智谱AI发布GLM-5.3-Flash:性能比肩顶尖模型,成本降至1/40,国产芯片首次承载大规模流量-AITOP100,AI资讯

发布时间 :2026年8月26日
模型亮点 :GLM-5系列首个原生多模态模型,性能比肩Claude Opus 4.8,成本仅为其1/40,所有测试流量均由国产芯片集群承载。
工具地址:智谱AI官网
1️⃣ 模型概述:
GLM-5.3-Flash是智谱AI于2026年8月26日正式发布并开源的原生多模态大模型。
| 项目 | 参数/说明 |
|---|---|
| 总参数量 | 320B |
| 架构设计 | 创新的 MoE(混合专家)架构 |
| 推理激活参数 | 仅18B |
| 多模态支持 | 文本、图像、视频输入 |
| 上下文窗口 | 高达 100万 Token |
| 模型定位 | 旗舰效率型 —— 以极致成本提供前沿能力 |
💡 “大基座+小激活” 的设计使其在保持顶尖能力的同时,实现了极高的推理效率。
2️⃣ 核心特性与技术创新
🔹 2.1 原生多模态与视觉编码能力
GLM-5.3-Flash将视觉能力原生集成进模型,能够自主判断何时需要“观察”,并利用视觉反馈指导下一步行动。
在视觉编码领域表现尤为突出:
- 🎨 前端开发 :根据设计图直接生成前端代码,并在浏览器预览效果,实现“边写、边看、边改”的闭环工作流
- 🎮 3D建模与游戏开发 :支持从文本描述生成3D场景,可导出Blender、Unity格式。甚至有案例显示,其自主运行16小时,搭建了一套约400㎡的专业主厨自宅与测试厨房
- 📄 自我验证与优化 :能检查并优化自身输出的PPTX、PDF、DOCX等文档,具备更强的审美判断能力
🔹 2.2 混合注意力架构与效率革命
GLM-5.3-Flash是全球首个采用稀疏注意力与线性注意力混合架构的开源前沿模型,这是实现高效低成本的关键:
| 创新点 | 具体表现 |
|---|---|
| 动态切换注意力模式 | 关键信息使用稀疏注意力保证精度;非关键上下文使用线性注意力提升速度 |
| 极致压缩内存与计算 | 通过IndexPool技术将索引器缓存向量从4个压成1个 |
| 计算量与缓存优化 | 注意力计算量降低 3.01倍,KV缓存大小降低 4.44倍 |
| 长上下文成本优势 | 长上下文服务成本降至GLM-5.3的约 1/3 |
| 推理速度提升 | 处理10万字法律文档时,推理速度比GLM-5.3快 2.8倍 |
🔹 2.3 国产芯片全栈适配
GLM-5.3-Flash的发布标志着国产AI芯片在大模型应用领域的重要突破:
- 🇨🇳 首次大规模承载流量 :发布前以匿名模型"Ox-Alpha"在OpenCode和OpenRouter测试期间,所有请求流量均由国产芯片集群(昇腾910B、寒武纪思元590等)提供算力支持
- ⚙️ 软硬协同优化 :智谱在SGLang基础上构建专用推理引擎,通过“模型优化系统,系统承载模型”的正向循环(由GLM-5.3驱动的Infra Agent辅助开发),将端到端服务性能提升 3倍
- 📊 接近英伟达GPU效率 :在国产芯片集群上实现了接近NVIDIA GPU的推理效率,单Token成本已达到与主流英伟达GPU相当的水平
3️⃣ 性能表现:跻身全球第一梯队
GLM-5.3-Flash在多项权威基准测试中展现了顶尖能力:
| 评估维度 | 表现摘要 | 对比参考 |
|---|---|---|
| 综合智能 | AA智能指数得分 57 | 与Claude Opus 4.8持平,进入全球前沿模型区间 |
| 编程能力 | Z.ai Code Bench体感评估中表现与Claude Opus 4.8相当 | 超过GLM-5.2 |
| Agent与复杂任务 | Terminal Bench 2.1、Agents’ Last Exam、AutomationBench等基准表现优异 | 明显优于GLM-5.2,接近Claude Opus 4.8 |
| 匿名测试验证 | 以"Ox-Alpha"身份在OpenRouter,6天处理超20万亿Token | 创调用量新高,成为当周最受欢迎模型 |

在 代码基准测试中,该测试衡量真实世界的编码性能,GLM-5.3-Flash 在每个努力水平上明显优于 GLM-5.2,并且与 Claude Opus 4.8 表现相当。

架构增强与优化的预训练语料库相结合,使 GLM-5.3-Flash 能够在更少的计算资源下提供更高的智能水平。

4️⃣ 成本优势:性价比高
GLM-5.3-Flash的定价策略是其最具冲击力的亮点,旨在推动AI普惠:
| 定价维度 | GLM-5.3-Flash(限时折扣) | GLM-5.3 | Claude Opus 4.8 |
|---|---|---|---|
| 输入价格 ($/M Tokens) | 0.075 | 1.40 | ~3.00 |
| 输出价格 ($/M Tokens) | 0.25 | 4.40 | ~10.00 |
| 缓存命中输入 ($/M Tokens) | 0.015 | 0.26 | ~0.60 |
| 相对价格比 | 基准 (1x) | 18.7x | ~40x |
💡 限时折扣期间,GLM-5.3-Flash的价格约为GLM-5.3的 1/20,Claude Opus 4.8的 1/40。
开发者能以极低的成本获得此前只有顶尖闭源模型才能提供的能力,大幅降低了个人开发者、中小企业和学术研究机构使用世界级AI模型的门槛。
5️⃣ 国产算力:10 万张国产芯片首次大规模集体出海
GLM-5.3-Flash 最引人注目的特点之一,是其全部线上流量由超过 10 万张国产芯片承载 。这是国产算力芯片首次大规模直接服务全球真实负载 。
据智谱披露,这批芯片通过自研高带宽互联网络连接,采用生产级 Encode–Prefill–Decode(EPD)分离式架构,将多模态编码、Prompt 预填充和逐 Token 解码拆分为可独立调度的工作池。与同一硬件上的初始基线相比,端到端服务性能提升了 3 倍,硬件效率和单 Token 成本已达到与主流英伟达 GPU 相当的水平 。据《晚点 LatePost》了解,这批芯片的供应商或来自华为、摩尔线程与海光。
AITOP100-AI资讯频道将持续关注AI行业新闻资讯消息,带来最新AI内容讯息。
想了解AITOP100平台其它版块的内容,请点击下方超链接查看
AI创作大赛 | AI活动 | AI工具集 | AI资讯专区 | AI小说
AITOP100平台官方交流社群二维码:


