不卷万亿参数,智谱GLM-5.3侧重编程能力与网络安全
8月14日,智谱AI创始人唐杰预告的“史诗级plus”模型终于露面。
GLM-5.3没有更换基座,参数规模为7530亿,与上一代基本一致,能力跃升均来自后训练阶段:更长的训练时间、更丰富的任务环境、更大规模的强化学习。智谱将这套方法论称为“后训练Scaling”,并认为基座的智能上界还远未触及天花板。

从GLM-5.2发布至今的两个月,大模型行业几乎以“周更”节奏推进。Kimi K3在7月以2.8万亿参数规模引爆行业后,有网友在唐杰社交平台评论区提问:“千问、Kimi都史诗级进化了,GLM还有戏吗?”唐杰回复:“史诗级plus。”
据智谱官方技术报告,在衡量真实终端环境任务完成的Terminal-Bench 3.0中,GLM-5.3得分从GLM-5.2的4.6跃升至28.3;在考察长程软件工程能力的DeepSWE v1.1中,从46.2提升至66.9。智谱表示,在上述两项基准中GLM-5.3均位列开源模型第一。在覆盖44种职业知识工作的GDPval-AA v2中,GLM-5.3得分1769,超过GLM-5.2的1508和Kimi K3的1682。

在智谱自研的Z.ai Code Bench评测中,GLM-5.3在High档位达到31.4%的准确率,据智谱数据,这一结果超过Claude Opus 4.8最高档位的29.5%,且每任务平均输出约5万tokens,仅为Opus 4.8的不到一半。不过,在同一评测的Max档位下,GLM-5.3(34.5%)仍低于Claude Fable 5(39.5%)。
网络安全能力是GLM-5.3另一大亮点。此前OpenAI与Anthropic相继暴露出前沿模型在安全治理方面的挑战,当模型能力持续提升,安全能力的规模化普及不再是可选项,而是模型能否被信任和广泛使用的必要条件。
据智谱官方数据,在国际漏洞推理评测CyberGym中,GLM-5.3以84.5%的成绩超过Anthropic的Mythos 5(83.8%)和GPT-5.6 Sol(83.6%)。在更考验深度推理、要求理解真实漏洞成因并完成利用验证的ExploitBench测试中,GLM-5.3取得54.4%的成绩,是上一代模型(24.4%)的两倍多,正在快速逼近国际最前沿水平。

自GLM-5.2以来,智谱联合清华大学、奇安信、腾讯玄武等十余家安全团队,对真实代码库进行红队测试,累计在269个项目中识别出2436个漏洞(经过初筛、去重),其中1097个为中高危。这些漏洞覆盖系统内核、操作系统、浏览器引擎、互联网协议等广泛领域,部分威胁甚至可以让Android、Windows、macOS及国民级通信软件出现大范围崩溃。目前,相关漏洞已陆续提交CNNVD、CNVD等国家漏洞库,进入负责任披露与协同修复流程。
GLM-5.3的发布,恰逢全球大模型定价策略发生剧烈转向。8月4日,OpenAI宣布将GPT-5.6 Luna的API价格下调约80%,每百万token(词元)输入价格由1美元降至0.2美元。谷歌随后推出Gemini 3.7 Flash,限时五折促销。Anthropic则发布Claude Opus 5,定价仅为Fable 5的一半。海外巨头集体降价,核心动因正是应对Kimi K3、DeepSeek V4等国产模型带来的冲击。
与此同时,国产大模型正在告别“白菜价”。DeepSeek于8月13日宣布调价,V4-Pro高峰时段每百万token输出价格自6元涨至27元。Kimi K3每百万token输出定价100元,较上一代上涨2至3倍。智谱GLM系列也经历了多次提价。据机构统计,中国大模型平均API输出价格已从2025年一季度的约12.2元/百万token升至2026年二季度的21.9元/百万token。
此次智谱暂未披露GLM-5.3具体价格是否有变动。海外降价、国产涨价趋势背后,是国产模型从以性价比换市场走向价值变现的战略转型。而GLM-5.3正好卡在这个关键节点上:据行业分析,若沿用GLM-5.2的API定价,GLM-5.3每百万token输入8元、输出28元,与DeepSeek V4-Pro高峰时段的9元和27元基本打平。
此次GLM-5.3给出了一条不同于参数竞赛的路径,不追万亿参数,用更极致的后训练工程把现有底座的能力推到新高度。这条路能否持续奏效,取决于三个变量:后训练Scaling的红利还能挖掘多久,开源之后的安全管控能否经得住考验,以及在海外降价、国产涨价的双重变局中,GLM-5.3能否以编程开源与安全能力,在开发者生态中建立起不可替代性。
