智谱GLM-5.3正式发布!同基座仅靠后训练拉满编程能力,网络安全漏洞挖掘能力实现突破性涌现-AITOP100,AI资讯
做开发、网络安全运维的从业者,近几年应该都有一个共同感受:市面上开源大模型要么代码能力拉胯,要么完全不具备漏洞分析能力,想要兼顾两者,只能付费使用闭源模型。说实话,能同时把工程编码和网络攻防两大场景做到开源SOTA的模型少之又少,而智谱刚刚推出的 GLM-5.3 刚好补上了这块空白。
AITOP100平台获得,2026年8月14日智谱AI已在海外社交平台X官方账号官宣GLM-5.3正式上线

这次值得注意的是:模型基座没有更换,依然是743B,全部性能提升仅依靠大规模后训练优化完成,不仅编程基准大幅刷新开源纪录,还意外催生了成熟的端到端网络漏洞利用推理能力,对于开发者、安全工程师来说实用性直接拉满。
一、GLM-5.3核心升级逻辑:不靠更大参数,靠规模化长周期后训练
很多人会下意识觉得,模型变强一定是更换了更大参数量底座,不过GLM-5.3完全跳出这个思路。它沿用前代GLM-5.2完全一致的743B基础模型,所有性能飞跃,全部来自后训练阶段的规模化迭代。
智谱团队基于之前搭建完整技术栈持续扩容,核心包含三大底层支撑工具:
- IndexShare:负责百万级超长上下文高效处理,保证大型代码库读取不丢失信息;
- SAO单样本异步强化学习:专门适配多步骤长时序任务的RL训练方案,解决传统同步训练算力空转浪费问题;
- slime开源异步后训练框架:统一承载训练、推理、数据缓存全链路,不用每次迭代重构整套训练管线。
简单说,研发团队在原有框架基础上扩充了海量贴近真实职场的任务环境,覆盖完整软件开发、漏洞挖掘、企业自动化运维场景,投入更多算力完成深度RL微调,最终让同一基座模型的综合智能体能力实现质的跨越。整套训练流程还加入了环境自动生成、任务可行性校验流水线,减少大量人工搭建任务的成本,也是这次升级能快速落地的关键。
二、编程能力全面登顶开源,真实工程场景效率远超前代
1. 多权威基准测试数据全面领跑
GLM-5.3被官方定义为专为编程而生的开源权重模型,各项代码类基准对比GLM-5.2提升幅度肉眼可见:
- 自研内部基准 Code Bench:整体编码准确率提升50%;在高难度开发场景下,输出token更少、任务完成精度更高,高难度档位仅需50K输出token,就能超越Claude Opus 4.8的表现;
- Terminal Bench 3.0:得分从前代4.6暴涨至28.3,大幅甩开其余开源模型;
- DeepSWE v1.1代码修复基准:46.2提升至66.9;
- Agents' Last Exam长时序CLI任务:23.8提升至28.5;
- 自动化开发基准AutomationBench、工具长推理HLE w/ Tools、复杂工业评估GDPval-AA v2 全部刷新开源最优成绩。
模型对比如下:

GLM-5.3 将代理式编码提升到新高度,相比 GLM-5.2 实现了显著改进,同时使用更少的输出令牌取得了更好的结果
详情图如下:

2. 彻底告别“玩具式编码”,适配企业级完整开发流程
市面上多数代码模型只能处理几十行简短脚本,可GLM-5.3训练环境完全对标资深工程师真实工作场景,部分任务等同于程序员数天工作量。举个典型ML基础设施优化任务例子:
模型可完整接入计算集群、存储系统、内部文档、全量代码仓库与实验数据,自主定位训练链路性能瓶颈、编写优化代码、批量运行对照实验,在保证程序逻辑无bug的前提下输出可量化提速方案,全程不需要用户拆分复杂步骤、逐环节监督执行。
而且官方专门搭建了 Z.ai Code Bench私有评测体系,规避公开测试集数据泄露导致的跑分虚高问题,从端到端任务完成率、细节校验准确率两个维度评估AI编码代理,数据更贴合普通人日常开发真实体验。
三、惊喜涌现网络安全能力,漏洞挖掘、链路推理实现双重突破
本次研发团队原本只是在训练素材中加入少量漏洞挖掘数据集,预期仅小幅提升漏洞识别能力,不过随着训练规模持续扩大,模型诞生了超出预期的完整网络攻防推理能力,这也是GLM-5.3区别于所有开源竞品的独特优势。
1. 三大安全基准全面验证实力
智谱采用CyberGym、ExploitBench、ExploitGym三套分层评测体系,覆盖漏洞识别、漏洞原理推演、完整利用链搭建全流程:
| 评测基准 | 测试内容 | GLM-5.3表现 |
|---|---|---|
| CyberGym | 白盒源码漏洞检测 | 得分84.5%,超越Mythos 5、GPT-5.6 Sol,同赛道全球第一 |
| ExploitBench | 深层漏洞利用逻辑推理 | 得分54.4%,性能是GLM-5.2(24.4%)两倍以上 |
| ExploitGym | 限时完整渗透任务 | 2小时完成105项、6小时完成130项(前代仅29/39项),长时序多步骤攻击规划能力提升幅度最大 |
2. 落地实战:真实开源项目检出2436个历史漏洞
不止基准跑分亮眼,GLM-5.3已经联合国内多家安全厂商落地真实代码审计,对269个开源项目完成扫描,累计检出2436处漏洞:
- 中高危漏洞合计 1097个;
- 漏洞最早可追溯至1981年,平均潜伏时长 26.6年;
- 覆盖操作系统内核、浏览器引擎、Web应用、网络协议、开源基础设施多类场景。
所有漏洞都会录入 Z.ai安全披露台账,区分已公开CVE与保密待修复漏洞,持续对外更新披露进度,为开源社区代码安全治理提供落地支撑。

四、GLM-5.3两种使用渠道:线上订阅即时可用,完整权重两周后开源
1. 线上即刻体验:GLM Coding Plan订阅体系 + ZCode客户端
模型发布当天已全量接入两大官方产品,个人开发者、团队可直接调用,无需等待开源权重:
(1)GLM Coding Plan分层订阅套餐
分为个人三档套餐与企业团队席位,采用积分配额计费,非高峰时段(周一至周五18点后、周末)调用仅消耗50%积分,大幅降低高频使用成本:
- Lite轻量版:每月12.6美元,每周10000积分,适配个人小型项目迭代,兼容20+主流AI编码工具;
- Pro专业版(热门):每月56美元,6倍Lite积分额度,解锁全套MCP工具、优先算力调度;
- Max高阶版:每月117.6美元,14倍积分,高峰期专属资源保障,适配大型代码仓库长期开发;
企业还提供Standard、Premium团队席位,支持统一权限管理、团队用量看板、集中开票。
(2)ZCode桌面客户端专属优化
ZCode深度适配GLM-5.3推理逻辑,配套多项独家功能:
- Goal长周期任务:输入开发目标后AI自动拆解、编码、自测、迭代,直至需求落地;
- 远程操控:微信、飞书移动端可监控、调度本地大型代码任务;
- 超高缓存命中率98%+:重复上下文大幅节省积分消耗;
🎉 限时活动:至8月31日,套餐额度额外提升1.5倍,叠加缓存优惠最高可获得180%基础可用额度。
2. 开源权重上线规划
官方明确:完整模型权重将在发布两周后开放,上线前会完成全套安全评估与模型加固流程,平衡漏洞挖掘实用能力与恶意攻击风险管控,保证开源后的合规性与安全性。
- 技术博客:
- GLM Coding Plan: https://z.ai/subscribe
- ZCode: https://zcode.z.ai/en
五、API关键调整,迁移升级必看细节
GLM-5.3对推理思考参数做了强制调整,原有业务接入需要修改配置,否则接口请求直接报错:
- 彻底移除
thinking.type: disabled关闭思考模式配置,思考功能强制开启; - 新增三档推理强度可选:
low轻量推理、high增强推理、max深度推理(编程、安全任务推荐max档位);
标准调用示例:
{
"model": "glm-5.3",
"thinking": { "type": "enabled" },
"reasoning_effort": "max"
}
原有关闭思考逻辑的业务,需要将配置切换为 enabled 并搭配 low 档位,再替换模型ID完成迁移。
六、底层训练框架slime,支撑本次大规模性能迭代
整套GLM-5.3后训练依托自研开源slime框架搭建,也是本次同基座大幅提效的核心工程底座,两大优化点值得关注:
- 算法层面:新增top-p掩码、全词表OPD采样方案,对齐训练与推理数值精度,logprob误差控制在1e-7级别,相比旧方案误差降低99.99%;
- 资源调度优化:引入分层本地缓存存储模型参数,动态切换多教师模型训练,长时序编码RL任务整体训练吞吐量提升2.3倍,能用更少算力完成更大规模环境训练,为持续迭代留出空间。
AITOP100-AI资讯频道将持续关注AI行业新闻资讯消息,带来最新AI内容讯息。
想了解AITOP100平台其它版块的内容,请点击下方超链接查看
AI创作大赛 | AI活动 | AI工具集 | AI资讯专区 | AI小说
AITOP100平台官方交流社群二维码:


