2026年8月14日,智谱通过 Z.ai 正式发布了 GLM-5.3。👉 https://z.ai/subscribe?ic=Y2H91IWSU3
Performance across comparison models
| Benchmark | GLM-5.3 | GLM-5.2 | Kimi K3 | DeepSeek-V4Pro-0813 | Qwen3.8-Max | Opus 4.8 | Fable 5(w/ fallback) | GPT-5.6 Sol |
|---|---|---|---|---|---|---|---|---|
| Coding | ||||||||
| Terminal Bench 2.1 | 88.2 | 81.0 | 88.3 | 87.9 | 86.6 | 85.0 | 88.0 | 88.8 |
| Terminal Bench 3.0 | 28.3 | 4.6 | 17.4 | – | – | 21.1 | 33.7 | 34.6 |
| DeepSWEv1.1 | 66.9 | 46.2 | 67.5 | 62.7 | 56.6 | 58.0 | 69.7 | 72.7 |
| NL2Repo | 58.0 | 48.9 | 58.0 | 61.1 | 55.9 | 69.7 | – | – |
| ProgramBenchAlmost Solved | 19.0 | 9.5 | 17.5 | – | 10.5 | 15.5 | 33.0 | 23.0 |
| FrontierSWE | 78.1 | 67.5 | – | – | – | 66.5 | 88.2 | – |
| SWE-Marathonv1.1 | 42.5 | 19.4 | 48.1 | – | – | 48.8 | 33.1 | 42.5 |
| PostTrainBench | 39.8 | 31.7 | 32.0 | – | – | 32.9 | 41.8 | 36.2 |
| Cyber | ||||||||
| CyberGym | 84.5 | 77.2 | 80.0 | 83.3 | 78.5 | 78.1 | 83.8 | 83.6 |
| ExploitGym2h / 6h | 105 / 130 | 29 / 39 | 36 / 70 | – | 14 / 26 | 80 / 120 | 181 / 247 | 216 / 293 |
| ExploitBench | 54.4 | 24.4 | 32.2 | – | 28.8 | 40.0 | 78.0 | 76.5 |
| Agentic | ||||||||
| Toolathlon Verified | 73.0 | 59.9 | 76.5 | 74.1 | 72.5 | 76.2 | 74.7 | 74.9 |
| AutomationBenchv1.0.6 | 48.2 | 26.2 | 46.7 | 43.2 | 39.8 | 41.0 | 46.2 | 45.8 |
| Agents’ Last ExamALE-CLI | 28.5 | 23.8 | 27.6 | 25.7 | 27.0 | 25.7 | 23.8 | 28.6 |
| HLE w/ Tools | 62.5 | 54.7 | 59.8 | 60.0 | 56.2 | 57.9 | 63.9 | 64.5 |
| GDPval-AA v2 | 1769 | 1508 | 1682 | 1590 | 1739 | 1588 | 1743 | 1730 |

这不是一次常规的版本迭代。官方博客的第一句话就定下了基调:
“Scaling post-training is all we did for GLM-5.3.”
翻译过来就是:我们什么都没改,只是把 post-training 的规模拉满了。
而结果令人震惊——同一个 base model,编程能力在关键基准上提升了 6 倍,网络安全能力出现了意料之外的涌现,甚至在某些长程任务上追平或超越了闭源巨头。
一、最反直觉的发现:底座不变,能力跃迁
GLM-5.3 与 GLM-5.2 共享完全相同的基础模型。所有的提升,100% 来自 post-training 阶段的规模化。
这意味着什么?
在 LLM 领域,我们习惯了”大力出奇迹”的叙事:更大的模型、更多的参数、更长的预训练。但 GLM-5.3 给出了一个截然不同的信号——当 base model 的质量达到一定阈值后,post-training 的规模化可能带来比预训练更高的边际收益。
智谱在过去一个月里做的,是在他们已经搭建好的技术栈上持续加码:
- IndexShare:高效长上下文处理
- SAO(Self-Adaptive Optimization)with compaction:针对长程任务的强化学习
- slime:大规模异步训练框架
- 以及最关键的——海量真实工作流环境的积累与合成
二、编程能力:从”能做”到”能独立完成”
如果说 GLM-5.2 是一个”能写代码的助手”,那么 GLM-5.3 正在向”能独立完成工程任务的 Agent”进化。
数据不会说谎
表格
| 基准测试 | GLM-5.3 | GLM-5.2 | 提升幅度 |
|---|---|---|---|
| Terminal Bench 3.0 | 28.3 | 4.6 | 6.1x |
| DeepSWE v1.1 | 66.9 | 46.2 | 1.4x |
| Agents’ Last Exam | 28.5 | 23.8 | 1.2x |
| AutomationBench | 48.2 | 26.2 | 1.8x |
Terminal Bench 3.0 的 6 倍跃升是最引人注目的。这个基准测试的是模型在真实终端环境中的复杂操作能力——不是写个函数那么简单,而是在一个完整的开发环境中理解上下文、执行命令、调试错误、完成多步骤任务。
从 4.6 到 28.3,意味着 GLM-5.3 从”几乎不会做”跨入了”能稳定完成”的区间。
Z.ai Code Bench:更真实的检验
智谱还公开了他们内部的 Z.ai Code Bench 数据——GLM-5.3 相比 5.2 提升了 50%。
这个基准的特殊之处在于,它不是为了刷榜设计的。它模拟的是真实用户场景:复杂的本地开发环境、多样化的任务类别、需要端到端完成的工程工作。有些任务对经验丰富的工程师来说也需要数天时间。
更重要的是,Z.ai Code Bench 是私有基准,这避免了模型在公开测试集上过拟合的问题,更能反映真实用户体验。
三、涌现的网络安全能力:意料之外的副产品
如果说编程能力的提升是预期之中,那么网络安全能力的涌现则完全出乎意料。
智谱在博客中坦承:
“As we scaled post-training, cyber capability developed faster than we expected.”
漏洞发现:CyberGym SOTA
在 CyberGym 漏洞发现基准上,GLM-5.3 达到了 84.5,超越了包括 GPT-5.6 Sol(83.6)、Fable 5(83.8)在内的所有对比模型,拿下 SOTA。
漏洞利用:翻倍以上的跃升
更惊人的是在漏洞利用链(exploitation chain)上的表现:
表格
| 测试 | GLM-5.3 | GLM-5.2 | 提升 |
|---|---|---|---|
| ExploitGym (2h) | 105 | 29 | 3.6x |
| ExploitGym (6h) | 130 | 39 | 3.3x |
| ExploitBench | 54.4 | 24.4 | 2.2x |
智谱特别指出,越往利用链的上游走,GLM-5.3 的优势越大。这意味着模型不仅能发现漏洞,还能自主构造完整的攻击链——这在两个月前还是不可想象的。
这个发现的意义远超一个基准测试的分数。它暗示了一个可能性:当 post-training 的环境足够丰富、任务足够真实时,模型可能会自发涌现出设计者未曾预料的能力。
四、他们是怎么做到的?环境即一切
GLM-5.3 的技术路线可以总结为一句话:把 post-training 的环境做得足够像真实工作,然后规模化。
从手工环境到自动合成
早期的 RLHF/RL 环境往往是手工设计的,数量有限、任务简单。但智谱意识到,当 Agent 能力提升后,瓶颈从模型转移到了环境。
一个有效的训练环境必须满足三个条件:
- 可执行——能在真实环境中运行
- 可验证——有明确的正确性判断标准
- 接近真实工作——不是玩具问题,而是工程师日常面对的任务
为了规模化这个过程,智谱搭建了一套端到端的环境合成 pipeline:
- 研究 Agent 从真实工作中收集任务模式
- 将其转化为可运行的长程环境,包含多步依赖和隐藏状态
- 评判 Agent 尝试每个任务,验证其确实可解
- 验证器 在没有参考答案的情况下合成,通过 oracle、no-op 和未解决状态检查
- 发现奖励捷径并关闭,确保奖励信号的可靠性
SAO with Compaction:长程任务的秘诀
GLM-5.3 继承了 GLM-5.2 的 SAO(Self-Adaptive Optimization)策略,并加入了 compaction 机制。
这个设计的核心思想是:在长程任务中,模型需要处理的信息量巨大,如果不做压缩,上下文窗口很快会被填满。Compaction 机制让模型能够主动压缩和整理中间状态,把注意力集中在真正影响任务进展的信息上。
效果在数据上清晰可见——GLM-5.3 的提升不仅体现在短任务上,在长程任务上同样显著。这说明模型学会了”如何学习”,而不是简单地记忆了更多模式。
五、开源与定价:两周后见
智谱承诺,GLM-5.3 的权重将在发布两周后开源,待安全评估和加固完成后放出。
这延续了智谱一贯的开源策略。在闭源模型越来越强、开源社区略显疲软的当下,GLM-5.3 的出现无疑是一剂强心针——它证明了开源模型在顶级能力上仍然可以竞争,甚至在某些领域领先。
定价与生态
目前 Z.ai 的 GLM Coding Plan 定价为 $18/月 起,支持 Claude Code、Cline 等 20+ 顶级编程工具。
如果你正在考虑订阅,可以通过我的专属链接注册,享受 9 折优惠:
👉 https://z.ai/subscribe?ic=Y2H91IWSU3
六、写在最后:Post-Training 的新范式
GLM-5.3 最重要的启示,不是某个具体的分数,而是它验证了一个假设:
当 base model 足够好后,post-training 的规模化可以独立驱动能力的质变。
这改变了我们对 LLM 发展的认知。过去我们认为,提升模型能力主要靠三件事:更大的模型、更多的数据、更长的预训练。但 GLM-5.3 告诉我们,第四件事可能同样重要——更好的环境、更真实的任务、更智能的训练策略。
在某种意义上,GLM-5.3 不是在训练一个更好的语言模型,而是在训练一个更好的”数字员工”——一个能在真实工作环境中理解上下文、分解任务、执行操作、验证结果的智能体。
两周后权重开源,我很期待看到社区会用它做出什么。
了解 码奋 的更多信息
订阅后即可通过电子邮件收到最新文章。

