GLM-5.3 深度解读:当 Post-Training 成为唯一的答案
GLM-5.3 深度解读:当 Post-Training 成为唯一的答案

GLM-5.3 深度解读:当 Post-Training 成为唯一的答案

2026年8月14日,智谱通过 Z.ai 正式发布了 GLM-5.3。👉 https://z.ai/subscribe?ic=Y2H91IWSU3

Performance across comparison models

BenchmarkGLM-5.3GLM-5.2Kimi K3DeepSeek-V4Pro-0813Qwen3.8-MaxOpus 4.8Fable 5(w/ fallback)GPT-5.6 Sol
Coding
Terminal Bench 2.188.281.088.387.986.685.088.088.8
Terminal Bench 3.028.34.617.421.133.734.6
DeepSWEv1.166.946.267.562.756.658.069.772.7
NL2Repo58.048.958.061.155.969.7
ProgramBenchAlmost Solved19.09.517.510.515.533.023.0
FrontierSWE78.167.566.588.2
SWE-Marathonv1.142.519.448.148.833.142.5
PostTrainBench39.831.732.032.941.836.2
Cyber
CyberGym84.577.280.083.378.578.183.883.6
ExploitGym2h / 6h105 / 13029 / 3936 / 7014 / 2680 / 120181 / 247216 / 293
ExploitBench54.424.432.228.840.078.076.5
Agentic
Toolathlon Verified73.059.976.574.172.576.274.774.9
AutomationBenchv1.0.648.226.246.743.239.841.046.245.8
Agents’ Last ExamALE-CLI28.523.827.625.727.025.723.828.6
HLE w/ Tools62.554.759.860.056.257.963.964.5
GDPval-AA v217691508168215901739158817431730

这不是一次常规的版本迭代。官方博客的第一句话就定下了基调:

“Scaling post-training is all we did for GLM-5.3.”

翻译过来就是:我们什么都没改,只是把 post-training 的规模拉满了。

而结果令人震惊——同一个 base model,编程能力在关键基准上提升了 6 倍,网络安全能力出现了意料之外的涌现,甚至在某些长程任务上追平或超越了闭源巨头。

一、最反直觉的发现:底座不变,能力跃迁

GLM-5.3 与 GLM-5.2 共享完全相同的基础模型。所有的提升,100% 来自 post-training 阶段的规模化。

这意味着什么?

在 LLM 领域,我们习惯了”大力出奇迹”的叙事:更大的模型、更多的参数、更长的预训练。但 GLM-5.3 给出了一个截然不同的信号——当 base model 的质量达到一定阈值后,post-training 的规模化可能带来比预训练更高的边际收益

智谱在过去一个月里做的,是在他们已经搭建好的技术栈上持续加码:

  • IndexShare:高效长上下文处理
  • SAO(Self-Adaptive Optimization)with compaction:针对长程任务的强化学习
  • slime:大规模异步训练框架
  • 以及最关键的——海量真实工作流环境的积累与合成

二、编程能力:从”能做”到”能独立完成”

如果说 GLM-5.2 是一个”能写代码的助手”,那么 GLM-5.3 正在向”能独立完成工程任务的 Agent”进化。

数据不会说谎

表格

基准测试GLM-5.3GLM-5.2提升幅度
Terminal Bench 3.028.34.66.1x
DeepSWE v1.166.946.21.4x
Agents’ Last Exam28.523.81.2x
AutomationBench48.226.21.8x

Terminal Bench 3.0 的 6 倍跃升是最引人注目的。这个基准测试的是模型在真实终端环境中的复杂操作能力——不是写个函数那么简单,而是在一个完整的开发环境中理解上下文、执行命令、调试错误、完成多步骤任务。

从 4.6 到 28.3,意味着 GLM-5.3 从”几乎不会做”跨入了”能稳定完成”的区间。

Z.ai Code Bench:更真实的检验

智谱还公开了他们内部的 Z.ai Code Bench 数据——GLM-5.3 相比 5.2 提升了 50%

这个基准的特殊之处在于,它不是为了刷榜设计的。它模拟的是真实用户场景:复杂的本地开发环境、多样化的任务类别、需要端到端完成的工程工作。有些任务对经验丰富的工程师来说也需要数天时间。

更重要的是,Z.ai Code Bench 是私有基准,这避免了模型在公开测试集上过拟合的问题,更能反映真实用户体验。

三、涌现的网络安全能力:意料之外的副产品

如果说编程能力的提升是预期之中,那么网络安全能力的涌现则完全出乎意料。

智谱在博客中坦承:

“As we scaled post-training, cyber capability developed faster than we expected.”

漏洞发现:CyberGym SOTA

在 CyberGym 漏洞发现基准上,GLM-5.3 达到了 84.5,超越了包括 GPT-5.6 Sol(83.6)、Fable 5(83.8)在内的所有对比模型,拿下 SOTA。

漏洞利用:翻倍以上的跃升

更惊人的是在漏洞利用链(exploitation chain)上的表现:

表格

测试GLM-5.3GLM-5.2提升
ExploitGym (2h)105293.6x
ExploitGym (6h)130393.3x
ExploitBench54.424.42.2x

智谱特别指出,越往利用链的上游走,GLM-5.3 的优势越大。这意味着模型不仅能发现漏洞,还能自主构造完整的攻击链——这在两个月前还是不可想象的。

这个发现的意义远超一个基准测试的分数。它暗示了一个可能性:当 post-training 的环境足够丰富、任务足够真实时,模型可能会自发涌现出设计者未曾预料的能力

四、他们是怎么做到的?环境即一切

GLM-5.3 的技术路线可以总结为一句话:把 post-training 的环境做得足够像真实工作,然后规模化

从手工环境到自动合成

早期的 RLHF/RL 环境往往是手工设计的,数量有限、任务简单。但智谱意识到,当 Agent 能力提升后,瓶颈从模型转移到了环境。

一个有效的训练环境必须满足三个条件:

  1. 可执行——能在真实环境中运行
  2. 可验证——有明确的正确性判断标准
  3. 接近真实工作——不是玩具问题,而是工程师日常面对的任务

为了规模化这个过程,智谱搭建了一套端到端的环境合成 pipeline:

  • 研究 Agent 从真实工作中收集任务模式
  • 将其转化为可运行的长程环境,包含多步依赖和隐藏状态
  • 评判 Agent 尝试每个任务,验证其确实可解
  • 验证器 在没有参考答案的情况下合成,通过 oracle、no-op 和未解决状态检查
  • 发现奖励捷径并关闭,确保奖励信号的可靠性

SAO with Compaction:长程任务的秘诀

GLM-5.3 继承了 GLM-5.2 的 SAO(Self-Adaptive Optimization)策略,并加入了 compaction 机制。

这个设计的核心思想是:在长程任务中,模型需要处理的信息量巨大,如果不做压缩,上下文窗口很快会被填满。Compaction 机制让模型能够主动压缩和整理中间状态,把注意力集中在真正影响任务进展的信息上。

效果在数据上清晰可见——GLM-5.3 的提升不仅体现在短任务上,在长程任务上同样显著。这说明模型学会了”如何学习”,而不是简单地记忆了更多模式。

五、开源与定价:两周后见

智谱承诺,GLM-5.3 的权重将在发布两周后开源,待安全评估和加固完成后放出。

这延续了智谱一贯的开源策略。在闭源模型越来越强、开源社区略显疲软的当下,GLM-5.3 的出现无疑是一剂强心针——它证明了开源模型在顶级能力上仍然可以竞争,甚至在某些领域领先。

定价与生态

目前 Z.ai 的 GLM Coding Plan 定价为 $18/月 起,支持 Claude Code、Cline 等 20+ 顶级编程工具。

如果你正在考虑订阅,可以通过我的专属链接注册,享受 9 折优惠

👉 https://z.ai/subscribe?ic=Y2H91IWSU3

六、写在最后:Post-Training 的新范式

GLM-5.3 最重要的启示,不是某个具体的分数,而是它验证了一个假设:

当 base model 足够好后,post-training 的规模化可以独立驱动能力的质变。

这改变了我们对 LLM 发展的认知。过去我们认为,提升模型能力主要靠三件事:更大的模型、更多的数据、更长的预训练。但 GLM-5.3 告诉我们,第四件事可能同样重要——更好的环境、更真实的任务、更智能的训练策略

在某种意义上,GLM-5.3 不是在训练一个更好的语言模型,而是在训练一个更好的”数字员工”——一个能在真实工作环境中理解上下文、分解任务、执行操作、验证结果的智能体。

两周后权重开源,我很期待看到社区会用它做出什么。


了解 码奋 的更多信息

订阅后即可通过电子邮件收到最新文章。

0 0 投票数
文章评分
订阅评论
提醒

0 评论
0
希望看到您的想法,请您发表评论x