GLM-5.3 发布:后训练规模化带来的前沿编码与涌现安全能力

发布于 · 4,248 字 · 约 11 分钟#智谱#Models原文链接
GLM-5.3 发布:后训练规模化带来的前沿编码与涌现安全能力 封面图
  • 规模化后训练使 GLM-5.3 编码能力比 GLM-5.2 提升 50%,在多个基准上取得开源 SOTA
  • 安全能力涌现,漏洞挖掘 CyberGym 达 SOTA,漏洞利用成绩超 GLM-5.2 两倍
  • 基于 slime 框架实现高效长程 RL 训练,端到端吞吐提升 2.3 倍
  • 权重将在发布两周后开源,支持 API 和本地部署,并提供新版 Coding Plan

对 GLM-5.3,我们做的事情只有一件:规模化后训练。 在 GLM-5.2 中我们搭好了技术栈:用于高效长上下文处理的 IndexShare、面向长程任务 RL 的 SAO,以及用于大规模异步训练的 slime,它们都运行在我们持续积累的长程任务环境上。过去一个月,我们在这个栈上继续扩规模:更多环境、更多样的任务,以及投在它们上面的更多算力。

今天我们发布 GLM-5.3。它与 GLM-5.2 使用同一个基座模型,所有提升都来自后训练。与 GLM-5.2 相比,它在复杂编码和长程任务上的表现显著更强:

  • 更强的编码能力:GLM-5.3 是目前编码能力最强的开放权重模型,在我们内部的 Z.ai Code Bench 上较 GLM-5.2 提升 50%,并在 Terminal Bench 3.0、Agents' Last Exam 等公开基准上取得开源 SOTA。
  • 涌现的网络安全能力:随着后训练规模扩大,安全能力的发展超出了我们的预期。GLM-5.3 在漏洞挖掘基准 CyberGym 上达到 SOTA,且越靠近利用链(exploitation chain)后段提升越大,在漏洞利用类基准上成绩超过 GLM-5.2 的两倍。
  • 开源:安全评估与加固完成后,我们将在发布两周后开放权重。
各模型性能对比
各模型性能对比
基准GLM-5.3GLM-5.2Kimi K3DeepSeek-V4 Pro-0813Qwen3.8-MaxOpus 4.8Fable 5 (w/ fallback)GPT-5.6 Sol
编码
Terminal Bench 2.188.281.088.387.986.685.088.088.8
Terminal Bench 3.028.34.617.4--21.133.734.6
DeepSWE v1.166.946.267.562.756.658.069.772.7
NL2Repo58.048.958.061.155.969.7--
ProgramBench Almost Solved19.09.517.5-10.515.533.023.0
FrontierSWE78.167.5---66.588.2-
SWE-Marathon v1.142.519.448.1--48.833.142.5
PostTrainBench39.831.732.0--32.941.836.2
安全
CyberGym84.577.280.083.378.578.183.883.6
ExploitGym 2h / 6h105 / 13029 / 3936 / 70-14 / 2680 / 120181 / 247216 / 293
ExploitBench54.424.432.2-28.840.078.076.5
智能体
Toolathlon Verified73.059.976.574.172.576.274.774.9
AutomationBench v1.0.648.226.246.743.239.841.046.245.8
Agents' Last Exam ALE-CLI28.523.827.625.727.025.723.828.6
HLE w/ Tools62.554.759.860.056.257.963.964.5
GDPval-AA v217691508168215901739158817431730

更强的编码能力

在 GLM-5.3 上,我们把环境规模化的方向推向了那些不太像编程练习、而更像真实专家工作单元的任务。现在的环境覆盖了更广的生产工作流,任务按照工程和研究工作的实际开展方式设计,其中一些相当于有经验工程师数天的工作量。以一个机器学习基础设施任务为例,模型会拿到与工程师相同的工作环境,可以访问计算集群、存储系统、内部文档、代码库和实验结果,需要诊断训练栈各环节的瓶颈、实施优化、跑实验,并在保证正确性的前提下交付可度量的端到端加速。在这种水平的环境上训练,推动模型学会端到端地承担完整的大型工作,而不是依赖用户拆解问题并逐步监督。

随着智能体能力提升,后训练规模化的难点很大程度上从模型转移到了环境。一个有用的任务环境必须可执行、可验证,并贴近真实的专业工作,而且我们需要大量这样的环境,而不是少数手工搭建的。为了规模化这一过程,我们构建了端到端合成环境的流水线,对其中一部分任务还合成了 RL 奖励信号。研究智能体从真实工作中收集任务模式,将其转化为带有多步依赖和隐藏状态的可运行长程环境;随后一个裁判智能体会亲自尝试每个任务,验证它确实可解。验证器在合成时不接触参考解,而求解轨迹则用来发现并封堵奖励捷径。通过 oracle、no-op 和未解状态检查的验证器,能产出足够可靠、可直接用于训练的二值奖励。

GLM-5.3 沿用了 GLM-5.2 引入的 RL 策略,包括带压缩的 SAO,这有助于让这些提升在长程任务上保持,而不只体现在短任务上。这一效果在编码和通用智能体任务上都有体现:Terminal-Bench 3.0 从 4.6 提升到 28.3,DeepSWE v1.1 从 46.2 提升到 66.9,Agents' Last Exam 从 23.8 提升到 28.5。这些流水线目前仍需要相当数量的人工参与,让环境生成与验证更加自主是接下来的方向之一。

在公开基准之外,我们还推出了 Z.ai Code Bench,一个内部基准,用于在真实用户场景下评估编码智能体。它覆盖多样的任务类别,并将智能体置于复杂的本地开发环境中。在不同努力等级下,我们从两个维度评估智能体:端到端任务完成率和细粒度检查清单准确率。作为非公开基准,Z.ai Code Bench 也降低了公开测试集污染的风险,能更真实地衡量真实用户体验。

Z.ai Code Bench 上的表现与 token 效率
Z.ai Code Bench 上的表现与 token 效率

如图所示,GLM-5.3 在性能和 token 效率上都有提升。在每个努力等级上,它都以更少的输出 token 取得了明显强于 GLM-5.2 的智能体编码成绩。在 Max 努力等级下,GLM-5.3 每任务消耗约 75K 输出 token 达到 34.5%,而 GLM-5.2 需 96K token 达到 23.4%。面对闭源模型同样如此:在 High 努力等级下,GLM-5.3 以约 50K 输出 token 达到 31.4%,超过需要 120K token 达到 29.5% 的 Claude Opus 4.8。GLM-5.3 仍落后于在 Max 努力等级下达到 39.5% 的 Claude Fable 5。

涌现的网络安全能力

作为后训练的一部分,我们在训练混合数据中加入了漏洞挖掘数据和环境。我们预期这会让模型更擅长发现漏洞和推理漏洞,但出乎意料的是,随着训练规模扩大,这项能力持续发展的速度。GLM-5.3 不只是更擅长识别孤立的缺陷:它开始跨利用的多个阶段进行推理,为完整的利用链形成连贯的计划。

网络安全能力评估
网络安全能力评估

我们在覆盖漏洞分析与利用不同阶段的三个基准上评估 GLM-5.3。CyberGym 从白盒源代码出发,测试模型能否通过触发故障来识别并验证漏洞,GLM-5.3 得分 84.5%,高于 GLM-5.2 的 77.2%,是该基准上的最好成绩,领先于 Mythos 5(83.8%)和 GPT-5.6 Sol(83.6%)。ExploitBench 要求对真实漏洞及其利用进行更深入的推理,GLM-5.3 达到 54.4%,是 GLM-5.2(24.4%)的两倍多,而 Mythos 5 和 GPT-5.6 Sol 分别为 78.0% 和 76.5%。ExploitGym 度量模型在时间归一化预算下能完成多少利用任务,GLM-5.3 在两小时内完成 105 个任务、六小时内完成 130 个,GLM-5.2 则分别是 29 和 39;预算使用各模型吞吐数据做了归一化,细节见脚注。Mythos 5 仍以 181 和 247 个任务明显领先。三个基准的模式一致:基准越靠近利用链后段,相对 GLM-5.2 的提升越大,与闭源前沿的差距也越大。能力增长最快的,恰恰是我们落后最远的地方。

随后我们测试了这些能力能否迁移到受控基准之外。自 GLM-5.2 起,我们与国内多个安全团队合作,用真实代码库检验我们的模型。经过专家评审、筛查和去重后,模型在 269 个项目中识别出 2436 个漏洞,其中包括 1097 个中高危问题。这些发现涵盖系统内核、操作系统、浏览器引擎、开源基础设施、Web 应用和网络协议,其中很多已多年甚至数十年无人察觉,最古老的可以追溯到约 40 年前。

这项工作后来发展成一项持续的漏洞披露行动。我们建立了 Z.ai Security Disclosure Ledger,在发现走披露流程的同时维护公开记录。账本随着新漏洞的评审和披露持续更新,区分已公开和仍在披露中的问题。对已披露的问题,它记录的信息包括受影响项目、严重程度、CVE 编号(如有),以及该漏洞在代码库中存在了多久。

  • 追踪的发现总数:2436
  • 已公开披露:53
  • 披露 embargo 中:2383
  • 严重及高危:1097
  • 涉及开源项目:269

这些发现的时间跨度达 45 年:最古老的缺陷引入于 1981 年,平均而言一个漏洞在被发现前已存在 26.6 年。

严重程度分布:Critical 107 / High 990 / Medium 1286 / Low 53

查看 Z.ai Security Disclosure Ledger

slime:为长程 RL 扩缩而建

这一切都运行在 slime 上,它是我们开源的 RL 扩缩后训练框架,训练侧基于 Megatron,rollout 侧基于 SGLang。其设计将训练、rollout 和数据缓冲保持在单一数据流上,数学、代码、沙箱、验证器和长程智能体环境都以数据生成的形式接入,而无需改动训练循环。正是这一点让我们在 GLM-5.2 和 GLM-5.3 期间持续增加环境,而不用每次重建训练栈。

在 GLM-5.3 周期中,我们沿两条线继续建设。算法侧新增了面向 RL 研究的能力:top-p mask、top-k 和全词表 OPD,以及提升训练与 rollout 一致性的配置,包括 R3 式设置和训练、rollout 两条路径间的完整数值对齐。这让我们能更精细地控制采样、训练和教师信号,也能快速开展对照实验。在我们的训练- rollout 一致性评估中,log 概率(logprob)的平均差异被控制在 1e-7 量级,相比此前的设置降低了超过 99.99%。

我们还针对大规模 RL 的资源效率和系统吞吐做了工作。本地存储现在作为额外的缓存层,分层保存原本会驻留在主机内存中的模型状态和数据。这对多教师 OPD 尤为重要:配合训练侧的动态教师切换和预取,可以同时使用多个教师,而无需为每个教师单独搭建常驻推理服务,附加开销有限,资源消耗大幅降低。针对智能体和异步负载,我们改进了路由器与 slime 之间的联合调度和负载均衡,让长度和完成时间差异巨大的 rollout 请求更好地利用推理资源。我们加入了负载感知的启发式策略,根据每个 rollout 环境的特征推导面向吞吐的配置,包括 prefill/decode 资源比例、并发设置等吞吐关键参数。结果是,在长程编码 RL 任务上,这些系统级优化将端到端 RL 训练吞吐提升了 2.3 倍以上,让我们能以更高的效率在更长的轨迹和更复杂的环境上扩缩训练。

综合起来,这些改进带来了更多实验灵活性、更低的资源成本和更高的吞吐,这正是让持续扩缩 RL 变得可行的原因。

上手 GLM-5.3

GLM-5.3 的 API 变化

GLM-5.3 支持三档思考努力等级:low、high 和 max。GLM-5.3 不再支持关闭思考。

思考参数

参数取值默认值说明
thinking.typeenabledenabled启用思考。disabled 不再支持。
reasoning_effortlow, high, maxmaxlow:轻量;high:增强;max:深度。

编码任务推荐使用 max。

{
  "model": "glm-5.3",
  "thinking": { "type": "enabled" },
  "reasoning_effort": "max"
}

需要迁移:如果你的应用目前使用 thinking.type: "disabled",请先改为 enabled 并将 reasoning_effort 设为 low,再更新模型 ID 为 glm-5.3。否则请求会失败。

在 GLM Coding Plan 和 ZCode 中使用 GLM-5.3

在你常用的编码智能体中试用 GLM-5.3,包括 ZCode、Claude Code、OpenCode 等。参见 https://docs.z.ai/devpack/overview。

面向 GLM Coding Plan 订阅用户:GLM-5.3 已推送给所有 GLM Coding Plan 用户。新的 GLM Coding Plan 采用积分制配额,输入、缓存输入和输出 token 分别计费。非高峰时段的模型调用消耗标准积分的 50%。高峰时段为周一至周五 14:00–18:00(UTC+8),其余时段(含周末)享受非高峰 5 折费率。立即开始构建:https://z.ai/subscribe

用 ZCode 更好地发挥 GLM-5.3

  • 98% 以上的缓存命中率,重复上下文按更低的缓存费率计费,相当于多出约 30% 的有效 token;
  • 1.5 倍限时配额提升,与缓存节省叠加后,8 月 31 日前最高可达标准配额的 180%;
  • 长程任务掌控力:Goal 模式会规划、编码、测试并验证,直到达成目标;
  • Remote Control:通过微信或飞书在手机上监控和引导长时间运行的任务。

试用 ZCode:https://zcode.z.ai/

本地部署 GLM-5.3

GLM-5.3 的模型权重将在两周后公开发布。

脚注

  • HLE w/ tools:评估使用 temperature=1.0、top_p=0.95 的采样参数,最大生成长度 163,840 token。评估在最大上下文长度 300,000 token 下进行,并使用上下文管理策略。裁判模型为 GPT-5.6-luna (medium)。
  • NL2Repo:我们在 1M 上下文下以 temperature=1.0、top_p=1.0、max_new_tokens=64k 评估 NL2Repo。为防止作弊,我们使用基于规则和基于 LLM 的双重判断来阻止恶意行为(如未授权的 pip 或 curl 操作)。
  • DeepSWE:使用 mini-swe-agent harness 运行 DeepSWE,参数为 temperature=0.95、top_p=1.0、timeout=6h,上下文 400K。
  • Terminal-Bench 2.1:在 Claude Code 2.1.207 中评估,temperature=1.0、top_p=1、max_new_tokens=65536,超时 6 小时。
  • Terminal-Bench 3.0:使用 Claude Code 2.1.207 harness(reasoning effort=max、400K 上下文、128K 最大输出)评估 Terminal-Bench-3 任务,报告每任务三次 rollout 的 avg@3。每次 rollout 在由任务官方镜像构建的隔离容器中运行,上限 600 个智能体轮次和 10 小时超时。禁用 Tool Search,各智能体产出的工件由任务官方的独立验证器评分。
  • Agent's Last Exam (CLI):使用官方评估协议和 Claude Code harness(reasoning effort=max、1M 上下文、64K 最大输出)评估 ALE。105 个任务各自在隔离 Docker 容器中运行,使用 Task Card 声明的资源。默认超时 4 小时,任务特定限制优先(最长 8 小时)。禁用 Tool Search,结果由官方 ALE 评估器评分。
  • Toolathlon Verified:所有结果通过官方评估服务获取,报告 3 次独立运行的平均 pass@1。
  • AutomationBench:在 AutomationBench v1.0.6 上评估,包含 PR #13 引入的 null 类型处理问题修复。
  • GDPval-AA v2:模型由 Artificial Analysis 评估。
  • CyberGym:在 Claude Code 2.1.207 中评估 GLM-5.3(max reasoning effort、无网络工具,temperature=1.0、top_p=1.0、max_new_tokens=128000)。所有评估不限任务超时,结果为 1507 个任务上的单次运行 Pass@1。为模拟真实使用场景,我们将智能体置于任务容器内,移除所有 Git 相关信息,并应用域名白名单(仅允许 pypi.org、deb.debian.org 等基础工具安装所需的关键域名)以防作弊。
  • ExploitGym:在 Claude Code 2.1.207 中评估 GLM-5.3、Kimi-K3 和 Qwen3.8 Max(max reasoning effort、无网络工具,temperature=1.0、top_p=1.0、max_new_tokens=128000)。报告的结果是 869 个任务在两种超时预算(2 小时和 6 小时)下的单次运行 Pass@1,计算方式为按各模型每秒 token 数(TPS 数据来自 Artificial Analysis)折算的 API 推理时间,再加上非 API 开销。也就是说,GLM-5.3 的结果按 115 TPS 折算,Kimi K3 按 40 TPS,Qwen3.8 Max 按 47 TPS。我们同样应用域名白名单以防作弊。
  • ExploitBench:在 Claude Code 2.1.207 中评估 GLM-5.3(max reasoning effort、无网络工具,temperature=1.0、top_p=1.0、max_new_tokens=128000)。遵循官方评估设置,我们将智能体与环境的最大交互轮次限制为 300,并对 41 个任务在 3 次修订上取平均覆盖率得分。任务覆盖率由各修订达成能力的并集决定,平均分由各结果平均得出。我们同样应用域名白名单以防作弊。
  • FrontierSWE:评估由 Proximal 进行,1M 上下文长度、max 努力等级、128K 最大输出 token。Dominance 得分截至 2026/08/14。
  • PostTrainBench:使用 Claude Code 2.1.207 评估 GLM-5.3,max 努力等级、temperature=1.0、top_p=1.0、max_new_tokens=128000、1M token 上下文窗口。报告 3 次运行的加权平均。未能产出得分的运行回退到官方零样本基座模型基线得分。在防止使用第三方 API 的检查方面,我们移除了原先基于模式匹配的检查,因为它在本地 vLLM 端点通过 OpenAI SDK 访问时会产生误报,改为使用 LLM 智能体检查方案中是否使用了外部 API。
  • SWE-Marathon:使用 Claude Code 2.1.207 评估 GLM-5.3,max 努力等级、temperature=1.0、top_p=0.95、max_new_tokens=128000、1M token 上下文窗口。对于 strip-clone,原始防作弊检查的 import 检测范围过宽,可能误拒正确实现,我们移除了相关检查并改用基于 LLM 的检查以避免误报。对于 parameter-golf 和 trimul-cuda,NVIDIA wheel 的变更导致 Docker 镜像构建失败,因此我们添加了 --extra-index-url https://pypi.org/simple 以恢复构建。

评论互动

© 2026 王若风的技术博客 · Powered by Astro