Glean 拾遗
最近收录

1 条 · 按时间

08-14

GLM-5.3:只靠后训练扩展,代码与网络攻防能力同步提升

Z.ai 发布 GLM-5.3,强调与 GLM-5.2 共用同一个 base model,所有提升都来自 post-training 扩展:持续扩大长程任务环境,并用流水线合成可执行、可验证的环境与 reward,训练栈沿用 IndexShare、SAO 和 slime。代码与 agent 能力在公开榜单上普遍上升,例如 Terminal-Bench 3.0 从 4.6 涨到 28.3,DeepSWE v1.1 从 46.2 升到 66.9。文章最值得注意的是“涌现式网络攻防能力”:ExploitBench 从 24.4 翻倍到 54.4;真实代码库评估中,在 269 个项目里发现 2436 个漏洞,最老的可追溯到 1981 年,Z.ai 为此建立了公开披露台账。工程侧,slime 通过本地缓存、训练-rollout logprob 对齐(1e-7)和负载感知调度,把长程 coding RL 的端到端吞吐提升 2.3×。API 上 thinking 不能再关闭,迁移需改用 reasoning_effort;权重将在安全加固完成两周后开源。适合关注 RL 后训练、agent 评测和 AI 安全披露的工程师阅读,注意所有跑分均为厂商自报。

z.ai · 22 min · Agent Engineering · AI Engineering · AI Security