💬 观点Latent Space
[AINews] Death of Params: Z.ai CEO Jie Tang on GLM 5.3 — GLM 5.3 揭示后训练新缩放定律:参数不再是唯一关键,环境合成与长程 RL
GLM 5.3 揭示后训练新缩放定律:参数不再是唯一关键,环境合成与长程 RL 才是新战场。
2026-08-20原文
本文为要点摘要,完整细节以原文为准。
🧭 一图看懂
由原文自动提炼 · 以原文为准点击任一分支,查看这一点的一句话解读
GLM 5.3 与后训练新缩放定律
Jie Tang 称参数量须与数据、算力、运行条件一起看
- Chinchilla 假设在推理时代失效
- 记忆偏好参数,推理偏好后训练数据与有效深度
⚙️ 流程拆解
STEP 1收集真实任务模式
STEP 2合成可运行长程环境
STEP 3judge 验证任务可解
STEP 4合成 verifier 与奖励
STEP 5长程 RL 训练模型
🔗 涉及的概念与玩家
- Z.ai公司
- Jie Tang人物
- GLM 5.3模型
- Ornith-1.5模型
- Chinchilla概念
- MoE方法
- RL方法
- Unsloth公司
- Jie Tang—任 CEO→Z.ai
- Jie Tang—解读→GLM 5.3
- GLM 5.3—依赖→RL
- GLM 5.3—采用→MoE
- Chinchilla—被超越→GLM 5.3
- Unsloth—量化→Ornith-1.5
- GLM 5.3 的进步主要来自长时程环境的强化学习,任务模拟真实工程工作,如诊断训练栈瓶颈并优化,模型需端到端负责,而非依赖用户分解步骤。
- 环境合成成为扩展瓶颈:为规模化后训练,zAI 构建全合成环境生成管线,研究代理从真实工作提取任务模式,验证器确保可解性,合成奖励信号可靠,推动模型能力提升。
- 参数规模不再是唯一杠杆:智谱提出 5 个缩放旋钮,包括 MoE 稀疏性等,高级技能如漏洞挖掘需 20+ 步推理链,依赖有效深度而非总参数,对开发者意味着应关注训练数据与推理效率。
原文:[AINews] Death of Params: Z.ai CEO Jie Tang on GLM 5.3 and the new Post-training Scaling Law · 作者 Latent Space
🕸 顺着图谱继续读
- Qwen3.8-Flash-Next — Qwen新模型,125B参数仅6B激活,本地运行性能强劲。2026-08-26 · 共同涉及 Unsloth、MoE
- GLM-5.3: How Chinese labs keep stride with the frontier — GLM2026-08-14 · 共同涉及 Z.ai、GLM 5.3
- [AINews] Cursor's $60B acquisition by SpaceXai closes — Cursor 被 SpaceXAI 收购,开源模型与 Agent 运行时成为焦点2026-08-14 · 共同涉及 Z.ai、GLM 5.3
- Scaling Laws, Carefully — 深度学习缩放法则的核心发现与最优分配策略。2026-06-24 · 共同涉及 Chinchilla