💬 观点Lilian Weng
Scaling Laws, Carefully — 深度学习缩放法则的核心发现与最优分配策略。
深度学习缩放法则的核心发现与最优分配策略。
2026-06-24原文
本文为要点摘要,完整细节以原文为准。
🧭 一图看懂
由原文自动提炼 · 以原文为准点击任一分支,查看这一点的一句话解读
深度学习缩放法则与算力分配
训练损失随模型、数据、算力按幂律可预测下降
- log-log 图上呈直线
- 三者需同步扩展才最优
- 大模型样本效率更高
⚙️ 流程拆解
STEP 1小规模训练拟合缩放律
STEP 2外推预测大模型需求
STEP 3分配算力于 N 与 D
STEP 4验证并调整拟合
🔗 涉及的概念与玩家
- Kaplan et al.人物
- Chinchilla模型
- Amari et al.人物
- Hestness et al.人物
- Rosenfeld et al.人物
- Scaling Laws概念
- Transformer模型
- Kaplan et al.—提出→Scaling Laws
- Chinchilla—修正→Scaling Laws
- Amari et al.—奠基→Scaling Laws
- Hestness et al.—验证→Scaling Laws
- Rosenfeld et al.—建模→Scaling Laws
- Transformer—适用→Scaling Laws
- 缩放法则揭示训练损失随模型大小、数据量和计算量呈幂律下降,在双对数图上呈直线。
- 核心问题是如何在模型大小和数据量之间最优分配计算资源,以最小化损失。
- 对开发者意味着:扩展模型时需同步增加数据,否则收益递减;计算预算应平衡两者。
原文:Scaling Laws, Carefully · 作者 Lilian Weng
🕸 顺着图谱继续读
- [AINews] Death of Params: Z.ai CEO Jie Tang on GLM 5.3 — GLM 5.3 揭示后训练新缩放定律:参数不再是唯一关键,环境合成与长程 RL 2026-08-20 · 共同涉及 Chinchilla
- DiScoFormer: One transformer for density and score, — 统一密度估计与分数匹配的Transformer,提升跨分布泛化能力。2026-06-29 · 共同涉及 Transformer
- Which tokens does a hybrid model predict better? — 混合预测下一个与未来多个token,提升模型效率与推理速度。2026-06-25 · 共同涉及 Transformer
- Accelerating Transformers Fine-Tuning with NVIDIA NeMo — NVIDIA NeMo AutoModel 如何加速 Transformer 微2026-06-24 · 共同涉及 Transformer