💬 观点Latent Space
[AINews] 10% worse, 100x cheaper, 10000x faster: Why — 模拟正在接管AI:从奖励信号到物理世界,每个环节正被模型替代。
模拟正在接管AI:从奖励信号到物理世界,每个环节正被模型替代。
2026-08-22原文
本文为要点摘要,完整细节以原文为准。
🧭 一图看懂
由原文自动提炼 · 以原文为准点击任一分支,查看这一点的一句话解读
模拟正在接管AI全流程
AI生产管线每年有一个环节从人造转为模型造,合成版10%更差但100倍便宜、万倍快
- 2022起每年翻转一个环节
- 每个翻转都有patient zero论文或产品
- 合成数据、rubric、AI研究员本质都是人类模拟
⚙️ 流程拆解
STEP 1合成奖励信号
STEP 2合成训练数据
STEP 3模型当教师
STEP 4模型定课程
STEP 5模型做研究
STEP 6合成RL环境
🔗 涉及的概念与玩家
- InstructGPT模型
- Constitutional AI方法
- RLAIF方法
- Phi模型
- AlphaEvolve产品
- Andrej Karpathy人物
- GLM-5.3模型
- Simile产品
- InstructGPT—启发→RLAIF
- Constitutional AI—采用→RLAIF
- Andrej Karpathy—延续思路→AlphaEvolve
- GLM-5.3—同属合成→Simile
- 从2022年起,AI流水线每年有一个环节从人类制造转为模型制造:先是奖励信号(InstructGPT的RLHF),再是训练数据(Phi系列),然后是教师(Alpaca),接着是课程(Self-Rewarding LMs)。
- 2026年,研究者角色被自动化:Karpathy的autoresearch让编码代理自主修改训练设置,一夜之间堆叠700次实验,将GPT-2训练时间从2.02小时降至1.80小时。
- 环境合成成为RL瓶颈:Z.ai的GLM-5.3和Ornith-1.5实现端到端环境合成与自我改进,裁判、环境、评分全部由模型生成。
原文:[AINews] 10% worse, 100x cheaper, 10000x faster: Why Simulation is taking over · 作者 Latent Space
🕸 顺着图谱继续读
- From Hugging Face to Amazon SageMaker Studio in one — 一键将Hugging Face模型部署到SageMaker Studio,简化M2026-07-07 · 共同涉及 RLAIF
- Jev: System One models for Prod, not God — with Diogo — InstructGPT 作者 Diogo Almeida 推出 Jev,主张用 2026-09-21 · 共同涉及 InstructGPT
- Accelerating the frontiers of scientific discovery: — Google 4000万美元资助Genesis任务,用AI加速科学发现。2026-07-22 · 共同涉及 AlphaEvolve
- Frontier post-training recipe review with Finbarr — 解析前沿大模型后训练技术演进,从 InstructGPT 到 2026 年 MO2026-06-16 · 共同涉及 InstructGPT