💬 观点Simon Willison
Better Models: Worse Tools — 新模型更聪明,但调用第三方工具时反而更易出错,原因在于训练偏向。
新模型更聪明,但调用第三方工具时反而更易出错,原因在于训练偏向。
2026-07-04原文
本文为要点摘要,完整细节以原文为准。
🧭 一图看懂
由原文自动提炼 · 以原文为准点击任一分支,查看这一点的一句话解读
新模型更聪明,工具调用更差
新版 Claude 调用 Pi 编辑工具时凭空捏造字段,参数不符 schema 被拒
- Opus 4.8 也会出错,不只是小模型
- 编辑内容通常正确,但参数不匹配
- Pi 只能拒绝调用并要求重试
🔗 涉及的概念与玩家
- Anthropic—开发→Claude
- Anthropic—发布→Opus 4.8
- Anthropic—发布→Sonnet 5
- Opus 4.8—错误调用→Pi
- Claude—内置工具→Claude Code
- OpenAI—开发→Codex
-
新 Claude 模型(如 Opus 4.8)调用 Pi 的编辑工具时,会凭空添加 schema 中不存在的字段,导致工具调用被拒绝。
- 这意味着模型训练中隐含的“工具偏好”会干扰第三方工具链的兼容性,开发者需警惕模型升级带来的隐性破坏。
-
问题根源在于 Anthropic 通过强化学习让模型更擅长使用自家 Claude Code 的编辑工具,却损害了其他自定义编辑工具的调用准确性。
- 这揭示了模型训练与工具生态的耦合:模型优化可能只针对特定工具,通用性反而下降。
-
第三方编码工具(如 Pi)可能被迫实现多种编辑工具,以匹配不同模型的最佳调用方式。
- 这增加了工具链复杂度,开发者需在模型灵活性与工具一致性之间权衡。
原文:Better Models: Worse Tools · 作者 Simon Willison
🕸 顺着图谱继续读
- Claude Cowork and chat are now one Claude — Anthropic 把 Claude Cowork 与聊天合并为单一 Claud2026-09-16 · 共同涉及 Anthropic、Claude、Claude Code
- Co-Existence and the End of Co-Intelligence — AI 从协作伙伴变为独立代理,人类如何与时而超越自己的 AI 共存?2026-06-04 · 共同涉及 Claude Code、Opus 4.8、Codex
- Auto mode is now the default in Claude Code for Pro, — Anthropic 将 Claude Code 默认设为自动模式,并称其能抵御提2026-08-08 · 共同涉及 Anthropic、Claude Code、Sonnet 5
- Anthropic Walks Back Policy That Could Have ‘Sabotaged’ — Anthropic 撤回可能阻碍 AI 研究的 Claude 政策,回应社区强烈2026-06-11 · 共同涉及 Anthropic、Claude、Opus 4.8