💬 观点Zvi Mowshowitz
Claude Opus 4.8: Capabilities and Reactions — Zvi 通过大量数据点分析 Claude Opus 4.8 的真实能力与用户反应
Zvi 通过大量数据点分析 Claude Opus 4.8 的真实能力与用户反应,帮你避开片面评测的噪音。
2026-06-02原文
本文为要点摘要,完整细节以原文为准。
🧭 一图看懂
由原文自动提炼 · 以原文为准点击任一分支,查看这一点的一句话解读
Claude Opus 4.8 能力与反应
主打诚实与减少错位行为,编码能力提升
- SWE-bench Pro 从 64.3 升至 69.2
- 价格与 Opus 4.7 相同:$5/$25 每百万 token
- Boris Cherny 称其为最强编码模型
🔗 涉及的概念与玩家
- Claude Opus 4.8模型
- Anthropic公司
- Claude Code产品
- Boris Cherny人物
- GPT-5.5模型
- SWE-bench Pro概念
- GDPval-AA概念
- Zvi Mowshowitz人物
- Anthropic—发布→Claude Opus 4.8
- Boris Cherny—创建→Claude Code
- Claude Opus 4.8—测试于→SWE-bench Pro
- Claude Opus 4.8—对比→GPT-5.5
- Zvi Mowshowitz—分析→Claude Opus 4.8
博主 Zvi Mowshowitz 认为,评估像 Claude Opus 4.8 这样的新模型需要海量数据点,而非几个基准测试。他汇总了官方数据、第三方评测和大量用户反馈,勾勒出模型的真实面貌。
- 核心改进是诚实度与编码能力:官方宣传重点是提升模型诚实度和减少未对齐行为,编码基准(如 SWE-bench Pro)分数也有切实进步。对开发者而言,一个更可信、能主动承认不确定性和自我纠错的 AI 助手,能极大提升工作流可靠性。
- 新功能带来工作流革新:模型引入了可调节的“努力程度”参数和 Claude Code 中的“动态工作流”功能,后者能自动规划任务并调用数十上百个子智能体并行处理。这意味着处理复杂任务时,开发者可以获得一个内置的、自动化的多智能体评审与迭代框架。
- 存在明确的弱点与争议:模型在反谄媚和促诚实方面可能调校过度,导致其显得“苛刻”或过度模棱两可;在对抗性、谈判类场景中表现可能不佳;且新引入的动态工作流功能因关键词触发机制(如提到“workflow”)引发了一些误操作抱怨。这提醒开发者和用户,需根据具体任务场景选择合适的模型与配置。
原文:Claude Opus 4.8: Capabilities and Reactions · 作者 Zvi Mowshowitz
🕸 顺着图谱继续读
- [AINews] Sonnet 5 today, and Fable 5 tomorrow — Sonnet 5 发布,性能提升但 token 消耗大增,Fable 5 缺席引2026-07-01 · 共同涉及 Anthropic、Claude Opus 4.8、Claude Code
- Introducing Claude Opus 4.8 — Anthropic 发布 Claude Opus 4.8,在推理、诚实度和代理任2026-06-04 · 共同涉及 Anthropic、Claude Opus 4.8、Claude Code
- [AINews] Anthropic raises $965B Series H, releases Opus — Anthropic 融资 9650 亿美元并发布 Opus 4.8,揭示了 AI2026-05-29 · 共同涉及 Anthropic、Claude Opus 4.8、Claude Code
- Claude Opus 4.8 — 编码、诚实度、1M 上下文全面升级,价格不变2026-05-28 · 共同涉及 Anthropic、Claude Opus 4.8、GPT-5.5