💬 观点Latent Space
[AINews] Claude Opus 5: Fable-level performance at Opus — Claude Opus 5 发布,基准测试争议与真实编码能力并存。
Claude Opus 5 发布,基准测试争议与真实编码能力并存。
2026-07-25原文
本文为要点摘要,完整细节以原文为准。
🧭 一图看懂
由原文自动提炼 · 以原文为准点击任一分支,查看这一点的一句话解读
Claude Opus 5 发布与基准争议
Epoch 测得 ECI 159、SWE-ECI 161,略低于 Fable 5 的 161
- ECI 159 vs Fable 5 的 161
- SWE-ECI 161 与 Fable 5 持平
- 仅比 Opus 4.8 高 1 分
🔗 涉及的概念与玩家
- Anthropic公司
- Claude Opus 5模型
- Claude Fable 5模型
- Epoch AI公司
- Artificial Analysis公司
- GPT 5.6 Sol模型
- Mikhail Parakhin人物
- ECI概念
- Anthropic—发布→Claude Opus 5
- Claude Opus 5—对标→Claude Fable 5
- Epoch AI—提出→ECI
- Epoch AI—评测→Claude Opus 5
- Artificial Analysis—评测→Claude Opus 5
- Mikhail Parakhin—实测→Claude Opus 5
- Claude Opus 5 在 Epoch 能力指数(ECI)上得 159 分,略低于 Fable 5 的 161 分,但软件工程 SWE-ECI 持平 161 分。这意味着基准测试可能低估了模型的实用改进,开发者应关注实际任务表现而非单一分数。
- 有用户发现 Opus 5 在 FrontierCode 上中等努力得分高于高努力,表明推理时计算并非总是单调提升性能。这提醒工具链设计需考虑任务特定的搜索/努力权衡,而非简单增加计算量。
- 早期用户反馈强调 Opus 5 在浏览器自动化和编码代理任务中表现出色,例如直接取消 ChatGPT Pro 订阅。这暗示模型在 agentic 工作流中潜力巨大,开发者应优先测试工具使用场景。
原文:[AINews] Claude Opus 5: Fable-level performance at Opus price (half Fable) · 作者 Latent Space
🕸 顺着图谱继续读
- [AINews] Claude Fable/Mythos 5.1: new SOTA model, 75% — Claude 5.1 发布:缓存降价 75%,但输出 token 增加,单任务成2026-09-02 · 共同涉及 Anthropic、Claude Opus 5、GPT 5.6 Sol
- Introducing Claude Opus 5 — Anthropic发布Claude Opus 5,性能接近Fable 5但价格减2026-07-24 · 共同涉及 Anthropic、Claude Opus 5、Claude Fable 5
- GPT‑6 Astra — OpenAI发布GPT2026-09-03 · 共同涉及 Claude Fable 5、GPT 5.6 Sol、Artificial Analysis
- Kimi K3, and what we can still learn from the pelican — Simon Willison用“鹈鹕骑自行车”测试新模型Kimi K3,揭示其成2026-07-16 · 共同涉及 Claude Fable 5、GPT 5.6 Sol、Artificial Analysis