💬 观点Simon Willison
Claude Fable 5.1 made me a really nice animated pelican — Simon Willison用“鹈鹕骑自行车”测试Claude Fable 5.
Simon Willison用“鹈鹕骑自行车”测试Claude Fable 5.1,发现推理等级差异巨大。
2026-09-01原文
本文为要点摘要,完整细节以原文为准。
🧭 一图看懂
由原文自动提炼 · 以原文为准点击任一分支,查看这一点的一句话解读
Claude Fable 5.1 鹈鹕测试
Anthropic 发布 Fable 5.1,主打编程、知识工作与长任务求解
- Terminal-Bench-Science 0.1 得分 52.6%
- Fable 5 为 24.7%,Opus 5 为 29.0%,GPT-5…
⚙️ 流程拆解
STEP 1修复 llm-anthropic 推理记录
STEP 2逐档生成鹈鹕 SVG
STEP 3对比 token 与耗时成本
STEP 4取 max 结果做动画
🔗 涉及的概念与玩家
- Anthropic公司
- Claude Fable 5.1模型
- Simon Willison人物
- Terminal-Bench-Science 0.1概念
- GPT-5.6 Sol模型
- Gemini 3.7 Flash模型
- llm-anthropic产品
- 鹈鹕基准概念
- Anthropic—发布→Claude Fable 5.1
- Simon Willison—测试→Claude Fable 5.1
- Claude Fable 5.1—得分52.6%→Terminal-Bench-Science 0.1
- Simon Willison—修复→llm-anthropic
- Claude Fable 5.1—参与→鹈鹕基准
- Fable 5.1 在低和中等推理等级下几乎不显示推理痕迹,输出token数相近,成本约10美分,但高等级(xhigh和max)推理痕迹显著,成本分别升至1.83美元和3.30美元,耗时数分钟。
- 推理等级影响输出质量:max等级生成的SVG细节丰富,如鹈鹕的蓝帽、鱼篮,而低等级则简单。这提示开发者需根据任务复杂度选择推理等级,以平衡成本与质量。
- 作者将max生成的SVG通过管道输入高推理等级进行动画化,成本1.37美元,成功产出动画。这展示了模型在创意任务中的潜力,但需注意推理token计入输出,影响成本。
原文:Claude Fable 5.1 made me a really nice animated pelican · 作者 Simon Willison
🕸 顺着图谱继续读
- [AINews] GPT-6 Astra: OpenAI’s biggest LLM launch of — OpenAI发布GPT2026-09-04 · 共同涉及 Claude Fable 5.1、GPT-5.6 Sol、Anthropic
- [AINews] Claude Fable/Mythos 5.1: new SOTA model, 75% — Claude 5.1 发布:缓存降价 75%,但输出 token 增加,单任务成2026-09-02 · 共同涉及 Anthropic、Claude Fable 5.1、GPT-5.6 Sol
- llm-anthropic 0.29 — Simon Willison 发布 llm2026-09-22 · 共同涉及 Simon Willison、llm-anthropic、Anthropic
- llm-anthropic 0.27 — Simon Willison 发布 llm2026-08-24 · 共同涉及 Simon Willison、llm-anthropic、Anthropic