💬 观点Simon Willison
Are AI labs pelicanmaxxing? — 系统测试证实AI实验室未刻意优化“骑自行车鹈鹕”生成能力。
系统测试证实AI实验室未刻意优化“骑自行车鹈鹕”生成能力。
2026-07-22原文
本文为要点摘要,完整细节以原文为准。
🧭 一图看懂
由原文自动提炼 · 以原文为准点击任一分支,查看这一点的一句话解读
AI实验室是否刻意优化鹈鹕骑车
系统测试未发现AI实验室刻意优化鹈鹕骑车生成能力
- 鹈鹕骑车图并未画得更好
- 实验室不更擅长画鹈鹕或自行车
- 调整难度后组合仍无优势
⚙️ 流程拆解
STEP 1选取8种动物与6种交通工具
STEP 2组合成48个提示词
STEP 3每个提示词运行三次
STEP 4在7个模型上生成图像
STEP 5用GPT-5.6 Luna和Gemini 3.1…
STEP 6分析是否存在刻意优化
🔗 涉及的概念与玩家
- Dylan Castillo人物
- Simon Willison人物
- GPT-5.6 Terra模型
- Claude Sonnet 5模型
- Gemini 3.5 Flash模型
- Grok 4.5模型
- Qwen3.7-Max模型
- GLM-5.2模型
- Dylan Castillo—测试→GPT-5.6 Terra
- Dylan Castillo—测试→Claude Sonnet 5
- Dylan Castillo—测试→Gemini 3.5 Flash
- Dylan Castillo—测试→Grok 4.5
- Dylan Castillo—测试→Qwen3.7-Max
- Dylan Castillo—测试→GLM-5.2
- 研究者Dylan Castillo用8种动物×6种交通工具共48个提示,对7个模型各测试3次,评估生成质量。
- 结果显示,没有模型在“骑自行车鹈鹕”上表现显著优于其他动物-交通工具组合,排除针对性优化。
- 这意味着开发者不应依赖非正式基准或传闻来评估模型能力,需采用系统化、可复现的评估方法。
原文:Are AI labs pelicanmaxxing? · 作者 Simon Willison
🕸 顺着图谱继续读
- [AINews] OpenAI reports median internal Codex output — OpenAI内部Codex使用量暴增56倍,揭示AI代理实际采用模式。2026-06-26 · 共同涉及 GLM-5.2、Gemini 3.5 Flash
- llm-anthropic 0.26 — llm2026-08-04 · 共同涉及 Claude Sonnet 5、Simon Willison
- What's new in Claude Sonnet 5 — Sonnet 5性能接近Opus 4.8,但新分词器使英语输入贵30%。2026-06-30 · 共同涉及 Claude Sonnet 5、Simon Willison
- The Pelican comparison grid for Astra is pretty — Simon Willison用骑自行车鹈鹕对比GPT2026-09-04 · 共同涉及 Simon Willison、GPT-5.6 Terra