💬 观点Simon Willison
Kimi K3, and what we can still learn from the pelican — Simon Willison用“鹈鹕骑自行车”测试新模型Kimi K3,揭示其成
Simon Willison用“鹈鹕骑自行车”测试新模型Kimi K3,揭示其成本、推理和工具调用能力。
2026-07-16原文
本文为要点摘要,完整细节以原文为准。
🧭 一图看懂
由原文自动提炼 · 以原文为准点击任一分支,查看这一点的一句话解读
Kimi K3 与鹈鹕基准测试
Moonshot AI 发布 2.8 万亿参数模型,称首个开放 3T 级模型
- 网站与 API 可用,开放权重承诺 7 月 27 日前发布
- 自报基准多超 Claude Opus 4.8 max 与 GPT-5…
- 落后于 Claude Fable 5 和 GPT-5.6 Sol
⚙️ 流程拆解
STEP 1用 OpenRouter 调用 Kimi K3
STEP 2输入生成鹈鹕骑自行车 SVG 提示
STEP 3模型输出 SVG 并消耗 token
STEP 4将 SVG 渲染为图像
STEP 5用图像输入让模型生成 alt 文本
🔗 涉及的概念与玩家
- Moonshot AI公司
- Kimi K3模型
- Simon Willison人物
- OpenRouter产品
- Claude Fable 5模型
- GPT-5.6 Sol模型
- 鹈鹕基准测试概念
- Artificial Analysis公司
- Moonshot AI—发布→Kimi K3
- Simon Willison—测试→Kimi K3
- Simon Willison—创建→鹈鹕基准测试
- Kimi K3—通过访问→OpenRouter
- Kimi K3—落后于→Claude Fable 5
- Artificial Analysis—评测→Kimi K3
- Kimi K3拥有2.8万亿参数,自称首个“开源3T级模型”,在多项基准上超越Claude Opus 4.8和GPT-5.5,但输给Claude Fable 5和GPT-5.6 Sol。
- 含义:模型规模竞赛持续,但开源模型正逼近闭源顶尖水平,开发者需关注性价比而非单纯参数。
- 鹈鹕测试显示K3仅支持“最大”推理模式,消耗13,241个推理token,单次成本25美分,且存在约85个token的隐藏系统提示。
- 含义:推理成本仍高,隐藏提示可能影响可控性,开发者需测试实际任务开销。
- Willison强调鹈鹕测试已无法区分顶尖模型,但作为“hello world”仍有用:验证模型输出SVG能力、估算成本和推理,并推动他实际尝试新模型。
- 含义:简单测试虽过时,但能快速暴露模型特性(如推理模式、视觉能力),开发者应结合自身任务设计更相关的评估。
原文:Kimi K3, and what we can still learn from the pelican benchmark · 作者 Simon Willison
🕸 顺着图谱继续读
- Kimi K3: The open-weights escalation — Kimi K3 发布,开源模型逼近前沿,中美差距缩至32026-07-20 · 共同涉及 Moonshot AI、Kimi K3、Claude Fable 5
- [AINews] Kimi K3 2.8T-A50B: the largest open model ever — Kimi K3 2.8T参数开源模型发布,性能接近顶级闭源模型,定价对标Sonn2026-07-17 · 共同涉及 Moonshot AI、Kimi K3、Artificial Analysis
- GPT‑6 Astra — OpenAI发布GPT2026-09-03 · 共同涉及 Claude Fable 5、GPT-5.6 Sol、Artificial Analysis
- [AINews] Claude Opus 5: Fable-level performance at Opus — Claude Opus 5 发布,基准测试争议与真实编码能力并存。2026-07-25 · 共同涉及 Claude Fable 5、Artificial Analysis、GPT-5.6 Sol