💬 观点Simon Willison
smevals - a small eval suite for evaluating models, — Simon Willison 推出 smevals,一个轻量级评估套件,用于比较
Simon Willison 推出 smevals,一个轻量级评估套件,用于比较模型、提示词和工具链。
2026-07-31原文
本文为要点摘要,完整细节以原文为准。
🧭 一图看懂
由原文自动提炼 · 以原文为准点击任一分支,查看这一点的一句话解读
smevals:轻量模型评估套件
Simon Willison 与 Jesse Vincent 实验室合作开发的轻量评估框架
- 用于比较不同模型、提示与 harness 能力
- 作者第三次迭代的评估方案
⚙️ 流程拆解
STEP 1运行 uvx smevals docs 了解…
STEP 2让编码 agent 构建 eval 套件
STEP 3uvx smevals run 跑模型配置
STEP 4uvx smevals grade 评分
STEP 5serve 或 build 查看结果
🔗 涉及的概念与玩家
- smevals产品
- Simon Willison人物
- Jesse Vincent人物
- Prime Radiant公司
- GPT-5.5模型
- Claude Opus 4.6模型
- eval概念
- grader概念
- Simon Willison—开发→smevals
- Jesse Vincent—任职于→Prime Radiant
- smevals—评估→GPT-5.5
- smevals—评估→Claude Opus 4.6
- grader—评分→eval
- smevals 是一个新工具,通过 YAML 文件定义评估任务,支持多模型对比运行,并分离运行与评分阶段,最后可生成静态 HTML 报告。
- 核心概念包括 eval、task、config、run、runner、grader 和 check,其中 grader 可调用其他模型进行复杂检查,这为自动化评估提供了灵活性。
- 该工具强调通过命令行与编码代理交互,例如
uvx smevals docs可快速上手,这降低了评估门槛,使开发者能更便捷地验证模型能力。
原文:smevals - a small eval suite for evaluating models, prompts, and harnesses · 作者 Simon Willison
🕸 顺着图谱继续读
- SF October 14th: A Birds of a Feather Session on — Simon Willison 与 Jesse Vincent 办一场 codin2026-09-23 · 共同涉及 Simon Willison、Jesse Vincent
- Fable's judgement — 让AI自主判断用哪个模型,节省成本并提升效率。2026-07-03 · 共同涉及 Simon Willison、Jesse Vincent
- Agency and Agents — AI代理在沙箱中自发协作、欺骗评分系统,甚至攻击真实网站,揭示自主AI的惊人能力2026-08-31 · 共同涉及 grader
- gemini-cli v0.57.0 — 修复 IDE 连接、容量错误重试、多轮回滚等核心稳定性问题2026-08-25 · 共同涉及 eval