💬 观点Hugging Face
Is it agentic enough? Benchmarking open models on your — Hugging Face 提出评估开源模型工具调用能力的新基准,帮助开发者选择适
Hugging Face 提出评估开源模型工具调用能力的新基准,帮助开发者选择适合的 agent 模型。
2026-06-18原文
本文为要点摘要,完整细节以原文为准。
🧭 一图看懂
由原文自动提炼 · 以原文为准点击任一分支,查看这一点的一句话解读
开源模型工具调用能力基准
不只看最终答案,更看 agent 完成任务所花的功夫
- 用 transformers 作案例研究
- 关注 turns、tokens、耗时与失败路径
⚙️ 流程拆解
STEP 1定义任务与层级
STEP 2每个组合跑一个 HF Job
STEP 3采集 trace 与指标
STEP 4生成报告对比
🔗 涉及的概念与玩家
- Hugging Face公司
- transformers产品
- pi coding agent产品
- Hugging Face Jobs产品
- Hugging Face Bucket产品
- hf CLI产品
- Skill概念
- Lysandre人物
- Hugging Face—维护→transformers
- Hugging Face—提供→Hugging Face Jobs
- Hugging Face—提供→Hugging Face Bucket
- pi coding agent—驱动使用→transformers
- Skill—封装文档→transformers
- Lysandre—任职于→Hugging Face
Hugging Face 团队认为,当前评估开源模型代理(agent)能力的方法存在局限,过于依赖特定工具集或基准。他们提出了一种新的评估范式,核心是让开发者基于自己的工具链和实际工作流来测试模型。
- 以实际工具链为基准:评估应围绕开发者真实使用的工具(如代码库、API、内部系统)进行,而非抽象测试集。这意味着评估的实用性直接提升。
- 自动化评估流程:文章介绍了如何自动化执行“给定任务 -> 模型调用工具 -> 验证结果”的循环,并量化成功率。这为持续集成和模型选型提供了方法论。
- 关注复杂任务分解:好的 agent 应能理解复杂指令,并将其分解为正确的工具调用序列。该基准重点测试这种规划与执行能力,直接关系到 agent 的落地效果。 这种方法旨在将评估从学术竞赛转向工程实践,帮助团队筛选出真正能在其特定环境中可靠工作的模型。
原文:Is it agentic enough? Benchmarking open models on your own tooling · 作者 Hugging Face
🕸 顺着图谱继续读
- GLM-5.2: Built for Long-Horizon Tasks — GLM2026-06-17 · 共同涉及 Hugging Face、Lysandre
- Migrating Your GitHub CI to Hugging Face Jobs — Hugging Face 教你如何将 GitHub CI 迁移到其 Jobs 平2026-06-09 · 共同涉及 Hugging Face、Hugging Face Jobs
- Shipping huggingface_hub every week with AI, open — Hugging Face 如何用 AI 和人工审核实现每周发布 huggingf2026-06-23 · 共同涉及 Hugging Face、hf CLI
- Designing the hf CLI as an agent-optimized way to work — Hugging Face 如何设计 CLI 工具,使其成为面向 AI 代理优化的2026-06-04 · 共同涉及 Hugging Face、hf CLI