实践anthropic-engineering
Claude SWE-Bench Performance — Claude 3.5 Sonnet 在真实软件工程基准测试中达到 49% 成功率
Claude 3.5 Sonnet 在真实软件工程基准测试中达到 49% 成功率,其背后的智能体设计思路值得借鉴。
2026-05-28原文
本文为要点摘要,完整细节以原文为准。
🧭 一图看懂
由原文自动提炼 · 以原文为准点击任一分支,查看这一点的一句话解读
Claude 3.5 Sonnet 的…
评估模型解决真实 GitHub 问题的能力,用 PR 单元测试评分
- SWE-bench Verified 是 500 题人工审核子集
- 任务来自流行开源 Python 仓库
⚙️ 流程拆解
STEP 1探索仓库结构
STEP 2写脚本复现错误
STEP 3编辑源码修复
STEP 4重跑脚本验证
STEP 5处理边缘情况
- 将控制权交给模型,保持脚手架最小化:智能体仅提供提示词、Bash 工具和编辑工具,让模型自主决定问题解决路径,而非硬编码特定工作流。这意味着设计智能体时应信任模型的判断力,避免过度约束。
- 在工具描述中嵌入详细使用说明与边界条件:例如在 Bash 工具描述中明确说明无网络访问、如何避免大量输出、如何运行后台命令。这提示我们,工具接口的描述质量与 API 设计本身同等重要,需预判模型的误解点。
- 提示词提供建议性步骤而非强制指令:提示词建议“探索仓库”、“创建复现脚本”、“编辑源码”等步骤,但模型可自由决定执行顺序与方式。这表明为复杂任务设计提示时,提供清晰、灵活的指导框架比规定死板的步骤更有效。
🕸 顺着图谱继续读
- Patterns for Building Cybersecurity Evals — 如何系统构建网络安全评估,确保AI agent安全可靠。2026-06-21 · 共同涉及 Claude 3.5 Sonnet
- Claude Opus 4.8 — 编码、诚实度、1M 上下文全面升级,价格不变2026-05-28 · 共同涉及 SWE-bench Verified
- Introducing Muse Glimmer — Meta 新开源 30B 模型 Muse Glimmer,主打端到端智能体任务完2026-08-10 · 共同涉及 SWE-bench
- [AINews] FrontierCode: Benchmarking for Code Quality — Latent Space 解析 FrontierCode 基准:为何仅 13% 2026-06-09 · 共同涉及 SWE-bench