30 秒快速回答
AI Agent 评测基准是一套标准化测试,用来衡量智能体在编程、网页操作、工具调用、多步推理等真实任务上的能力。主流基准包括 SWE-bench(修 Bug)、GAIA(通用助手任务)、WebArena(网页交互)、AgentBench(多维度操作系统)等。选基准就像选体检项目——没有哪个能包揽全部,关键在于匹配你的场景。
核心价值:看完这篇文章,你将理解各大基准测什么、不测什么,以及为什么 70% 的 SWE-bench 得分不等于能处理 70% 的真实工单。
一、为什么 LLM 榜单不够用了?
2023 年到 2024 年初,大家评估 AI 主要看 MMLU、HumanEval 这类静态基准——给模型一道题,看它答得对不对。但 Agent 时代完全不同了。
一个 AI Agent 需要做的是:理解目标 → 制定计划 → 调用工具 → 观察结果 → 修正行动 → 交付产出。这是一个多步、有状态、与环境交互的过程。传统基准完全测不了这些。
来看一组对比:
| 维度 | 传统 LLM 基准(MMLU 等) | Agent 基准(SWE-bench 等) |
|---|---|---|
| 任务形态 | 单轮问答 | 多步交互 |
| 评测对象 | 模型知识 | 规划 + 工具使用 + 执行 |
| 环境 | 静态题目 | 动态沙箱/真实环境 |
| 评分方式 | 答案匹配 | 任务完成度/Pass@k |
| 代表性指标 | Accuracy | 任务解决率 |
简单说:LLM 基准考”知不知道”,Agent 基准考”做不做得到”。
二、四大主流 Agent 基准详解
1. SWE-bench:AI 程序员的”驾考”
测什么:给 Agent 一个真实的 GitHub Issue,要求它定位代码库中的 Bug 并提交 Patch。
怎么测:从 12 个 Python 开源项目(Django、SymPy、scikit-learn 等)中提取真实 Issue,Agent 需要理解问题描述、在代码库中搜索定位、修改代码、通过测试。
关键指标:解决率(Resolved Rate)。SWE-bench Verified 是过滤掉有歧义 Issue 后的精选子集,当前顶级 Agent(如 Devin、Claude Code)在该子集上的解决率在 50%-70% 区间。
局限:12 个 Python 项目的 Issue 分布不等于真实工程团队的 Backlog。一个在 SymPy 数学 Bug 上表现出色的 Agent,未必能处理 Django 认证模块的安全补丁。
# SWE-bench 任务示例结构
Issue: "Django's QuerySet.count() returns wrong result
when using distinct() with annotations"
Agent 需要:
1. 理解 Django ORM 的 distinct() 和 annotate() 语义
2. 在 django/db/models/query.py 中定位相关代码
3. 编写修复 + 测试用例
4. 提交 patch
2. GAIA:通用 AI 助手的”智商测试”
测什么:让 Agent 完成普通人类能做的网络信息检索与推理任务,如”2023 年奥斯卡最佳影片的导演是哪所大学毕业的?”
设计哲学:GAIA 刻意设计成对人类简单、对 AI 困难的任务。它不考专业知识,考的是多步推理、信息检索、工具协调的组合能力。
关键指标:Pass@1 准确率。人类在该基准上的表现是 92%+,而 2024 年最强的 AI Agent 约 40%,2025-2026 年头部 Agent 已突破 60%。
局限:偏重信息检索与推理,不涉及代码编写、系统操作等工程型能力。
3. WebArena:网页交互的”实操考场”
测什么:在模拟的电子商务、社交论坛、地图、CMS 等真实网站环境中完成操作任务。
示例任务:”在购物网站搜索蓝牙耳机,按评分排序,把前 3 个加入购物车”。
关键指标:任务成功率(Task Success Rate)。
核心挑战:Agent 需要理解网页结构、填写表单、处理弹窗、应对页面跳转——这些都是真实 Web Agent 每天面对的。
4. AgentBench:多维度的”全能体测”
测什么:8 个不同环境下的 Agent 能力——操作系统(OS)、数据库(DB)、知识图谱(KG)、卡牌游戏(DCG)、横向思维谜题(LTP)、家居(ALFWorld)、网页浏览(Web)、代码(Code)。
设计亮点:这是目前覆盖面最广的 Agent 基准,从命令行操作到数据库查询到游戏策略,全面评估 Agent 的泛化能力。
关键指标:各环境得分 + 综合评分。
三、Agent 评测的四大结构性难题
理解基准之前,先要理解它们”天生不稳”的原因:
1. 环境漂移(Environment Drift)
WebArena 2023 年的模拟购物网站,和 2026 年真实互联网上的电商页面已经不是一回事。基准环境是”冻结”的,但现实在变。一个在冻结环境里考 90 分的 Agent,面对新版网页可能连表单都找不到。
2. 测试不稳定(Test Flakiness)
Agent 任务通常有非确定性——同一个任务跑 10 次,可能 7 次成功 3 次失败,而失败原因可能是随机种子、网络延迟、沙箱状态残留。大多数排行榜只报告平均分,很少给出置信区间。
3. 答案泄露(Solution Leakage)
SWE-bench 的任务来自公开 GitHub Issue,其解决方案就在同一个仓库的 Git 历史里。任何在任务创建后训练的模型,都可能已经”见过”答案。SWE-bench Verified 子集部分缓解了这个问题,但结构性的泄露风险始终存在。
4. 基准到生产的鸿沟(Benchmark-to-Production Gap)
这是最大的陷阱:70% 的 SWE-bench 得分 ≠ 能处理 70% 的真实工单。基准的任务分布(12 个 Python 库、特定 Issue 类型)与真实团队的 Backlog(微服务、前端、运维脚本、遗留代码)没有对齐。
一句话记住:把 Agent 基准当”入场券”而非”能力证书”。高分是必要的,但不是充分的。
四、怎么选择适合你的评测基准?
| 你的场景 | 推荐基准 | 关注指标 |
|---|---|---|
| AI 编程助手/代码 Agent | SWE-bench Verified | Resolved Rate |
| 通用问答/研究助手 | GAIA | Pass@1 |
| 网页自动化/RPA | WebArena | Task Success Rate |
| 全能型 Agent 综合评估 | AgentBench | 各维度得分 |
| 多 Agent 协作系统 | AEMA / 自建场景测试 | 协作成功率 |
实操建议:
- 不只看总分:SWE-bench 按项目拆分分数更有参考价值——你的 Agent 可能在 Django 项目上 80%,在 SymPy 上 30%,平均分掩盖了这个断层。
- 自建”冒烟测试”:从你的真实业务场景中抽取 10-20 个代表性任务,形成内部基准。这是唯一能回答”这个 Agent 能不能上线”的测试。
- 关注趋势而非绝对值:基准分数在涨,但你的关注点应该是”换了新模型/新框架后,我的场景分数有没有提升”。
总结
- SWE-bench 测编程,GAIA 测通用推理,WebArena 测网页交互,AgentBench 测综合能力——各有所长,没有”万能基准”。
- Agent 基准天生比 LLM 基准”更不稳定”:环境漂移、测试波动、答案泄露、生产鸿沟是四大硬伤。
- 高分是入场券,自建业务场景测试才是上线决策的依据。
延伸阅读:
- SWE-bench 官方 Leaderboard — 实时跟踪各 Agent 在代码修复上的表现
- GAIA Leaderboard — 通用 AI 助手能力排名
- 《什么是 AI Agent?智能体工作原理与搭建指南》— 理解 Agent 基础概念
- 《什么是 MCP 协议?一文读懂 AI 的 USB 接口标准》— Agent 工具调用的标准协议
- 《什么是 A2A 协议?Agent 之间的 TCP/IP 标准全解析》— 多 Agent 协作通信标准