30 秒快速回答

AI Agent 评测基准是一套标准化测试,用来衡量智能体在编程、网页操作、工具调用、多步推理等真实任务上的能力。主流基准包括 SWE-bench(修 Bug)、GAIA(通用助手任务)、WebArena(网页交互)、AgentBench(多维度操作系统)等。选基准就像选体检项目——没有哪个能包揽全部,关键在于匹配你的场景。

核心价值:看完这篇文章,你将理解各大基准测什么、不测什么,以及为什么 70% 的 SWE-bench 得分不等于能处理 70% 的真实工单。


一、为什么 LLM 榜单不够用了?

2023 年到 2024 年初,大家评估 AI 主要看 MMLU、HumanEval 这类静态基准——给模型一道题,看它答得对不对。但 Agent 时代完全不同了。

一个 AI Agent 需要做的是:理解目标 → 制定计划 → 调用工具 → 观察结果 → 修正行动 → 交付产出。这是一个多步、有状态、与环境交互的过程。传统基准完全测不了这些。

来看一组对比:

维度 传统 LLM 基准(MMLU 等) Agent 基准(SWE-bench 等)
任务形态 单轮问答 多步交互
评测对象 模型知识 规划 + 工具使用 + 执行
环境 静态题目 动态沙箱/真实环境
评分方式 答案匹配 任务完成度/Pass@k
代表性指标 Accuracy 任务解决率

简单说:LLM 基准考”知不知道”,Agent 基准考”做不做得到”


二、四大主流 Agent 基准详解

1. SWE-bench:AI 程序员的”驾考”

测什么:给 Agent 一个真实的 GitHub Issue,要求它定位代码库中的 Bug 并提交 Patch。

怎么测:从 12 个 Python 开源项目(Django、SymPy、scikit-learn 等)中提取真实 Issue,Agent 需要理解问题描述、在代码库中搜索定位、修改代码、通过测试。

关键指标:解决率(Resolved Rate)。SWE-bench Verified 是过滤掉有歧义 Issue 后的精选子集,当前顶级 Agent(如 Devin、Claude Code)在该子集上的解决率在 50%-70% 区间。

局限:12 个 Python 项目的 Issue 分布不等于真实工程团队的 Backlog。一个在 SymPy 数学 Bug 上表现出色的 Agent,未必能处理 Django 认证模块的安全补丁。

# SWE-bench 任务示例结构
Issue: "Django's QuerySet.count() returns wrong result 
        when using distinct() with annotations"
        
Agent 需要:
1. 理解 Django ORM 的 distinct() 和 annotate() 语义
2. 在 django/db/models/query.py 中定位相关代码
3. 编写修复 + 测试用例
4. 提交 patch

2. GAIA:通用 AI 助手的”智商测试”

测什么:让 Agent 完成普通人类能做的网络信息检索与推理任务,如”2023 年奥斯卡最佳影片的导演是哪所大学毕业的?”

设计哲学:GAIA 刻意设计成对人类简单、对 AI 困难的任务。它不考专业知识,考的是多步推理、信息检索、工具协调的组合能力。

关键指标:Pass@1 准确率。人类在该基准上的表现是 92%+,而 2024 年最强的 AI Agent 约 40%,2025-2026 年头部 Agent 已突破 60%。

局限:偏重信息检索与推理,不涉及代码编写、系统操作等工程型能力。

3. WebArena:网页交互的”实操考场”

测什么:在模拟的电子商务、社交论坛、地图、CMS 等真实网站环境中完成操作任务。

示例任务:”在购物网站搜索蓝牙耳机,按评分排序,把前 3 个加入购物车”。

关键指标:任务成功率(Task Success Rate)。

核心挑战:Agent 需要理解网页结构、填写表单、处理弹窗、应对页面跳转——这些都是真实 Web Agent 每天面对的。

4. AgentBench:多维度的”全能体测”

测什么:8 个不同环境下的 Agent 能力——操作系统(OS)、数据库(DB)、知识图谱(KG)、卡牌游戏(DCG)、横向思维谜题(LTP)、家居(ALFWorld)、网页浏览(Web)、代码(Code)。

设计亮点:这是目前覆盖面最广的 Agent 基准,从命令行操作到数据库查询到游戏策略,全面评估 Agent 的泛化能力。

关键指标:各环境得分 + 综合评分。


三、Agent 评测的四大结构性难题

理解基准之前,先要理解它们”天生不稳”的原因:

1. 环境漂移(Environment Drift)

WebArena 2023 年的模拟购物网站,和 2026 年真实互联网上的电商页面已经不是一回事。基准环境是”冻结”的,但现实在变。一个在冻结环境里考 90 分的 Agent,面对新版网页可能连表单都找不到。

2. 测试不稳定(Test Flakiness)

Agent 任务通常有非确定性——同一个任务跑 10 次,可能 7 次成功 3 次失败,而失败原因可能是随机种子、网络延迟、沙箱状态残留。大多数排行榜只报告平均分,很少给出置信区间。

3. 答案泄露(Solution Leakage)

SWE-bench 的任务来自公开 GitHub Issue,其解决方案就在同一个仓库的 Git 历史里。任何在任务创建后训练的模型,都可能已经”见过”答案。SWE-bench Verified 子集部分缓解了这个问题,但结构性的泄露风险始终存在。

4. 基准到生产的鸿沟(Benchmark-to-Production Gap)

这是最大的陷阱:70% 的 SWE-bench 得分 ≠ 能处理 70% 的真实工单。基准的任务分布(12 个 Python 库、特定 Issue 类型)与真实团队的 Backlog(微服务、前端、运维脚本、遗留代码)没有对齐。

一句话记住:把 Agent 基准当”入场券”而非”能力证书”。高分是必要的,但不是充分的。


四、怎么选择适合你的评测基准?

你的场景 推荐基准 关注指标
AI 编程助手/代码 Agent SWE-bench Verified Resolved Rate
通用问答/研究助手 GAIA Pass@1
网页自动化/RPA WebArena Task Success Rate
全能型 Agent 综合评估 AgentBench 各维度得分
多 Agent 协作系统 AEMA / 自建场景测试 协作成功率

实操建议

  1. 不只看总分:SWE-bench 按项目拆分分数更有参考价值——你的 Agent 可能在 Django 项目上 80%,在 SymPy 上 30%,平均分掩盖了这个断层。
  2. 自建”冒烟测试”:从你的真实业务场景中抽取 10-20 个代表性任务,形成内部基准。这是唯一能回答”这个 Agent 能不能上线”的测试。
  3. 关注趋势而非绝对值:基准分数在涨,但你的关注点应该是”换了新模型/新框架后,我的场景分数有没有提升”。

总结

  • SWE-bench 测编程,GAIA 测通用推理,WebArena 测网页交互,AgentBench 测综合能力——各有所长,没有”万能基准”。
  • Agent 基准天生比 LLM 基准”更不稳定”:环境漂移、测试波动、答案泄露、生产鸿沟是四大硬伤。
  • 高分是入场券,自建业务场景测试才是上线决策的依据。

延伸阅读

  • SWE-bench 官方 Leaderboard — 实时跟踪各 Agent 在代码修复上的表现
  • GAIA Leaderboard — 通用 AI 助手能力排名
  • 《什么是 AI Agent?智能体工作原理与搭建指南》— 理解 Agent 基础概念
  • 《什么是 MCP 协议?一文读懂 AI 的 USB 接口标准》— Agent 工具调用的标准协议
  • 《什么是 A2A 协议?Agent 之间的 TCP/IP 标准全解析》— 多 Agent 协作通信标准