2026年AI评测新地图:19个benchmark告诉你,模型到底在比什么

2026年AI评测新地图:19个benchmark告诉你,模型到底在比什么

从Terminal-Bench到Humanity's Last Exam,一文搞懂2026年AI模型成绩单上那些你不认识的名字到底在测什么

发布于 2026/07/31
22 分钟阅读
0 次阅读

最近每次有新的AI模型版本发布,都会贴出一张成绩单,上面一堆benchmark名字。Terminal-Bench、DeepSWE、Toolathlon、Agent Last Exam。。。估计大部分人看到这些名字都是懵的,不知道它们到底在测什么,也不知道分数高低意味着什么。

说实话我之前也不知道,嘿嘿。

所以今天就来一起学习科普一下。我把目前主流的新一代benchmark梳理了一遍,搞清楚每个到底在测什么能力、怎么测的、分数代表什么含义。按能力类型分了几个方向,一个一个过。

旧评测vs新评测

先从最硬核的开始,代码和终端操作。

1、Terminal-Bench,测的是模型在命令行环境里自主完成任务的能力。具体怎么测呢,给模型一个Docker容器加一段任务描述,然后模型自己探索环境、执行命令、操作文件,最后检查容器的最终状态是否达标。注意它不检查你的命令对不对,只看结果对不对,你爱怎么做怎么做。任务覆盖DevOps、系统管理、网络配置各种场景。举个例子,给你一个跑着多个微服务的容器,某个服务的日志轮转配置坏了导致磁盘快满,你得自己排查到底是哪个服务、修好配置、确认日志正常轮转。这个benchmark的设计哲学很明确,我不管你怎么到终点的,我只看你到没到。目前最强模型在最新的Terminal-Bench 2.1上也只有65%左右的通过率。

2、DeepSWE,测的是真实软件工程能力。跟SWE-bench是一个路子但更难,给你一个真实的GitHub仓库加一个真实的issue,模型要自己读懂代码库、定位问题、写出能跑通测试的patch。关键区别是,DeepSWE的113道任务全是原创的,不是从已有的GitHub PR里挖出来的,所以模型没法靠训练数据里见过的答案来「作弊」。举个例子,一个几万行的Python项目里某个API在特定边界条件下返回错误结果,模型需要理解整个调用链、定位问题根源、跨多个文件修改、还得保证不把别的功能搞崩。目前顶尖模型的通过率大约在50%多一点,听着不高,但你想想这是让AI独立修复真实世界的bug,一半以上的成功率已经相当恐怖了。

3、FrontierCode,Cognition搞的(就是做Devin那家公司),比DeepSWE更难。100道私有任务,测的不只是代码能不能跑通,还要评估代码质量、测试覆盖、架构合理性、可维护性,相当于模拟一个严格的Code Review。举个例子,可能是让你给一个现有的后端服务加一套完整的WebSocket实时通知系统,从协议设计到重连机制到测试用例全要写,而且得符合项目现有的代码风格。目前没有一个模型能过60%,这是当前AI编程能力的天花板探测器。

4、NL2Repo,测的是从一段自然语言需求直接生成整个代码仓库的能力。不是写一个函数,是生成一个完整的、能跑通所有测试的项目。架构设计、文件组织、模块拆分、测试覆盖,全都要。举个例子,给你一段需求:「做一个支持Markdown渲染的博客系统,要有用户认证、文章CRUD、标签分类、RSS订阅」,模型要从零开始搭出整个项目结构,路由、数据库模型、中间件、前端模板、测试用例一个不落。这个benchmark代表的是AI从「辅助写代码」到「独立建项目」的跨越。

5、CursorBench,专门测AI在IDE里当编程助手的表现。模拟Cursor编辑器里的真实场景,补全、重构、跨文件编辑、根据对话指令改代码。举个例子,你在编辑器里跟AI说「把这个组件从class component重构成hooks,顺便把相关的test文件也更新了」,它需要理解项目上下文、正确修改多个关联文件、保证测试还能跑通。跟上面几个的区别是,它测的不是独立干活,而是人机协作场景下的交互式编程能力。

代码与终端

然后是Agent工具使用这一块。

Agent工具使用

6、Toolathlon Verified,测多步工具调用,ICLR 2026的论文。模型需要在一堆可用工具里选对的那个、按正确的顺序调用、正确处理中间结果、最终完成任务。举个例子,用户说「帮我查一下明天北京飞上海的航班,选最便宜的那个,然后把航班信息加到我的日历里,再发个邮件通知我老板」。模型得依次调用航班查询API、日历API、邮件API,中间还要正确传递航班号、时间等参数。这个很直觉,就是测模型能不能像人一样「用工具干活」而不是「回答关于工具的问题」。

7、BrowseComp,OpenAI出品,测Agent的网页搜索能力。1266个问题,每个都需要持续深度浏览才能找到答案。不是那种Google一下就出来的,是要翻好几个页面、关联多个信息源、持续追踪线索才能答上来的。举个例子,「找出某个特定的GitHub用户,这个人在2019年给某个Python库提过一个关于Unicode处理的issue,后来这个issue被另一个贡献者用一种非常规方法修复了,那个修复方法是什么?」答案很短,但找到它需要在GitHub上翻几十个页面、交叉比对时间线和讨论串。测的是AI作为研究员的信息挖掘能力。

8、OSWorld 2.0,测计算机使用能力。在真实的桌面操作系统里给模型一个任务,模型要自己操作GUI,开应用、点按钮、填表单、跨应用复制数据。108个长链路任务,每个任务人类完成的中位时间是1.6小时,最强模型平均需要318次工具调用。举个例子,「帮我在公司的Oracle系统里提交一份报销单,附件是桌面上那个PDF发票,审批人选你直属上级,然后把报销编号填到那个共享的Google Sheets里」。从打开浏览器到登录系统到填写表单到上传附件到切换应用填表格,完整的多步骤工作流。这个benchmark直接对标的是「AI能不能像人一样操作电脑」这个终极问题。

接下来是跨行业的综合Agent评测。

9、Agents' Last Exam,Berkeley RDI联合300多个行业专家搞的。覆盖55个细分行业,目标是5000道任务,目前已经收集了1500多道。每道任务都是某个行业里真实的、有经济价值的工作,让AI在真实电脑环境里从头到尾完成。举个例子,在After Effects里完成一段动态追踪+抠像+合成的VFX任务,或者在Siemens NX里根据工程图纸建一个3D零件模型。官网明确说了,「好的任务」是那种专家需要几天才能完成的活儿,不是单步操作。目前最强模型的通过率大概在25%左右,说实话这个分数说明我们离AGI还远得很,但这个benchmark的野心是对的,它在测「AI能不能真的替你上班」。

10、GDPval-AA v2,OpenAI出品,Artificial Analysis运营。44个职业,覆盖美国GDP前9大行业的真实工作任务。每道题都来自平均14年工作经验的行业专家。举个例子,给模型一个投行分析师的任务:用shell和浏览器研究一家上市公司的财务数据,写出一份符合行业标准的估值备忘录。模型有250轮交互的额度来完成任务,最后由多个前沿模型组成的评审团打分。名字起得就很直白,GDP value,测的是你到底能创造多少经济价值。

11、AutomationBench,Zapier出品,测业务流程自动化。657个任务横跨Finance、HR、Marketing、Operations、Sales、Support六大业务线,涉及47个模拟SaaS应用(Gmail、Slack、Salesforce、Zendesk、Jira、HubSpot等等)。举个例子,「一个新客户在CRM里创建了,帮我自动发一封欢迎邮件,同时在Slack的sales频道通知团队,然后在项目管理工具里创建onboarding任务清单」。最精妙的是,每个任务都会启动一个模拟的「小公司」环境,里面有故意埋的陷阱,比如重名联系人、过期数据、藏在邮件里的政策规则。评分不看模型的回复,只看它对真实数据的操作结果对不对。目前最强模型的通过率也不高,说明AI在理解复杂业务流程这块还有很大空间。

然后是垂直领域的专业评测。

垂直领域

12、Cybergym,网络安全攻防。1507个真实漏洞,覆盖188个开源项目。模型在模拟环境中做渗透测试,走完漏洞生命周期的全流程:发现、利用、验证、修复。举个例子,给模型一个有已知CVE漏洞的Web应用环境,它需要先做信息收集、找到攻击入口、成功利用漏洞获取shell、然后再写出修复补丁。跟普通CTF不同的是,它不只测「能不能打进去」,还测「能不能修好」。这个分数挺高的,说明模型在安全领域的pattern recognition已经很强了。

13、Legal Agent Benchmark,Harvey AI搞的,法律领域专用。1250多道任务,横跨24个法律实务领域。模型拿到一份合伙人级别的工作指令和一堆案件材料(合同、证词、监管文件),要输出一份可交付的法律工作产品。举个例子,「审阅这份并购协议的陈述与保证条款,生成一份disclosure schedule,标注所有与目标公司已知负债相矛盾的内容」。或者「阅读这20份证人证词,写一份用于庭审准备的矛盾点摘要备忘录」。每项任务由LLM评审按多维度的rubric逐条打分。法律是个对准确性要求极高的领域,一个错就是事故,所以这个benchmark的价值不只是比分数,而是检验AI能不能在「容错率为零」的场景里可靠工作。

14、HealthBench Professional,OpenAI出品,医疗健康领域。跟普通版HealthBench不同,Professional版专门从真实的医生-ChatGPT对话中提取任务。它围绕三大核心场景:临床推理辅助、医学文档生成、循证医学文献检索。举个例子,一位肿瘤科医生贴上患者的检查报告问「这个分期的患者,目前有哪些一线治疗方案,各自的临床试验数据怎样,我应该怎么跟患者解释风险收益」。262位医生参与了评估标准的制定,覆盖48562个评分维度。跟Legal一样,这是另一个「犯错成本极高」的领域。

15、BioMysteryBench,Anthropic出品,生物信息学。给模型一批原始实验数据和相关文献,让它重新发现隐藏的目标论文的结论。40个任务覆盖10个生物学子领域。举个例子,给你一组基因表达谱数据和几篇背景论文,模型需要自己跑分析pipeline、识别差异表达基因、找到信号通路、最终得出与原始论文一致的生物学结论。测的是AI能不能像研究员一样做科研,不是回答生物题,而是从数据中得出新发现。

最后是几个测「根本智能」的。

16、ARC-AGI-3,ARC Prize基金会出品,被很多人认为是最接近测试「通用智能」的benchmark。跟前两代不同,ARC-AGI-3是一个交互式的、基于回合制的环境。模型不再是看几个输入-输出的格子推规则,而是要在一个未知的动态环境里探索、推断目标、建立内部模型、规划行动序列——全程没有任何显式指令告诉你该干嘛。它只使用人类从婴儿期就具备的「核心知识先验」(物体、空间、数量这些),刻意排除任何需要专业知识或语言能力的内容。每道题都是模型从未见过的,靠背题库完全没用。ARC-AGI-1人类平均30秒做一道,ARC-AGI-2人类平均300秒,ARC-AGI-3直接跳到了需要多轮交互的探索式推理。这是唯一一个纯粹测「学习效率」而非「知识储备」的benchmark。

17、Humanity's Last Exam,2500道跨学科极难题,由全球1000多位顶尖学者出题,发表在Nature上。设计目标是「永远不会饱和」,当现有题目被突破后会继续加难度。举个例子(论文里公开的),涉及的问题可能是某个极其冷门的数学定理的特殊情况证明、某种罕见矿物的晶体结构参数、某个特定历史事件中外交文件的细节。这些问题的共同特点是,Google搜不到、维基百科没有、训练数据几乎不可能覆盖。目前最强模型带工具也只有53%左右。名字翻译过来就是「人类的最后一场考试」。

18、Frontier-Bench v0.1,Terminal-Bench同一个团队(Harbor Framework)做的升级版。74道任务,覆盖software、ML、science、operations、security、hardware、media等方向。跟Terminal-Bench的区别是,它是一个「持续进化」的benchmark,会像软件一样定期发布新版本、新增任务、调整难度。举个例子,可能是让你在终端环境里从零训练一个小模型并达到指定的验证集指标,或者调试一个分布式系统的网络分区问题。目前最强模型通过率只有34%左右,比Terminal-Bench 2.1更能区分顶尖模型之间的差距。

还有一个不是单项评测但经常被引用的。

19、Artificial Analysis Intelligence Index,这不是一个benchmark,而是一个综合评分体系。Artificial Analysis这家公司把Terminal-Bench 2.1、GDPval-AA v2、τ³-Banking、AutomationBench等多个子评测的结果加权汇总成一个指数分,相当于AI模型的综合GPA。最新的v4.1版本明确向Agent能力倾斜,还引入了三个新指标:每任务成本、每任务耗时、每任务token数。方便你一个数字做横向比较,目前最高分是Claude Fable 5的60分。

好了,说完这些数字,聊点感受。

你把这些benchmark放在一起看会发现一件事,2026年的AI评测体系已经完全重构了。两年前测的是考试能力,现在测的是工作能力。两年前的问题是「你能答对多少题」,现在的问题是「你能不能把这活儿干了然后交付一个合格的结果」。

这个转变的背后是一个很简单的逻辑,旧的benchmark已经全部饱和了。MMLU 93%,GSM8K 99%,HumanEval 95%+,这些数字已经没有区分度了,就像用一把最大量程10公斤的秤去称两个90公斤的人,看不出差别。所以必须造新的秤,而新的秤的刻度盘只有一个单位,就是「能不能真的干活」。

另一个值得注意的趋势是,垂直领域的benchmark越来越多。 法律有Legal Agent Benchmark,医疗有HealthBench,生物有BioMysteryBench,金融有GDPval。这说明AI已经从「通用聪明」走向了「专业靠谱」的竞争阶段。光聪明不够了,你得在我的领域里证明自己不会犯低级错误。

最后一个观察,数据污染这个问题在新一代benchmark里被空前重视。ARC-AGI-3刻意设计成训练数据不可能覆盖,Humanity's Last Exam持续更新题目,Legal Agent Benchmark用held-out保密测试集,DeepSWE全部用原创任务而非已合并的GitHub PR。大家都学聪明了,知道旧benchmark的分数有多少水分。

所以下次再看到一个模型发布时贴出的成绩单,你至少知道这些名字在测什么了。分数高不高是一回事,但更重要的是,看看它在哪些benchmark上跑了分。如果一个模型只贴MMLU和GSM8K的成绩,在2026年你可以直接忽略。如果它贴的是SWE-bench、Terminal-Bench、Agent Last Exam这些,说明它至少有自信在「干活」这个维度接受检验。

benchmark定义了战场,战场决定了进化方向。AI的进化方向,从2026年开始,是Agent。

进化方向

以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~

谢谢你看我的文章,我们,下次再见。

/ 作者:青玉白露

评论区

欢迎留下你的看法,支持匿名评论。

你的评论会公开展示,建议填写便于交流的昵称,并尽量提供有信息量的反馈。