基准测试已死

@MagnaDing
英语2026年9月04日
105K
131
5
19
119

TL;DR

随着 AI Agent 从回答问题转向执行复杂的现实任务,传统的基准测试已逐渐过时。作者主张采用基于成果的实习模式来衡量真正的 AGI。

你好,AI 爱好者们!

OpenAI 本周正式宣布:欢迎来到 AGI 时代。

GPT-6 Astra 已经发布,OpenAI 将其定位为一次代际飞跃——在计算机使用、编程、研究以及那些过去需要人类全程监督的漫长而杂乱的工作方面,都取得了巨大进步。

我先姑且相信这些宣传,因为它引出了一个行业一直悄悄回避的问题:我们到底该如何衡量这个东西?

过去几年,AI 一直依赖基准测试来运行。每次发布新模型,都会附带一张表格,证明新模型在这里好 3%,在那里好 7%,并且根据某个去年春天还不存在的基准测试,神秘地聪明了 12%。我们对它们进行排名、用颜色编码、堆叠到排行榜上,然后加冕一个赢家。当模型基本上只是在回答问题的时候,这套方法还挺管用。但当模型开始动手做事时,它就行不通了。

核心问题在于:基准测试只是一个问题库。 你把一个问题交给模型,它产生一个答案,你对照答案键来检查。即使是那些花哨的计算机使用基准测试,本质上也是一堆在预构建环境中运行的预编写任务。这确实有用。但这与你把一个 Agent 放到真实机器上并让它完成某件事时发生的情况完全不同。

现实生活不会附带一个基准测试文件。你的桌面上没有任何东西会告诉你“完成”到底是什么样子。

一台真实的计算机,是一个会在任务中途崩溃的浏览器,一个昨天悄悄重新设计了界面的网站,一个包含三个矛盾版本电子表格,一个没人提过的权限,一个埋在六层文件夹深处的 PDF,一个在最糟糕的请求上超时的 API,以及一个说“你能处理一下这个吗?”然后没定义“这个”就走开的人类。

Agent 必须自己弄清楚。而没有人能很好地基准测试的部分是:它必须在第一次尝试失败时恢复过来。 这与得到正确答案是完全不同的技能。

这就是为什么关于 OpenAI 购买了数万台消费级 Mac 用于强化学习和计算机使用训练的报道,比表面看起来更有深意。具体数字虽有报道但未经审计——但方向是明确的。前沿实验室希望他们的模型能运行在真实机器上,而不是被困在聊天框里。而这悄悄地打破了整个基准测试的游戏规则。

想象两个 Agent,同一台电脑,同样模糊的指令:

研究这个市场,挑选三家有前景的公司,建立一个财务对比,并为投资委员会准备一份演示文稿。

没有唯一正确的方法来做这件事。有上百种方法。一个 Agent 浏览了两个小时。另一个写了一个脚本。第三个中途偶然发现了一个更好的数据源,并放弃了原计划。第四个犯了个错误,发现了它,并修正了它。第五个给了你一份基于完全错误数字的漂亮演示文稿。

那么,哪个赢了?基准测试的作者无法预先写出答案,因为根本没有标准答案。

而这就是事情变得真正棘手的地方。给 Agent 打分最困难的部分可能不再是答案是否正确。 而是这些工作到底有没有用。 这听起来像是在吹毛求疵。但并非如此。

拿一个在计算机使用基准测试中达到 95% 的 Agent,然后把它放到一家真实公司里工作一周。它建错了文件夹结构,覆盖了一个正在使用的电子表格,花了六个小时追查一条死路,自信地引用了一个 2023 年的统计数据,然后被一个它从未想过要问的权限墙卡住。每一项基准测试任务:完美。但没有人会让它干满第二周。

再拿一个只得了 85% 的 Agent——但它知道自己什么时候困惑,会问出那个能突破瓶颈的问题,在事情出错时改变策略,并且悄无声息地交付你真正能用的工作。哪个更聪明?排行榜不知道。老实说,我们也不知道。

这就是为什么我认为独立的基准测试正在撞墙。不是因为研究人员在偷懒——他们正在构建比以往更困难、更现实的测试。问题在于,现实总是比测试更庞大。你可以让基准测试更长,添加更多工具、更多网站、更多应用、更多步骤、更多随机性。这都没用。你仍然在构建一个有规则的游戏,一旦模型学会了玩这个游戏,你就又回到了原点。

所以我们会看到分数。91.4%。94.7%。97.2%。98.1%。人们会争论模型 A 是否比模型 B 好。有人会推出另一个排行榜。另一个人会推出一个排行榜的排行榜。而自始至终,模型会坐在一台真实的计算机上,做着那些数字都无法描述的事情。

这就是基准测试的悖论: AI 越接近通用智能,一个预写问题库能告诉你的就越少。

那么,什么会取代它呢?我认为答案不是“一个更好的基准测试”。我认为是性质上不同的东西。别再给 Agent 一个问题,给它一个目标。别再给它一个整洁的沙盒,给它一个混乱的沙盒。别再根据它是否遵循了预期步骤来打分,而是根据它是否得到了结果来打分。别再重复运行同一个公开测试,把它扔进不断变化的环境中,去处理它从未见过的私有任务。

并且,别再只问它是否成功了。要问它成功的可靠性如何,成本是多少,花了多长时间,需要人类干预的频率,行为是否安全,以及工作成果是否经得起现实的考验。

简而言之:下一代 AI 评估应该看起来更像一场实习,而不是一场考试。

不要问模型:

它通过测试了吗?

给它一台笔记本电脑、一个账号、一笔预算、一个目标,以及一周时间。然后观察它做了什么。这能告诉你更多关于它的智能的信息——而且这将是标准化的噩梦。而这正是关键所在。

现实世界的智能是混乱的、依赖上下文的、自适应的、开放式的。当你把它压平成一个带有固定答案的整洁问题列表时,你就不再是在衡量智能了。你衡量的是应试能力。

这就是为什么 Astra 给我的感觉不同。OpenAI 正在大声告诉我们,我们已经进入了 AGI 时代。好吧。但如果这是真的,我们或许应该停止给 AGI 发放我们为聊天机器人设计的标准化考试了。

有趣的问题不再是“它得了多少分?” 而是“当你给它一台电脑并告诉它去完成某件事时,会发生什么?” 我怀疑我们即将发现,我们还没有一个好的答案。

所以——欢迎来到 AGI 时代。同时,也悄悄地欢迎来到不可评分的 AI 时代。基准测试并没有变差。只是我们试图衡量的东西,已经走出了它的范围。

阅读文章

一键保存

使用 YouMind AI 深度阅读爆款文章

保存原文、追问细节、总结观点,并在一个 AI 工作空间里把爆款文章沉淀成可复用笔记。

了解 YouMind
写给创作者

把你的 Markdown 变成干净的 𝕏 文章

图片上传、表格、代码块,往 𝕏 上手动重排太痛苦。YouMind 把整篇 Markdown 一键转成干净、可直接发布的 𝕏 文章草稿。

试试 Markdown 转 𝕏

更多可拆解样本

近期爆款文章

探索更多爆款文章