你好,AI 爱好者们!
OpenAI 本周正式宣布:欢迎来到 AGI 时代。
GPT-6 Astra 已经发布,OpenAI 将其定位为一次代际飞跃——在计算机使用、编程、研究以及那些过去需要人类全程监督的漫长而杂乱的工作方面,都取得了巨大进步。
我先姑且相信这些宣传,因为它引出了一个行业一直悄悄回避的问题:我们到底该如何衡量这个东西?
过去几年,AI 一直依赖基准测试来运行。每次发布新模型,都会附带一张表格,证明新模型在这里好 3%,在那里好 7%,并且根据某个去年春天还不存在的基准测试,神秘地聪明了 12%。我们对它们进行排名、用颜色编码、堆叠到排行榜上,然后加冕一个赢家。当模型基本上只是在回答问题的时候,这套方法还挺管用。但当模型开始动手做事时,它就行不通了。
核心问题在于:基准测试只是一个问题库。 你把一个问题交给模型,它产生一个答案,你对照答案键来检查。即使是那些花哨的计算机使用基准测试,本质上也是一堆在预构建环境中运行的预编写任务。这确实有用。但这与你把一个 Agent 放到真实机器上并让它完成某件事时发生的情况完全不同。
现实生活不会附带一个基准测试文件。你的桌面上没有任何东西会告诉你“完成”到底是什么样子。
一台真实的计算机,是一个会在任务中途崩溃的浏览器,一个昨天悄悄重新设计了界面的网站,一个包含三个矛盾版本电子表格,一个没人提过的权限,一个埋在六层文件夹深处的 PDF,一个在最糟糕的请求上超时的 API,以及一个说“你能处理一下这个吗?”然后没定义“这个”就走开的人类。
Agent 必须自己弄清楚。而没有人能很好地基准测试的部分是:它必须在第一次尝试失败时恢复过来。 这与得到正确答案是完全不同的技能。
这就是为什么关于 OpenAI 购买了数万台消费级 Mac 用于强化学习和计算机使用训练的报道,比表面看起来更有深意。具体数字虽有报道但未经审计——但方向是明确的。前沿实验室希望他们的模型能运行在真实机器上,而不是被困在聊天框里。而这悄悄地打破了整个基准测试的游戏规则。
想象两个 Agent,同一台电脑,同样模糊的指令:
研究这个市场,挑选三家有前景的公司,建立一个财务对比,并为投资委员会准备一份演示文稿。
没有唯一正确的方法来做这件事。有上百种方法。一个 Agent 浏览了两个小时。另一个写了一个脚本。第三个中途偶然发现了一个更好的数据源,并放弃了原计划。第四个犯了个错误,发现了它,并修正了它。第五个给了你一份基于完全错误数字的漂亮演示文稿。
那么,哪个赢了?基准测试的作者无法预先写出答案,因为根本没有标准答案。
而这就是事情变得真正棘手的地方。给 Agent 打分最困难的部分可能不再是答案是否正确。 而是这些工作到底有没有用。 这听起来像是在吹毛求疵。但并非如此。
拿一个在计算机使用基准测试中达到 95% 的 Agent,然后把它放到一家真实公司里工作一周。它建错了文件夹结构,覆盖了一个正在使用的电子表格,花了六个小时追查一条死路,自信地引用了一个 2023 年的统计数据,然后被一个它从未想过要问的权限墙卡住。每一项基准测试任务:完美。但没有人会让它干满第二周。
再拿一个只得了 85% 的 Agent——但它知道自己什么时候困惑,会问出那个能突破瓶颈的问题,在事情出错时改变策略,并且悄无声息地交付你真正能用的工作。哪个更聪明?排行榜不知道。老实说,我们也不知道。
这就是为什么我认为独立的基准测试正在撞墙。不是因为研究人员在偷懒——他们正在构建比以往更困难、更现实的测试。问题在于,现实总是比测试更庞大。你可以让基准测试更长,添加更多工具、更多网站、更多应用、更多步骤、更多随机性。这都没用。你仍然在构建一个有规则的游戏,一旦模型学会了玩这个游戏,你就又回到了原点。
所以我们会看到分数。91.4%。94.7%。97.2%。98.1%。人们会争论模型 A 是否比模型 B 好。有人会推出另一个排行榜。另一个人会推出一个排行榜的排行榜。而自始至终,模型会坐在一台真实的计算机上,做着那些数字都无法描述的事情。
这就是基准测试的悖论: AI 越接近通用智能,一个预写问题库能告诉你的就越少。
那么,什么会取代它呢?我认为答案不是“一个更好的基准测试”。我认为是性质上不同的东西。别再给 Agent 一个问题,给它一个目标。别再给它一个整洁的沙盒,给它一个混乱的沙盒。别再根据它是否遵循了预期步骤来打分,而是根据它是否得到了结果来打分。别再重复运行同一个公开测试,把它扔进不断变化的环境中,去处理它从未见过的私有任务。
并且,别再只问它是否成功了。要问它成功的可靠性如何,成本是多少,花了多长时间,需要人类干预的频率,行为是否安全,以及工作成果是否经得起现实的考验。
简而言之:下一代 AI 评估应该看起来更像一场实习,而不是一场考试。
不要问模型:
它通过测试了吗?
给它一台笔记本电脑、一个账号、一笔预算、一个目标,以及一周时间。然后观察它做了什么。这能告诉你更多关于它的智能的信息——而且这将是标准化的噩梦。而这正是关键所在。
现实世界的智能是混乱的、依赖上下文的、自适应的、开放式的。当你把它压平成一个带有固定答案的整洁问题列表时,你就不再是在衡量智能了。你衡量的是应试能力。
这就是为什么 Astra 给我的感觉不同。OpenAI 正在大声告诉我们,我们已经进入了 AGI 时代。好吧。但如果这是真的,我们或许应该停止给 AGI 发放我们为聊天机器人设计的标准化考试了。
有趣的问题不再是“它得了多少分?” 而是“当你给它一台电脑并告诉它去完成某件事时,会发生什么?” 我怀疑我们即将发现,我们还没有一个好的答案。
所以——欢迎来到 AGI 时代。同时,也悄悄地欢迎来到不可评分的 AI 时代。基准测试并没有变差。只是我们试图衡量的东西,已经走出了它的范围。





