基準測試已死

@MagnaDing
英語2026年9月04日
105K
131
5
19
119

TL;DR

隨著 AI Agents 從回答問題轉向執行複雜的現實任務,傳統的基準測試已變得過時。作者主張採用基於成果的實習模式來衡量真正的 AGI。

哈囉,AI 愛好者們!

OpenAI 這週正式宣布了:歡迎來到 AGI 時代。

GPT-6 Astra 已經推出,OpenAI 將其定位為一個世代性的躍進——在電腦使用、程式編寫、研究,以及那些過去需要人類全程監督的冗長、混亂的工作上,都有巨大的突破。

我先姑且相信這個行銷說法,因為它浮現出一個業界一直默默迴避的問題:我們到底要如何衡量這個東西?

過去幾年來,AI 一直依賴基準測試(Benchmarks)。每次新模型發表,都會附上一張表格,證明新模型在這裡進步了 3%,在那裡進步了 7%,並且根據某個去年春天還不存在的基準測試,神祕地變聰明了 12%。我們為它們排名、標上顏色、堆疊到排行榜上,然後選出冠軍。當模型基本上只是在回答問題時,這套方法還行得通。但當模型開始「做事」時,這套方法就失靈了。

這裡的核心問題是:基準測試只是一個題庫。 你給模型一個問題,它產出一個答案,你對照解答來檢查答案。即使是那些花俏的電腦使用基準測試,骨子裡也只是一堆在預設環境中執行的預先寫好的任務。這確實有它的用處。但這跟你把一個 Agent 放到真實的機器上,叫它去完成某件事,完全是兩碼子事。

真實世界不會附帶一個基準測試檔案。你桌面上的任何東西都不會告訴你「完成」的明確樣貌。

一台真實的電腦,是一個會在中途當機的瀏覽器、一個昨天才默默改版設計的網站、一個有三個矛盾版本的工作表、一個沒人提及的權限、一個埋在六層資料夾深處的 PDF、一個在最糟的請求時超時的 API,以及一個說「你可以處理一下這個嗎?」然後沒定義「這個」是什麼就走開的人類。

Agent 必須自己想辦法搞定。而最難被基準測試衡量到的部分是:它必須在第一次嘗試失敗時能夠恢復。 這和「得到正確答案」是完全不同的技能。

這就是為什麼 OpenAI 購買了數萬台消費級 Mac 用於強化學習和電腦使用訓練的報導,比表面上看起來更有深意。具體數字雖有報導但未經審計——但方向是明確的。前沿實驗室希望他們的模型能運行在真實的機器上,而不是被困在聊天框裡。而這,悄悄地打破了整個基準測試的遊戲規則。

想像兩個 Agent,同一台電腦,同樣模糊的簡報:

研究這個市場,選出三家有潛力的公司,建立一份財務比較,並為投資委員會準備一份簡報。

完成這件事的方法不只一種,而是有上百種。一個 Agent 瀏覽了兩個小時。另一個寫了一個腳本。第三個在中途偶然發現一個更好的數據來源,於是拋棄了原本的計畫。第四個犯了錯,發現了,然後修正它。第五個交給你的是一份華麗但建立在完全錯誤數字上的簡報。

那麼,哪一個贏了?基準測試的作者無法預先寫好答案,因為根本沒有標準答案。

而這就是事情變得真正棘手的地方。評估一個 Agent 最困難的部分,可能不再是答案是否正確。而是這些東西到底有沒有用。 這聽起來像是在吹毛求疵,但並非如此。

拿一個在電腦使用基準測試中達到 95% 的 Agent,然後把它放到一家真實公司裡一週。它建立了錯誤的資料夾結構、覆蓋了一個正在使用的工作表、花了六小時追查一個無效的線索、自信地引用了一個 2023 年的統計數據,然後卡在一個它從沒想過去問的權限牆上。每一項基準測試任務:完美。但沒有人會讓它繼續工作到第二週。

現在,拿一個只拿到 85% 分數的 Agent——但它知道自己什麼時候困惑、會問出那個能解開僵局的關鍵問題、在事情出錯時改變策略、並且默默地交出你實際上能用的成果。哪一個比較聰明?排行榜完全不知道。老實說,我們也不知道。

這就是為什麼我認為獨立基準測試正在撞牆。不是因為研究人員在偷懶——他們正在建立比以往更困難、更逼真的測試。問題在於,現實世界總是不斷超越測試的範圍。你可以讓基準測試更長、加入更多工具、更多網站、更多應用程式、更多步驟、更多隨機性。但這都沒用。你仍然在建立一個有規則的遊戲,而一旦模型學會了玩這個遊戲,一切又會回到原點。

所以我們會看到分數。91.4%。94.7%。97.2%。98.1%。人們會爭論模型 A 是否擊敗了模型 B。有人會推出另一個排行榜。另一個人會推出一個「排行榜的排行榜」。而與此同時,模型正坐在一台真實的電腦前,做著那些數字都無法描述的事情。

這就是基準測試的悖論: AI 越接近通用智慧,預先寫好的題庫能告訴你的就越少。

那麼,什麼能取代它?我認為答案不是「一個更好的基準測試」。我認為答案是本質上不同的東西。停止給 Agent 一個問題,改給它一個目標。停止給它一個整齊的沙盒,改給它一個混亂的。停止評分它是否遵循了預期的步驟,改評分它是否達成了結果。停止重複運行同樣的公開測試,改把它丟進持續變化的環境,執行它從未見過的私人任務。

並且,停止只問它是否成功。要問它成功的可靠性有多高、成本是多少、花了多少時間、需要人類介入的頻率、行為有多安全,以及它的工作成果在現實中是否經得起考驗。

簡而言之:下一代 AI 評估,應該看起來更像是一場實習,而不是一場考試。

不要問模型:

它通過考試了嗎?

給它一台筆電、一個帳號、一個預算、一個目標,和一週的時間。然後觀察它做了什麼。這會告訴你更多關於它智慧程度的資訊——而且這會是一場標準化的噩夢。而這正是重點所在。

真實世界的智慧是混亂的、依賴情境的、適應性的、且開放式的。當你把它壓平成一張整潔的、有固定答案的問題清單時,你就不再是衡量智慧了。你衡量的是考試能力。

這就是為什麼 Astra 給我的感覺如此不同。OpenAI 大聲告訴我們,我們已經進入了 AGI 時代。好吧。但如果這是真的,我們或許應該停止讓 AGI 去考我們為聊天機器人設計的標準化測驗。

有趣的問題不再是「它得了幾分?」 而是「當你給它一台電腦,叫它去完成某件事時,會發生什麼事?」 而我懷疑,我們即將發現我們還沒有一個好的答案。

所以——歡迎來到 AGI 時代。同時,也悄悄地:歡迎來到「無法評分的 AI」時代。基準測試並沒有變差。只是我們試圖衡量的東西,已經走出了它的框架。

閱讀文章

一鍵儲存

使用 YouMind AI 深度閱讀爆款文章

保存原文、追問細節、總結觀點,並在一個 AI 工作空間裡把爆款文章沉澱成可複用筆記。

了解 YouMind
寫給創作者

把你的 Markdown 變成乾淨的 𝕏 文章

圖片上傳、表格、程式碼區塊,往 𝕏 上手動重排太痛苦。YouMind 把整篇 Markdown 一鍵轉成乾淨、可直接發佈的 𝕏 文章草稿。

試試 Markdown 轉 𝕏

更多可拆解樣本

近期爆款文章

探索更多爆款文章