現在 Model router 無所不在,但它們有一個根本性的限制。無論底層是先進的啟發式規則,還是一個讀取每輪對話來挑選 LLM 的小模型,router 的能力永遠比不上它所挑選的那個模型。Replit Agent 的做法則是讓模型自己決定。
主 Agent(也就是核心迴圈)會為子 Agent 選擇層級與運算量(effort),並隨著任務推進動態調整自己的設定。有了這樣的自由度,GPT-6 Astra 會把例行實作交給成本較低的子 Agent,自行判斷哪些地方才值得花自己的 token。在 DeepSWE 與 Terminal-Bench 兩項基準測試中,Replit Agent 相較於單獨使用 Astra 達到了 Pareto 最佳:沒有任何已公布的 Astra 基準能在成本更低的情況下拿到更高分數。它也比 sidekick 架構(同樣的配置,但只搭配一個長生命週期的 worker)分別高出 11 分與 16 分。

包含動畫與註腳的完整文章,請見 https://replit.com/blog/free-the-models
為什麼我們減少 scaffolding
每一次模型發布,都會讓原本寫死在 harness 裡的假設失效。
當模型在長跨度任務上越來越強,harness 層就不需要那麼多 scaffolding。實務上,我們觀察到它們更傾向自主委派工作:用子 Agent 來管理上下文、實現平行處理。近期的幾項突破(包括 Navier–Stokes 在內),部分原因正是成功協調了由前沿模型驅動的大量 Agents [[1]](https://openai.com/index/navier-stokes-solution/)。
但前沿能力並不均勻。最強的程式碼模型,未必最擅長設計 UI 或製作 Slides,也不一定是寫 Email 的高手。
因此,我們設計的 harness 會讓每個模型用自己的方式做事,只保留必要的防護機制,並以「最低成本達到目標品質」為原則。
每推出一个新模型,我們就得重新驗證過去深信不疑的作法,並快速實驗那些建立在湧現行為上的技巧。所以,「解放模型」意味著讓它自己決定要思考多深、何時把工作交出去,以及交給誰。

圖 1:核心迴圈在每一步所做的三個決策。
可組合的委派基礎元件
當我們開始嘗試 GPT-6 Astra [[2]](https://openai.com/index/gpt-6-astra) 時,發現這個模型很擅長委派工作。GPT-6 系列也是 OpenAI 第一個支援在單輪對話中途改變 effort、又不會破壞快取的模型。
為了運用這些能力,我們打磨了四個 harness 基礎元件。它們讓核心迴圈在每一步只有少數幾個選項:派出哪種子 Agent、用什麼規模與 effort、是否回到已經交代過任務的子 Agent,以及自己要思考多深:
- 領域感知的子 Agent。 除了通用 worker 之外,harness 也提供專家角色:唯讀 explorer、瀏覽器 tester、reviewer,以及負責 Slides 與 UI 的設計子 Agent,各自搭配專屬的模型與工具。目前仍由 harness 決定有哪些專家;至於何時、如何使用,則由核心迴圈決定。
- 子 Agent 層級與 effort。 分為 small、standard、large,成本與能力逐級提升,每個層級內還有 effort 等級。兩者適用於所有子 Agent,由核心迴圈在每次調度時挑選。舉例來說,機械式的重新命名會交給 low effort 的 small;而為頑固 bug 產生假設,則會交給 high effort 的 large。
- 可重複使用的子 Agent。 核心迴圈可以回到已經交代過任務的子 Agent,不必從頭開始。整個 session 不會只靠一個常駐的 sidekick:各種類型與層級的子 Agent 都能保持待命,由核心迴圈決定喚醒哪一個。OpenAI 新模型的快取保存時間更長,也讓這樣做的成本得以壓低。
- 動態 effort 調整。 既然在某些模型上,中途改變 effort 也能保留快取,我們便訓練了一套升級系統,在每一步檢查執行軌跡,讓 effort 與任務難度相匹配。與 router 不同,它是在對話中途針對進行中的工作即時反應,而不是只在收到請求時判斷一次。
Astra 與 Fable 5.1 [[3]](https://www.anthropic.com/claude-fable-and-mythos-5-1) 的程式碼品質,也讓我們能減少使用 code-review 子 Agent,且評估分數完全沒有下滑。我們從未在任何模型上看過這種工程水準。
新模型會自主委派工作
像 Astra 與 Fable 這類前沿模型,每個 token 的成本更高,跟小模型相比顯得不太划算。但我們觀察到,它們會自然地把工作委派給成本較低的子 Agent,把自己的 token 留給真正需要的決策。
Replit Agent 從不強迫核心迴圈產生子 Agent。表 1 顯示三個模型在正式環境中如何做出這項決定:

表 1:Replit Agent 正式環境中的委派情形,各模型皆採用 medium reasoning effort。
三個模型都會委派,但方式各不相同。在 medium effort 下,Fable 系列很少把工作交給通用 worker:它們會派出唯讀 explorer 與 reviewer,把實作留給自己。Astra 是我們見過第一個會在沒有指示的情況下,主動把工作委派給通用 worker 的模型;而且一旦交代過任務,它往往會回到同一個 worker,而不是另起爐灶。這個回頭率隨著每一代模型不斷上升。

圖 2:根據 trace 繪製的 2026 年 9 月 17 日正式環境對話輪次。核心迴圈調度了一個 explorer、兩個 worker 與一個 tester;在五次 worker 調度中,有三次是回到已經交代過任務的 worker。
結果
我們在 Max 模式(以 Astra 作為核心迴圈的最高品質設定)下,用兩項軟體工程基準測試評估 Replit Agent:DeepSWE 與 Terminal-Bench。比較對象有兩個基準線:一是各排行榜公布的 mini-swe-agent 中單獨使用 Astra 的成績,二是 sidekick 架構——配置完全相同,唯一的差異是把子 Agent 基礎元件換成單一長生命週期 worker。每張圖表都以分數對應每項任務的成本,因此最有效率的配置會落在左上角。
在 DeepSWE v1.1 [[4]](https://deepswe.datacurve.ai/)(測試對活躍開源 repo 的長跨度修改)中,Replit Agent 拿到 72%、每項任務成本 $2.11。mini-swe-agent 中的 Astra 在 low effort 下為 67%、$1.60,xhigh effort 下為 74%、$4.43;sidekick 架構為 61%、$1.34。Terminal-Bench 4.0 [[5]](https://www.tbench.ai/) 測試完全在 shell 中完成的多步驟工作。Replit Agent 達到 49%、每項任務 $2.53;Astra 在 low effort 下為 42%、$2.25,xhigh 下為 60%、$5.86。sidekick 架構則為 33%、$1.84。

Replit Agent 在兩項基準上都勝過 sidekick 架構,分別領先 11 分與 16 分。sidekick 成本較低,但代價是分數掉了六分之一到三分之一。單獨使用 Astra 只有在花更多錢時才能拿到更高分:它的最佳設定比 Replit Agent 高出 2 分與 11 分,成本卻超過兩倍。沒有任何一個基準線能同時在成本與分數上勝出。我們測試的 Replit Agent 就是交付給使用者的版本,提示詞與 harness 都未做任何更動。
harness 設計的殘酷教訓
我們把這些結果視為 Sutton「殘酷教訓」[[6]](http://www.incompleteideas.net/IncIdeas/BitterLesson.html) 的又一次印證。把人類的知識寫進 Agent,短期內有效,長期會遇到瓶頸,最終會被隨算力擴展的通用方法超越。僵化的 harness 會強迫模型照單一方式做事;可組合的 harness 則讓它自己選。模型越聰明,harness 就越不該替它做決定。
相較於規範更嚴格的架構,這種做法為我們帶來三項優勢:
- 押注模型縮放定律。 依賴模型品味來完成的委派,會隨著每次發布持續進步。下一代模型的早期預覽版也延續了這個趨勢。
- 貼合任務需求。 小任務不產生任何子 Agent,搜尋時派出一個 explorer,當建構過程能拆成獨立區塊時就組一支團隊。
- 重用但不持久化。 子 Agent 會保留上下文,以防模型想再找它;但只要模型不需要,就不會有任何東西被留存。
用 Sutton 的話來說,harness 應該讓模型自己摸索如何完成工作,而不是規定「換作是我們會怎麼做」。解放模型吧。
致謝
本文由 Daniel Furman、Jacky Zhao、Vaibhav Kumar、Ed Sioufi 與 Michele Catasta 撰寫。感謝 James Austin、Toby Ho、Preeya Kirani、Zhen Li、Robin Newhouse、Devanshu Sen Pandey、Ibrahim Sheikh、Samuel Spitz、Peter Zhong,以及 Replit AI 團隊的其他成員對本研究的貢獻。如果你想在 Replit 從事 AI 相關工作,我的團隊正在招募人才,歡迎聯繫 pirroh@repl.it。





