**
OpenAI 將 GPT 6 Astra 描述為其迄今為止能力最強、最符合人類意圖的模型。
Greg Brockman 更進一步表示,將 Astra 視為人工通用智慧的早期形式是合理的。
該模型也成為首個跨越 OpenAI 在網路安全領域「關鍵」門檻的模型。根據該公司說法,它能夠在有限的人類指導下,發現先前未知的漏洞並建立可運作的漏洞利用程式。
這些說法雖然引人注目,但它們並非這次發布中最重要的一部分。
真正的改變在於架構。
傳統語言模型會透過一連串固定的 Transformer 區塊傳遞資訊,並生成下一個 token。而 Astra 可以在向用戶顯示一個字詞之前,多次透過相同的計算區塊處理其內部狀態。
它不僅僅是生成更長的思考鏈。
它在回答之前,會花更多時間進行思考。
1 現代語言模型的運作方式
想像你輸入:
聖母峰是...
模型必須預測接下來會出現什麼。
其注意力機制會決定上下文中哪些部分重要。「聖母峰」這個詞會觸發相關概念,例如山脈、海拔、喜馬拉雅山、尼泊爾、西藏、攀登和遠征。
然後,模型會將這些關聯與周圍的上下文結合。在大多數情況下,像「地球上最高的山峰」這樣的接續會變得高度可能。
在傳統的 Transformer 內部,這個表徵會依序通過一系列區塊。每個區塊對其進行一次轉換,然後將結果傳遞給下一個區塊。
如果一個模型包含 40 個區塊,隱藏狀態會依序通過全部 40 個區塊。最終的表徵會被轉換成下一個 token 的機率分佈。
更多的區塊通常意味著更大的計算深度。一個更深的模型可以在確定答案之前執行更多的轉換。
但增加區塊也會增加參數數量、記憶體需求和訓練成本。
通常的假設很簡單:如果你想要一個更深的模型,你需要建立一個更大的層疊堆疊。
循環架構改變了這個原則。
2 循環架構改變了什麼
根據《The Information》的報導,GPT 6 Astra 使用了循環 Transformer 架構。
OpenAI 尚未發布完整的技術規格,因此確切的實作方式仍屬機密。但一般機制已可從公開研究中充分理解。
模型不是只將隱藏狀態通過每個區塊一次,而是可以將結果送回一個計算區塊並再次處理。
將其視為一種內部草稿。
模型產生一個初步表徵,再次通過相同的權重,進行精煉,並重複此過程數次。只有在循環完成後,下一個可見的 token 才會出現。

參數數量保持不變。權重仍留在一個區塊內,計算量隨著循環次數增加,並且只輸出最終的 token。
關鍵細節在於參數數量不一定會增加。
相同的權重在每次傳遞中都被重複使用。
增加的是計算量。
在傳統 Transformer 中,一個 token 會通過一系列不同的區塊。在循環 Transformer 中,它可以多次通過相同的共享結構。
模型透過計算變得更深,而不是透過參數數量變得更大。
這創造了一個新的權衡:
- 更多參數需要更多記憶體
- 更多循環需要更多計算
- 同一個模型可以在不同任務上花費不同數量的計算
最後一點尤其重要。計算深度可以在不建立新模型的情況下改變。
3 循環深度如何訓練
僅僅將一個 Transformer 區塊放入循環中是不夠的。
如果一個模型在訓練期間總是執行恰好 32 次傳遞,它可能會學會依賴每個步驟的位置。第一次傳遞可能學習一個功能,第十次另一個,而第三十二次可能變成一個固定的輸出層。
結果將是一個偽裝成循環的傳統 32 層網路。
研究人員透過在訓練期間改變循環傳遞的次數來解決這個問題。
最清晰的示範之一來自循環深度模型 Huginn。其創建者訓練了一個約 35 億參數的網路,使用了約 8000 億個 token。
在每個訓練步驟中,循環次數從一個平均值接近 32 的分佈中取樣。一個樣本可能接收 4 次傳遞,另一個 17 次,另一個 40 次,另一個接近 90 次。
模型無法事先知道哪一次傳遞將是最後一次。
因此,它必須學習比固定操作序列更通用的東西。
它必須學習如何改善其當前的內部狀態。

arXiv 上循環深度論文的摘要
透過數十個循環步驟進行訓練會產生另一個問題:記憶體。
標準的反向傳播需要儲存來自每個循環的中間激活值。當重複次數足夠多時,記憶體成本會變得巨大。
Huginn 的研究人員使用了一個實用的折衷方案。前向傳播可以運行多個循環,但梯度僅透過最後八次計算。
較早的傳播仍然影響最終結果,但它們完整的激活歷史不必保留在記憶體中。
這類似於截斷的反向傳播通過時間。不同之處在於,循環發生在計算深度上,而不是序列中的詞語之間。

循環次數在每個訓練步驟中被取樣,而梯度僅透過最後八次傳播計算。
模型並非被教導要執行一個固定的 32 次操作序列。
它被教導的是,無論過程何時停止,都要將其隱藏狀態移向一個有用的答案。
這改變了深度的意義。
深度不再僅僅是工程師在訓練前選擇的一個屬性。它可以成為推理過程中的一個變數。
4 推理過程中的自適應計算
目前大多數的推理控制都作用於可見 token 的層級。
如果要求模型思考更久,它會生成更長的思考鏈,使用更多的輸出 token,或建立額外的中間文字。
循環架構提供了一種不同的機制。
內部傳遞的次數可以在不修改權重、也不強迫模型撰寫更長解釋的情況下改變。
一個簡單的任務可能只需要 4 次循環。
一個困難的數學證明可能需要 32 次。
一個複雜的編碼問題可能需要 64 次。
模型保持不變。只有內部計算量發生變化。

權重保持固定。只有用於處理每個 token 的內部傳遞次數發生變化。
公開的循環深度實驗已經顯示出預期的模式。
在前幾次循環中,效能提升很快。之後的增益變小,直到曲線接近平穩。
這表明隱藏狀態正在收斂。
早期的傳遞進行大幅修正。後期的傳遞則精煉較小的細節。最終,額外的計算不再產生有意義的改進。
未來的系統可以自動檢測那個時刻。
模型不是為每個提示分配固定的循環次數,而是可以持續處理,直到其隱藏狀態變得足夠穩定。簡單的 token 會很便宜。困難的 token 會獲得更多計算。
這將創造真正的自適應計算深度。
思考更久不再意味著必須寫更多。
5 研究與早期實務成果
重複使用 Transformer 層並不是一個新想法。
Universal Transformers 在 2018 年引入了循環處理。ALBERT 透過跨層共享權重來減少參數數量。Mixture of Recursions 則探索了將 token 路由到不同計算量的方法。
開源的 Nanbeige4.2 3B 模型提供了一個特別直接的例子。
其配置包含 22 層和 num_loops: 2。實際上,模型會兩次通過這些層。它大約具有 22 層網路的參數數量,但大約具有 44 層網路的計算深度。

Hugging Face 上的 Nanbeige4.2 3B 配置
二十二層,num_loops: 2,以及 Apache 2.0 授權。這個機制在一個開源模型配置中已經可見。
多年來,循環 Transformer 設計一直是有趣的研究想法,而非主流方法。
缺少的要素是強有力的擴展證據。
9 月 1 日,一群研究人員發表了 SMELT,這是一項旨在比較循環 Transformer 和傳統 Transformer 在匹配條件下表現的研究。
他們控制了參數數量、訓練計算量和 KV 快取大小。在這些限制條件下,循環模型需要減少 6.8% 到 18% 的訓練計算量才能達到相同的效能水準。
最大的增益出現在程式碼方面。

arXiv 上 SMELT 論文的摘要
在計算量、參數和 KV 快取匹配的情況下,循環節省了 6.8% 到 18% 的訓練計算量,其中程式碼方面的增益最強。
研究人員還觀察到注意力行為的變化。
在傳統 Transformer 中,序列中最早的 token 通常會成為注意力匯集點。即使它們的語義重要性有限,它們也會獲得不成比例的注意力。
在第二次通過相同區塊後,模型的注意力轉向了更相關的 token。
第二次循環不僅僅是重複第一次。它將第一次循環的結果作為更選擇性處理的基礎。
SMELT 並未證明每個未來的模型都應該是循環的。但它確實顯示,在主要實驗條件匹配後,循環仍然具有競爭力。
問題不再是循環深度是否可行。
問題是它能擴展到什麼程度。
6 可解釋性與控制
使循環具有吸引力的相同架構特徵,也使模型監控變得複雜。
使用明確的思考鏈推理時,至少有一些中間步驟會以可讀文字的形式出現。研究人員可以檢查它們,搜尋可疑模式,並將陳述的推理與最終答案進行比較。
循環模型可以在隱藏激活值內部執行更多處理,而不產生任何文字。
Buck Shlegeris 和 Ryan Greenblatt 認為,這可能會降低思考鏈監控的用處。如果更多處理轉移到隱藏計算中,可見的解釋可能較少揭示模型是如何得出結果的。
Sebastian Raschka 提出了一個重要的反駁觀點。
重複使用權重並不會自動創造秘密或無法存取的認知。內部激活值仍然可以透過可解釋性工具進行研究。主要區別在於,模型可能需要更少的可見中間 token,因為在生成開始之前已經發生了更多計算。
OpenAI 首席科學家 Jakub Pachocki 也表示,Astra 的計算圖深度大致維持在 GPT 4 深度的兩倍以內,並且循環被刻意限制以保留監控能力。
這表明這是一個受限制的實作,而非無限的循環過程。
首先,思考鏈並不能保證是模型內部計算的忠實記錄。系統因產生有用的答案而獲得獎勵,而非提供每個隱藏操作的科學準確報告。
涉及 OpenAI、Anthropic 和 Google DeepMind 的研究表明,模型的解釋可能遺漏重要因素,在事後合理化決策,或呈現一條比實際影響結果的路徑更清晰的路徑。
循環架構使這個區別更難被忽視。
可見的推理可能只是一個介面。
主要的計算可能在任何文字出現之前,就在模型內部發生了。
7 GPT 6 Astra 的成果
GPT 6 Astra 最引人注目的基準測試結果是在 ARC AGI 3 上獲得了 99.9% 的分數。
這個數字聽起來幾乎是終極的,但它在很大程度上取決於測試的執行方式。
Simon Willison 強調,99.9% 的結果來自 OpenAI 的自訂 Provider Adapter 測試框架。在標準的 ARC Prize 測試框架下,同一個模型得分為 62.7%。
模型沒有改變。
改變的是評估環境。

同一個模型在兩種不同的運行成本下產生了兩個不同的分數。
OpenAI 的運行成本約為 19,000 美元。標準運行成本約為 26,000 美元。
顯著更高的分數也是由成本更低的設定產生的。
這並不一定使結果無效。自訂的 adapter 可能與模型互動得更有效,或者揭示了通用評估框架可能遺漏的能力。
但頭條數字不能脫離產生它的條件來解釋。

GPT 6 Astra 在 ARC AGI 3 上的表現
一個模型,兩種評估框架,差距達 37.2 個百分點。
其他評估則沒有那麼戲劇性。
在 Artificial Analysis Intelligence Index 上,Astra 的得分大致與 GPT 5.6 Sol 相當,比 Claude Fable 5.1 低約五分。
其實際優勢可能在於代理任務上的效率,它能夠以較低成本達到具有競爭力的效能。
基準測試顯示了模型能達到什麼。架構則有助於解釋這些能力從何而來以及它們可能如何發展。
8 這對 AI 的未來意味著什麼
多年來,擴展語言模型主要意味著增加參數、增加數據,以及建立更大的固定 Transformer 區塊堆疊。
每一代新模型都變得更大、更昂貴、運行要求更高。
GPT 6 Astra 指向了另一條路徑。
一個模型可以重複使用相同的參數,為困難任務分配更多計算,並在產生第一個字詞之前精煉其內部表徵。
這將模型大小與其推理深度分離開來。
系統不是遵循一條固定的計算路徑,而是可以根據特定問題的難度來調整工作量。
這可能同時改變模型效能和使用 AI 的經濟性。同一個智慧體可以為簡單請求以快速且低成本模式運行,然後在任務真正需要更多推理時增加其計算深度。
循環正在回歸語言模型。這一次,它主要不是作用於詞語之間,而是作用於創造詞語的內部過程。
下一代系統可能不僅僅因為包含更多參數而變得更強大。
它們的決定性優勢可能在於知道何時已經找到了一個好的答案,以及何時值得在內部循環中再跑一圈。
資料來源
- OpenAI 發布 GPT 6 Astra 的公告
- Greg Brockman 談 GPT 6 Astra 與 AGI
- GPT 6 Astra 與關鍵網路安全門檻
- Ilya Sutskever 推薦的深度學習閱讀清單
- The Verge 關於 Astra 和循環 Transformer 的報導
- 透過潛在推理擴展測試時計算
- 遞迴混合
- Hugging Face 上的 Nanbeige4.2 3B
- SMELT:計算匹配 MoE 循環 Transformer 的擴展定律
- AI 安全專家對 Astra 推理架構的擔憂
- Sebastian Raschka 對 Astra 和循環 Transformer 的分析
- 思考鏈的可監控性
- Simon Willison 對 GPT 6 Astra 的分析





