GPT 6 Astra 究竟是如何思考的

@Mikadzyki_NFT
英語2026年9月08日
955K
83
16
16
142

TL;DR

GPT 6 Astra 引入了一種循環 Transformer 架構,允許模型重複使用權重並在輸出文字前多次處理內部狀態。這將參數數量與計算深度解耦,從而在推論過程中實現了自適應計算。

**

OpenAI 將 GPT 6 Astra 描述為其迄今為止能力最強、最符合人類意圖的模型。

Greg Brockman 更進一步表示,將 Astra 視為人工通用智慧的早期形式是合理的。

該模型也成為首個跨越 OpenAI 在網路安全領域「關鍵」門檻的模型。根據該公司說法,它能夠在有限的人類指導下,發現先前未知的漏洞並建立可運作的漏洞利用程式。

這些說法雖然引人注目,但它們並非這次發布中最重要的一部分。

真正的改變在於架構。

傳統語言模型會透過一連串固定的 Transformer 區塊傳遞資訊,並生成下一個 token。而 Astra 可以在向用戶顯示一個字詞之前,多次透過相同的計算區塊處理其內部狀態。

它不僅僅是生成更長的思考鏈。

它在回答之前,會花更多時間進行思考。

1 現代語言模型的運作方式

想像你輸入:

聖母峰是...

模型必須預測接下來會出現什麼。

其注意力機制會決定上下文中哪些部分重要。「聖母峰」這個詞會觸發相關概念,例如山脈、海拔、喜馬拉雅山、尼泊爾、西藏、攀登和遠征。

然後,模型會將這些關聯與周圍的上下文結合。在大多數情況下,像「地球上最高的山峰」這樣的接續會變得高度可能。

在傳統的 Transformer 內部,這個表徵會依序通過一系列區塊。每個區塊對其進行一次轉換,然後將結果傳遞給下一個區塊。

如果一個模型包含 40 個區塊,隱藏狀態會依序通過全部 40 個區塊。最終的表徵會被轉換成下一個 token 的機率分佈。

更多的區塊通常意味著更大的計算深度。一個更深的模型可以在確定答案之前執行更多的轉換。

但增加區塊也會增加參數數量、記憶體需求和訓練成本。

通常的假設很簡單:如果你想要一個更深的模型,你需要建立一個更大的層疊堆疊。

循環架構改變了這個原則。

2 循環架構改變了什麼

根據《The Information》的報導,GPT 6 Astra 使用了循環 Transformer 架構。

OpenAI 尚未發布完整的技術規格,因此確切的實作方式仍屬機密。但一般機制已可從公開研究中充分理解。

模型不是只將隱藏狀態通過每個區塊一次,而是可以將結果送回一個計算區塊並再次處理。

將其視為一種內部草稿。

模型產生一個初步表徵,再次通過相同的權重,進行精煉,並重複此過程數次。只有在循環完成後,下一個可見的 token 才會出現。

Mikadzyki🌙 - inline image

參數數量保持不變。權重仍留在一個區塊內,計算量隨著循環次數增加,並且只輸出最終的 token。

關鍵細節在於參數數量不一定會增加。

相同的權重在每次傳遞中都被重複使用。

增加的是計算量。

在傳統 Transformer 中,一個 token 會通過一系列不同的區塊。在循環 Transformer 中,它可以多次通過相同的共享結構。

模型透過計算變得更深,而不是透過參數數量變得更大。

這創造了一個新的權衡:

  • 更多參數需要更多記憶體
  • 更多循環需要更多計算
  • 同一個模型可以在不同任務上花費不同數量的計算

最後一點尤其重要。計算深度可以在不建立新模型的情況下改變。

3 循環深度如何訓練

僅僅將一個 Transformer 區塊放入循環中是不夠的。

如果一個模型在訓練期間總是執行恰好 32 次傳遞,它可能會學會依賴每個步驟的位置。第一次傳遞可能學習一個功能,第十次另一個,而第三十二次可能變成一個固定的輸出層。

結果將是一個偽裝成循環的傳統 32 層網路。

研究人員透過在訓練期間改變循環傳遞的次數來解決這個問題。

最清晰的示範之一來自循環深度模型 Huginn。其創建者訓練了一個約 35 億參數的網路,使用了約 8000 億個 token。

在每個訓練步驟中,循環次數從一個平均值接近 32 的分佈中取樣。一個樣本可能接收 4 次傳遞,另一個 17 次,另一個 40 次,另一個接近 90 次。

模型無法事先知道哪一次傳遞將是最後一次。

因此,它必須學習比固定操作序列更通用的東西。

它必須學習如何改善其當前的內部狀態。

Mikadzyki🌙 - inline image

arXiv 上循環深度論文的摘要

透過數十個循環步驟進行訓練會產生另一個問題:記憶體。

標準的反向傳播需要儲存來自每個循環的中間激活值。當重複次數足夠多時,記憶體成本會變得巨大。

Huginn 的研究人員使用了一個實用的折衷方案。前向傳播可以運行多個循環,但梯度僅透過最後八次計算。

較早的傳播仍然影響最終結果,但它們完整的激活歷史不必保留在記憶體中。

這類似於截斷的反向傳播通過時間。不同之處在於,循環發生在計算深度上,而不是序列中的詞語之間。

Mikadzyki🌙 - inline image

循環次數在每個訓練步驟中被取樣,而梯度僅透過最後八次傳播計算。

模型並非被教導要執行一個固定的 32 次操作序列。

它被教導的是,無論過程何時停止,都要將其隱藏狀態移向一個有用的答案。

這改變了深度的意義。

深度不再僅僅是工程師在訓練前選擇的一個屬性。它可以成為推理過程中的一個變數。

4 推理過程中的自適應計算

目前大多數的推理控制都作用於可見 token 的層級。

如果要求模型思考更久,它會生成更長的思考鏈,使用更多的輸出 token,或建立額外的中間文字。

循環架構提供了一種不同的機制。

內部傳遞的次數可以在不修改權重、也不強迫模型撰寫更長解釋的情況下改變。

一個簡單的任務可能只需要 4 次循環。

一個困難的數學證明可能需要 32 次。

一個複雜的編碼問題可能需要 64 次。

模型保持不變。只有內部計算量發生變化。

Mikadzyki🌙 - inline image

權重保持固定。只有用於處理每個 token 的內部傳遞次數發生變化。

公開的循環深度實驗已經顯示出預期的模式。

在前幾次循環中,效能提升很快。之後的增益變小,直到曲線接近平穩。

這表明隱藏狀態正在收斂。

早期的傳遞進行大幅修正。後期的傳遞則精煉較小的細節。最終,額外的計算不再產生有意義的改進。

未來的系統可以自動檢測那個時刻。

模型不是為每個提示分配固定的循環次數,而是可以持續處理,直到其隱藏狀態變得足夠穩定。簡單的 token 會很便宜。困難的 token 會獲得更多計算。

這將創造真正的自適應計算深度。

思考更久不再意味著必須寫更多。

5 研究與早期實務成果

重複使用 Transformer 層並不是一個新想法。

Universal Transformers 在 2018 年引入了循環處理。ALBERT 透過跨層共享權重來減少參數數量。Mixture of Recursions 則探索了將 token 路由到不同計算量的方法。

開源的 Nanbeige4.2 3B 模型提供了一個特別直接的例子。

其配置包含 22 層和 num_loops: 2。實際上,模型會兩次通過這些層。它大約具有 22 層網路的參數數量,但大約具有 44 層網路的計算深度。

Mikadzyki🌙 - inline image

Hugging Face 上的 Nanbeige4.2 3B 配置

二十二層,num_loops: 2,以及 Apache 2.0 授權。這個機制在一個開源模型配置中已經可見。

多年來,循環 Transformer 設計一直是有趣的研究想法,而非主流方法。

缺少的要素是強有力的擴展證據。

9 月 1 日,一群研究人員發表了 SMELT,這是一項旨在比較循環 Transformer 和傳統 Transformer 在匹配條件下表現的研究。

他們控制了參數數量、訓練計算量和 KV 快取大小。在這些限制條件下,循環模型需要減少 6.8% 到 18% 的訓練計算量才能達到相同的效能水準。

最大的增益出現在程式碼方面。

Mikadzyki🌙 - inline image

arXiv 上 SMELT 論文的摘要

在計算量、參數和 KV 快取匹配的情況下,循環節省了 6.8% 到 18% 的訓練計算量,其中程式碼方面的增益最強。

研究人員還觀察到注意力行為的變化。

在傳統 Transformer 中,序列中最早的 token 通常會成為注意力匯集點。即使它們的語義重要性有限,它們也會獲得不成比例的注意力。

在第二次通過相同區塊後,模型的注意力轉向了更相關的 token。

第二次循環不僅僅是重複第一次。它將第一次循環的結果作為更選擇性處理的基礎。

SMELT 並未證明每個未來的模型都應該是循環的。但它確實顯示,在主要實驗條件匹配後,循環仍然具有競爭力。

問題不再是循環深度是否可行。

問題是它能擴展到什麼程度。

6 可解釋性與控制

使循環具有吸引力的相同架構特徵,也使模型監控變得複雜。

使用明確的思考鏈推理時,至少有一些中間步驟會以可讀文字的形式出現。研究人員可以檢查它們,搜尋可疑模式,並將陳述的推理與最終答案進行比較。

循環模型可以在隱藏激活值內部執行更多處理,而不產生任何文字。

Buck Shlegeris 和 Ryan Greenblatt 認為,這可能會降低思考鏈監控的用處。如果更多處理轉移到隱藏計算中,可見的解釋可能較少揭示模型是如何得出結果的。

Sebastian Raschka 提出了一個重要的反駁觀點。

重複使用權重並不會自動創造秘密或無法存取的認知。內部激活值仍然可以透過可解釋性工具進行研究。主要區別在於,模型可能需要更少的可見中間 token,因為在生成開始之前已經發生了更多計算。

OpenAI 首席科學家 Jakub Pachocki 也表示,Astra 的計算圖深度大致維持在 GPT 4 深度的兩倍以內,並且循環被刻意限制以保留監控能力。

這表明這是一個受限制的實作,而非無限的循環過程。

首先,思考鏈並不能保證是模型內部計算的忠實記錄。系統因產生有用的答案而獲得獎勵,而非提供每個隱藏操作的科學準確報告。

涉及 OpenAI、Anthropic 和 Google DeepMind 的研究表明,模型的解釋可能遺漏重要因素,在事後合理化決策,或呈現一條比實際影響結果的路徑更清晰的路徑。

循環架構使這個區別更難被忽視。

可見的推理可能只是一個介面。

主要的計算可能在任何文字出現之前,就在模型內部發生了。

7 GPT 6 Astra 的成果

GPT 6 Astra 最引人注目的基準測試結果是在 ARC AGI 3 上獲得了 99.9% 的分數。

這個數字聽起來幾乎是終極的,但它在很大程度上取決於測試的執行方式。

Simon Willison 強調,99.9% 的結果來自 OpenAI 的自訂 Provider Adapter 測試框架。在標準的 ARC Prize 測試框架下,同一個模型得分為 62.7%。

模型沒有改變。

改變的是評估環境。

Mikadzyki🌙 - inline image

同一個模型在兩種不同的運行成本下產生了兩個不同的分數。

OpenAI 的運行成本約為 19,000 美元。標準運行成本約為 26,000 美元。

顯著更高的分數也是由成本更低的設定產生的。

這並不一定使結果無效。自訂的 adapter 可能與模型互動得更有效,或者揭示了通用評估框架可能遺漏的能力。

但頭條數字不能脫離產生它的條件來解釋。

Mikadzyki🌙 - inline image

GPT 6 Astra 在 ARC AGI 3 上的表現

一個模型,兩種評估框架,差距達 37.2 個百分點。

其他評估則沒有那麼戲劇性。

在 Artificial Analysis Intelligence Index 上,Astra 的得分大致與 GPT 5.6 Sol 相當,比 Claude Fable 5.1 低約五分。

其實際優勢可能在於代理任務上的效率,它能夠以較低成本達到具有競爭力的效能。

基準測試顯示了模型能達到什麼。架構則有助於解釋這些能力從何而來以及它們可能如何發展。

8 這對 AI 的未來意味著什麼

多年來,擴展語言模型主要意味著增加參數、增加數據,以及建立更大的固定 Transformer 區塊堆疊。

每一代新模型都變得更大、更昂貴、運行要求更高。

GPT 6 Astra 指向了另一條路徑。

一個模型可以重複使用相同的參數,為困難任務分配更多計算,並在產生第一個字詞之前精煉其內部表徵。

這將模型大小與其推理深度分離開來。

系統不是遵循一條固定的計算路徑,而是可以根據特定問題的難度來調整工作量。

這可能同時改變模型效能和使用 AI 的經濟性。同一個智慧體可以為簡單請求以快速且低成本模式運行,然後在任務真正需要更多推理時增加其計算深度。

循環正在回歸語言模型。這一次,它主要不是作用於詞語之間,而是作用於創造詞語的內部過程。

下一代系統可能不僅僅因為包含更多參數而變得更強大。

它們的決定性優勢可能在於知道何時已經找到了一個好的答案,以及何時值得在內部循環中再跑一圈。

資料來源

一鍵儲存

使用 YouMind AI 深度閱讀爆款文章

保存原文、追問細節、總結觀點,並在一個 AI 工作空間裡把爆款文章沉澱成可複用筆記。

了解 YouMind
寫給創作者

把你的 Markdown 變成乾淨的 𝕏 文章

圖片上傳、表格、程式碼區塊,往 𝕏 上手動重排太痛苦。YouMind 把整篇 Markdown 一鍵轉成乾淨、可直接發佈的 𝕏 文章草稿。

試試 Markdown 轉 𝕏

更多可拆解樣本

近期爆款文章

探索更多爆款文章