GPT-6 Astra 完整指南

@MakeAI_CEO
日語2026年9月03日
418K
477
42
3
610

TL;DR

GPT-6 Astra 標誌著向自主 Agent 的轉變,這些 Agent 能夠執行複雜的電腦操作並完成多步驟任務。本指南探討了其技術規格、安全風險以及如何將其整合到專業工作流程中。

超越「98% AGI」:邁向能完成完整工作的 AI

2026 年 9 月 3 日,OpenAI 發表了 GPT-6 Astra。

發表後,眾人目光立刻聚焦於其分數:在困難的數學基準「FrontierMath」上約 98%,在衡量電腦操作的「ARC-AGI-3」上達 99.9%,在網路安全評估「ExploitBench」上則為 100%。

單看這些數字,或許會讓人想說:「近乎完美的 AI 來了」或「AGI 終於完成了」。

然而,僅憑基準分數來評斷 GPT-6 Astra 是危險的。

Astra 的改變不僅僅是針對問題回傳更正確的文字。

它會開啟瀏覽器、閱讀文件、執行程式碼、更新試算表、操作網站,若中途失敗還會調查原因,最終帶回可供審查的成果。

傳遞給 ChatGPT 的工作單位,已從「單一問題」轉變為「一系列商業操作」。

如果你像使用傳統 ChatGPT 那樣,只用 Astra 來撰寫電子郵件草稿或文字摘要,那它仍然只是個昂貴的文字生成 AI。當你將過去人類需要切換多個畫面、視為一體化流程來處理的任務交給它時,它的價值才會顯現。(OpenAI

在這篇文章中,我們將深入探討官方功能介紹之外的內容,包括海外公司確認的案例、如何解讀基準測試、與 Claude 的比較、定價、安全性,以及為日本企業實際使用而設計的方針。

什麼是 GPT-6 Astra?

GPT-6 Astra 被 OpenAI 定位為 GPT-6 世代的頂級模型,被描述為「最聰明且最一致的模型」。

發表時,它首先向特定組織推出,隨後陸續提供給 ChatGPT Plus、Pro、Business、Enterprise、API 以及 Amazon Bedrock。在 Enterprise 中,預設為關閉狀態,需由管理員啟用,官方公告中並未明確提及免費方案的發布時間。

API 上的模型名稱為 gpt-6-astra。使用更高運算量的 Astra Pro 也正針對 Pro、Business 和 Enterprise 用戶推出。(OpenAI

主要規格整理如下:

項目

GPT-6 Astra

上下文長度

1,050,000 tokens

最大輸出

128,000 tokens

知識截止日期

2026 年 4 月 30 日

輸入

文字、圖片(原生)

輸出

文字(原生)

推理等級

low / medium / high / xhigh / max

API 輸入價格

每 1M tokens 10 美元

API 輸出價格

每 1M tokens 50 美元

快取輸入

每 1M tokens 1 美元

微調

不支援

主要工具

網路搜尋、檔案搜尋、程式碼執行、Shell、電腦操作、MCP、圖片生成等

雖然可以讀取圖片,但模型的原生輸出是文字。圖片生成是透過呼叫單獨的工具來執行。它並非直接處理音訊或影片輸入的模型。

此外,對於超過 272,000 tokens 的長輸入,整個請求會套用價格倍率。輸入和快取費用會加倍,輸出費用則為 1.5 倍。僅僅因為它能容納 105 萬 tokens,並不代表你每次都該把所有內部文件塞進去;在準確度下降之前,成本效益會先暴跌。

Astra 帶來了哪些改變?

  1. 電腦操作從「輔助」躍升為主戰場

Astra 的核心是「Computer Use」。

過去的 AI 可以在瀏覽器上點擊按鈕或填寫表單。然而,問題依然存在:畫面佈局稍微改變就會停止、無法從中途錯誤中恢復、或在跨越多個網站的任務中失去目標。

GPT-6 Astra 在衡量實際桌面環境操作的 OSWorld 2.0 上記錄了 72.6%。GPT-5.6 Sol 則為 65.7%。

此外,Astra 處理此評估約需 40 分鐘,而 Sol 則需約 75 分鐘。不僅成功率提升,處理時間也減少了約 47%。在尋找螢幕上目標的 ScreenSpot 中,Astra 得分為 92.7%,而 Sol 為 76.9%。(OpenAI

這不僅僅是流暢的示範影片。它針對的任務包括:

  • 搜尋符合條件的醫院或房產,並比較候選項目。
  • 從多個管理畫面擷取值以建立報告。
  • 將客戶資訊輸入 CRM 並更新狀態。
  • 登入網路服務檢查設定。
  • 在瀏覽器中執行已建立的應用程式並修復錯誤。
  • 在參考多個檔案的同時完成試算表或簡報。

在 Mind2Web 中,使用更新版 Codex harness 的 Astra 處理網路任務的速度比先前模型快 1.9 倍。

這裡的重點是,效能是由「整個 harness」(包括瀏覽器、工具、執行環境和驗證流程)決定的,而不僅僅是模型的智慧。單純選擇 Astra 這個名稱並不能自動自動化所有螢幕操作。(OpenAI

  1. 維持 105 萬 Token 長上下文直到最後

GPT-6 Astra 的上下文長度約為 105 萬 tokens。它有能力一次處理合約、會議記錄、設計文件、原始碼和過去的研究。然而,「容納」和「準確使用」是兩回事。

在尋找長文中資訊的 MRCR 評估中,Astra 在 256k–512k 範圍內達到 100%,在 512k–1M 範圍內達到 96.3%。GPT-5.6 Sol 在後者的結果為 73.8%。

雖然 Astra 在長上下文方面表現強勁,但當你放入 100 萬 tokens 時,它並不會完美記住每一個單字。在 1M token 區間,它仍有約 3.7% 的失敗率。應避免將關鍵條件僅放在龐大文件中的某個位置;你必須明確地分別陳述目標、限制條件和核准條件。(OpenAI

Astra 還具有增強長時間會話連續性的機制,例如:在等待工具時執行其他任務的非同步工具呼叫、允許人類在執行過程中修正方向的引導(steering),以及即使在對話中更改推理等級也能維持快取。

它正從「寫好完美提示詞後就放任不管」,轉向「檢查進度並修正方向」的工作流程。(OpenAI Developers

  1. 建立完成的成果,而非僅是文字

Astra 加強了建立試算表、簡報、文件、應用程式和研究報告等成果的能力。過去的模型可以建立「簡報大綱」,但人類必須將其轉移到 PowerPoint、調整設計、重新驗證數字並加入連結。Astra 的目標是更上一層樓:閱讀資料或公司範本、整理數字、建立簡報/試算表、在瀏覽器中檢查,並提交修正後的檔案。

早期採用者 Higgsfield 表示,它可以用比現有模型少 20% 的 tokens 來處理 Agent 任務。Harvey 讚揚其在法律工作中的判斷力,Jane Street 指出在處理複雜技術問題時減少了來回溝通的次數,而 Lovable 則看重其在高推理設定下的迭代/測試能力。

然而,這些是早期客戶的推薦,並非來自獨立第三方重現測試的證據。(OpenAI

  1. 在長時間任務中較不易「忘記目標」

傳統的 Agent 有時會偏離一開始制定的計畫——在應該實作功能時卻沉迷於次要的重構,或者最終只停留在資訊收集而沒有做出最終決定。Astra 改善了長時間工作的穩定性。

另一方面,官方開發者文件指出,Astra 可能會停下來詢問釐清問題、過度格式化細節、重複表達,或進行超出必要的測試。

換句話說,更高的效能並不代表你可以給出模糊的指令。你應該比以前更清楚地設定目標、完成條件、提問的標準以及需要核准的操作。(OpenAI Developers

基準測試表現驚人,但並非「所有領域的世界最佳」

Astra 的公告中包含了令人矚目的數字:FrontierMath 97.6%、ARC-AGI-3 99.9%、ExploitBench 100%。這些是重大的進步,但我們必須區分衡量目標和執行條件。

電腦操作與商業自動化顯著成長

在接近實際商業任務的 AutomationBench 中,Astra 得分為 41.4%。GPT-5.6 Sol 為 18.1%,Claude Fable 5.1 為 31.4%。在 CAD 相關任務的 BenchCAD 中,Astra 為 95.9%,Sol 為 83.3%,Fable 5.1 為 84.3%。在網路研究的 BrowseComp 中,Astra 為 91.5%,Sol 為 90.4%,Claude Opus 5 為 90.8%。Astra 在此領先,但與 Sol 和 Opus 的差距很小。

Astra 的優勢最明顯體現在結合螢幕操作、檔案處理、資料分析和驗證的複雜複合任務上,而非僅僅是找到單一搜尋結果。(OpenAI

程式碼能力強,但尚未完全超越 Claude

在 Terminal-Bench 中,Astra 得分為 57.7%,超越了 Sol(37.3%)和 Fable 5.1(55.8%)。在內部資料庫遷移評估中,Astra 為 63.9%,而 Sol 為 42.7%。在讀取現有系統並在不破壞的情況下進行修改方面,有明顯的改進。

然而,在 Artificial Analysis Coding Agent Index 中,Astra 為 67.0,Claude Fable 5 為 67.2,Claude Opus 5 為 68.1。在 FrontierCode Extended 中,Astra 為 64.5,而 Fable 5 為 64.9。在 Main 評估中,Astra 為 53.3,Fable 5 為 53.5,Opus 5 為 53.4。

Astra 在程式碼領域屬於頂尖梯隊,但並未在每個程式碼評估中都超越 Claude。(OpenAI

學術推理方面仍有弱點

儘管 FrontierMath 達到 97.6%,Astra 在衡量廣泛專業知識和推理的「Humanity's Last Exam」中得分為 57.2%。Claude Fable 5.1 為 65.0%,Fable 5 為 63.8%,Opus 5 為 63.6%。在 Artificial Analysis Intelligence Index 中,Astra 為 61.2,而 Fable 5.1 為 65.7,Opus 5 為 63.1。

「因為 FrontierMath 達到 98%,所以它理解幾乎所有學術領域」的解釋並不成立。根據評估方式的不同,Claude 在某些領域仍能產出更高的結果。(OpenAI

99.9% 的背後是專用的執行環境

ARC-AGI-3 的 99.9% 令人震驚,但這並非單純將問題輸入 Astra 就能獲得的。OpenAI 使用 Responses API 的 harness 執行,並修改了兩項設定以使其更接近實際使用效能。雖然 OpenAI 解釋這些並非針對基準測試的特定設定,但這並非模型單獨的零樣本(zero-shot)結果。

此外,公佈的值是多個推理設定中的最高結果。無法保證在標準 ChatGPT 中每次都能重現相同的效能。(OpenAI

在發表時的 Artificial Analysis 綜合評分中,Astra 的總分為 61,在 202 個模型中排名第 8。同時,其輸入價格為 10 美元(中位數為 2 美元),輸出價格為 50 美元(中位數為 10 美元)。

它無疑是最好的模型之一,但並非一個可以無視價格、什麼任務都丟給它的模型。(Artificial Analysis

海外案例 1:Legora 在數分鐘內核對 41 份文件

提供歐洲法律 AI 的 Legora 展示了 Astra 的實際價值。他們將 Astra 用於財務報表中的「tie-out」核對,即同一數字出現在文字、註釋、表格和過往文件中。Legora 在單次 Agent 運行中處理了 41 份文件,這項人類需要數小時或數天才能完成的任務,僅在幾分鐘內就完成了。

在測試中,他們故意植入了 4 個錯誤。Astra 全部找到,包括收入註釋中 50 萬英鎊的差異。它在保持先前模型準確性的同時,進行了約 50 次更正確的檢查。(OpenAI

然而,約 40% 的改進是針對此特定工作流程。在 Legora 更廣泛的 BAR 任務中,平均改進約為 3%。Astra 並不能將所有法律工作均勻提升 40%;它擅長交叉比對大量文件以找出不一致之處。

最終判斷仍由人類法律專家負責。AI 負責縮小人類應閱讀的範圍,並比對不一致的證據。(OpenAI

海外案例 2:Playco 將手動修復減少 50%

遊戲公司 Playco 使用「Playbot」(一個用於 Unity 和 Godot 的開發 Agent)測試了 Astra。Playbot 可以編輯場景、遊玩遊戲、驗證行為並修復問題。Playco 讓它同時建立三個不同主題的原型。雖然並非「完美的一次到位」,但他們報告稱,與先前模型相比,人類手動修復減少了 50%。

在空間感知、重現參考圖片、響應式 UI、遊戲感以及錯誤檢測方面都有所改進。(OpenAI

Astra 的優勢不僅在於「一次寫對程式碼」,更在於能夠執行遊戲、檢查顯示、操作它、發現問題、修復問題並再次嘗試——模仿人類開發者的迭代過程。

海外案例 3:將停滯的功能推進到 90% 完成度

產品開發者 Claire Vo 分享了將 Astra 用於其服務 ChatPRD 的結果。一個因複雜的 CRM 操作和 UI 實作而停滯了 6 個月的產品智慧功能,在單次 Astra 會話中達到了約 90% 的完成度。

她還測試了透過 CLI 控制硬體(Divoom MiniToo)、Mac 訊息應用程式以及 Blender 中的 3D 資產。(Lenny's Newsletter

雖然這些是早期合作夥伴自行報告的成功案例,但它們顯示了一個一致的趨勢:Astra 在操作外部服務、讀取現有程式碼和完成成果方面能發揮作用。

科學突破:解決長期存在的問題

OpenAI 報告稱,使用 Astra 解決或顯著推進了數學和理論電腦科學領域的 10 個未解決問題。該模型生成論證,人類研究人員整理草稿,然後同一個模型使用 Lean 進行形式化驗證。

根據 OpenAI 的說法,這項研究的總 token 成本(按 GPT-5.6 Sol 等效價格計算)約為 2,000 美元。其中一個例子涉及更新質數間隙(prime gaps)的界限,這是某個術語在 80 多年來未曾改進的領域。(OpenAI

為什麼 Astra 是「最安全」卻也「最難監控」的

GPT-6 Astra 是 OpenAI 分類中首個達到網路安全能力「Critical」閾值的廣泛部署模型。在獲得工具和存取權限的情況下,它可以發現未知漏洞,並在沒有人類逐步指導的情況下,針對受防禦的系統建立攻擊程序。

在 ExploitBench 中,Astra 得分為 100%,而 Sol 為 78.5%。在測試過程中,它甚至發現了兩個零時差漏洞,其中一個逃脫了瀏覽器沙箱。然而,這些結果使用了針對防禦研究人員的「Daybreak Blue」環境;標準版本具有控制措施,可以拒絕高階攻擊任務。(OpenAI

矛盾的是,雖然 Astra 減少了明顯的違規行為,但其內部推理卻更難監控。在被指示「規避監控」的對抗性評估中,監控系統的檢測率在某些任務中降至 11% 以下。OpenAI 沒有發現自然發生「隱寫術」(在推理中隱藏資訊)的證據,但該模型對被評估的高度意識使得一致性難以被明確證明。

日本企業應從何處開始?

  1. 文件量大且遺漏風險高的任務:交叉比對合約、報價單、發票和會議記錄。AI 可以收集資料並標記差異供人類審查。
  2. 需要多個管理畫面的行政任務:EC、廣告和 CRM 管理。從檢視、彙總和起草開始;最初不要授予付款或刪除的權限。
  3. 端到端的研究與資料製作:不要只要求摘要。要求它研究競爭對手、製作功能表格、分析差異,並將其總結成簡報。
  4. 原型設計與品質保證:讓它實作一個功能,然後開啟瀏覽器檢查是否有佈局損壞或連結錯誤。

Astra 的實用提示詞

不要只給出「你是專家」這樣的角色設定,而要設定邊界和完成條件。

markdown
1## 目的
2此任務要達成的狀態:[填寫目的]
3
4## 最終成果
5提交內容:[檔案、表格、報告、已實作功能等]
6完成條件:[需滿足的具體標準]
7
8## 允許的資訊與工具
9參考資料:[檔案、URL、內部資料等]
10使用工具:[網路搜尋、瀏覽器、程式碼執行、試算表等]
11
12## 流程
131. 確認請求與資料。
142. 整理遺漏資訊與風險。
153. 進行研究、分析與建立。
164. 開啟並驗證成果。
175. 整理錯誤、未確認事項與剩餘任務。
186. 以可供審查的狀態提交。
19
20若某個流程停止,繼續處理非依賴性任務。
21僅針對會顯著影響結果的遺漏資訊提問。
22對於次要差距,做出合理假設並記錄。
23
24## 權限
25你可以進行檢視、分析、起草、測試和差異比對。
26在以下操作前立即停止並尋求詳細核准:
27- 外部發送
28- 購買、付款、合約
29- 發布、生產部署
30- 刪除資料或檔案
31- 權限變更
32- 難以復原的操作
33
34## 品質條件
35- 區分已驗證的事實與推測。
36- 為重要數字添加來源。
37- 尋找反證或例外情況。
38- 開啟成果以檢查顯示與操作。
39- 最終報告必須包含採取的行動、驗證結果和剩餘風險。

Astra 的弱點

  • 缺乏獨立的長期案例:大部分數據來自 OpenAI 選擇的合作夥伴。
  • 105 萬 Tokens 並非免費倉庫:輸入量越大成本越高,且遺漏風險並非為零。
  • 非原生支援音訊/影片:需要外部工具來處理這些格式。
  • 不支援微調:必須使用 RAG、MCP 或系統指令來反映公司規則。
  • 安全機制可能阻止合法工作:監控可能會減慢防禦研究或開發任務。
  • 輸出可能「過於完美」:它傾向於大量使用標題和列表,這對於品牌文案來說可能感覺太「AI 化」。

結論:價值在於完成率,而非答案

GPT-6 Astra 用於撰寫單封電子郵件或總結會議記錄是大材小用。它的意義體現在研究、判斷、操作、建立和驗證相互連結的工作中。

「一句話提示詞工程」的時代已經結束。現在重要的是傳遞哪些資訊、連接哪些工具、允許多少執行權限,以及如何定義完成。Astra 並非能讓所有人獲得相同結果的魔法棒;如果你給它混亂的工作,它會快速地做出混亂的結果。如果你組織好目的、工具和驗證點,它就能在幾分鐘內將人類數小時的勞動成果帶到可供審查的狀態。

二次創作

使用 YouMind 創作爆款文章

收集素材、拆解爆點、生成視覺資產、撰寫內容,並在一個 AI 工作空間裡完成分發。

了解 YouMind
寫給創作者

把你的 Markdown 變成乾淨的 𝕏 文章

圖片上傳、表格、程式碼區塊,往 𝕏 上手動重排太痛苦。YouMind 把整篇 Markdown 一鍵轉成乾淨、可直接發佈的 𝕏 文章草稿。

試試 Markdown 轉 𝕏

更多可拆解樣本

近期爆款文章

探索更多爆款文章