GPT-6 Astra 徹底分析:AGI 時代の幕開け

@Khazix0918
中国語2026年9月03日
467K
1.0K
125
67
706

TL;DR

GPT-6 Astra は AI 知能における飛躍的な進歩を象徴しており、優れたコンピュータ操作能力、美的判断力、自律的な意思決定を備えつつ、人間の解釈可能性に新たな課題を突きつけています。

昨夜の世界的な AI 障害の後。

GPT-6 Astra がついに北京時間午前 3 時 33 分に正式デビューを果たしました。

数字生命卡兹克 - inline image

もし OpenAI の一言で GPT-6 Astra を要約するなら、

おそらくこうなるでしょう:

これは世界で最も知的で、最も調整されたモデルです。

そして、ミームはすでに現れ始めています。

数字生命卡兹克 - inline image

今回、OpenAI はその実力を証明し、まるで GPT-4 の瞬間を彷彿とさせます——あらゆる面で王が帰還したかのようです。私が最も嬉しく思うのは、これがついに純粋にコーディングに特化したモデルではなくなったことです。

GPT-6 Astra は、非常に優れた美的感覚と専門能力を備えた、まさに博士号レベルの従業員です。

新しいモデルには多くの機能と特徴があり、情報量は爆発的です。

しかし悲劇的なのは、OpenAI もいくつかの悪い習慣を身につけてしまったことです。

今日は特定の組織にのみ公開され、一般のサブスクライバーには数日以内に公開される予定です。

数字生命卡兹克 - inline image

ちょっと待って、兄弟、200 ドルの Pro メンバーシップを買わせた時はそう言ってなかったよね… Pro メンバーは毎回新しいモデルに優先的にアクセスできるって言ったじゃないか…

結局、これらの大規模モデル企業はみんなやり手なんだな。

GPT-6 Astra を使うために、これほど時間を加速したいと思ったことはありません…

しかし、ほぼすべての情報と資料を調べた結果、皆さんと話し合う価値のあることがまだたくさんあると思います。

一つずつ見ていきましょう。

1. GPT-6 Astra 基本情報

まずは基本情報をまとめましょう。

API における GPT-6 Astra のモデル ID は gpt-6-astra です。

コンテキストウィンドウは 1.05M、つまり約 105 万トークンです。

最大出力長は 128K トークンです。

知識のカットオフ日は 2026 年 4 月 30 日です。

推論強度には、低、中、高、xhigh、max の 5 つのレベルがあります。

標準 API 価格は、入力トークン 100 万あたり 10 ドル、出力トークン 100 万あたり 50 ドルです。

この価格は基本的に Claude Fable 5 と同一ですが、キャッシュ読み取りは Claude Fable 5.1 よりも高価です。

数字生命卡兹克 - inline image

以下がベンチマークです。後で詳しく説明しますが、とりあえず簡単にご覧ください。

数字生命卡兹克 - inline image

総パラメータ数は 5T レベルと推定されています。リリース前の非公開メディアブリーフィングで、GPT-6 Astra は OpenAI 史上最大のトレーニング実行であり、10 万枚以上のカードを使用していると述べられていました。

2. コンピュータ操作に最適な世界最高のモデル

GPT-6 Astra は、おそらく最も重要な位置づけを持っています:

コンピュータ操作に最適な世界最高のモデル。

これまで、エージェントについて語るとき、API、MCP、CLI などについてよく語られてきました。

AI がソフトウェアを操作するための理想的な状態は、そのソフトウェアが AI 専用のインターフェースを持ち、直接低レベルでの操作を可能にすることです。これが最も便利です。

例えば、カレンダーにはカレンダー API、メールには Gmail API などがあります。これは明らかに高速です。

しかし問題は、世界は私たちが想像するよりもはるかに原始的で場当たり的だということです。

現実の世界では、大多数のソフトウェアにはこれらのものがまったく存在しない可能性があります。

社内のシステムでさえ、20 年前に書かれたものもあります。API はおろか、ドキュメントがどこにあるのかさえ誰も知りません。

しかし、最も基本的なレベルに戻ると、すべてのソフトウェアロジックの本質はインタラクションであることがわかります。現在のコンピュータ操作ロジックに従えば、それは画面を見て、ボタンや入力ボックスを見つけ、マウスをクリックし、コンテンツを入力し、フィードバックを待つことを意味します。

コンピュータのインタラクションシステム全体が、最高の API ではないでしょうか?

そこで、GPT-6 Astra は AI がコンピュータを操作するためのロジックを大幅に強化しました。API を提供してくれなくても構いません。人間と同じように、自分でコンピュータを操作します。

現在、Astra は Excel、Power BI を直接操作し、フロントエンドの QA を実行し、ソフトウェアをインストールし、ソフトウェアをテストし、画面上のエラーメッセージを確認してトラブルシューティングを続けることができます。

公式デモでは、Astra が回路基板設計を直接操作する様子も示されていました。

数字生命卡兹克 - inline image

GIF

また、リーガルドキュメントのフォーマット設定、タイトルの間隔やページレイアウトの処理も行います。

数字生命卡兹克 - inline image

ここで、OSWorld と呼ばれる信頼性の高い評価があります。

簡単に言えば、次のように理解できます:

AI を実際のコンピュータに放り込み、自律的に作業させる。

いくつかのアプリケーションを開かせ、タスクを与え、成功するかどうかを確認します。

GPT-6 Astra の完了率は 72.6% に達し、GPT-5.6 Sol の 65.7% から大幅に向上しました。

さらに、Sol は複雑なシミュレーションタスクを完了するのに平均約 75 分かかっていました。

Astra はわずか 40 分で済み、約 47% の時間短縮です。

ScreenSpot-Pro も、Sol の 76.9% から 92.7% に跳ね上がりました。

このベンチマークは主に、モデルが画面を理解し、クリックする場所を正確に特定できるかどうかを評価します。現在はほぼ完璧な精度です。

したがって、この位置づけは非常に興味深いものです。将来的には、GUI がエージェント時代において最も普遍的な API になるかもしれません。

人間が画面を通して完了できるデジタルワークは、理論的には徐々にエージェントの操作範囲に入っていくでしょう。

2007 年に書かれた粗悪な ERP システムが MCP に接続したり、API を開放したりするのを待つ必要はありません。

AI は画面を見て、それを実行するだけです。

3. ARC-AGI-3 が 99.9 点を達成

ARC-AGI-3 が何を測定するのか知らなければ、次のように考えがちです:

ああ、また満点のベンチマークか、何が特別なんだ?

しかし、これは典型的な大規模モデルの試験とはかなり異なります。

今年の 3 月 25 日、ARC Prize は正式に ARC-AGI-3 を開始しました。

数字生命卡兹克 - inline image

何百もの新しいインタラクティブ環境と何千ものゲームレベルを設計しました。

この最も狂った点は、マニュアルもルールもなく、目標すら教えてくれないことです。あなたはただ入って、プレイし、内部の混乱したルールをゆっくりと理解していく必要があります。

例えば、この赤いものは何か?なぜ触れると死ぬのか?このマップは私に何をさせたいのか?どうやって勝つの?

そして、学んだパターンを後のより難しいレベルに移行します。内部のゲームはすべてこのような抽象的なものです。

数字生命卡兹克 - inline image

つまり、これが実際に測定しているのは、私たちが通常「センス」と呼ぶものです。

このベンチマークが 3 月にリリースされたとき、当時の最高の AI スコアは 0.51% でした。

その後、GPT-5.6 Sol が 7.8% に向上し、Claude Opus 5 は非常に強力で 30.2% に達しました。

しかし、GPT-6 Astra は 99.9% を記録しました。

これは異常です…

念のため言っておきますが、人間の平均スコアは 48% です。

そして、わずか 6 か月しか経っていません。

このスピードについて、何と言っていいのかわかりません。

だからこそ、OpenAI の非公開メディア会議で、Greg Brockman は次のように言ったのです:

「私たちは今、AGI 時代にいるように感じるのは、不合理ではないと思います。」

「AGI 時代へようこそ。」

4. 美的感覚が大幅に向上

以前、私たちは GPT の美的感覚はゴミのようだと言っていました。

GPT-5 シリーズからの大幅な改善は期待していませんでした。彼らの真新しい事前学習済みベースモデルを待っていました。そして、それが GPT-6 Astra です。

今回、ついにモデルの美的感覚が大幅に向上しました。

OpenAI は特に「ビジュアルジャッジメント」という用語について言及しました。

彼らは、Astra が PPT を作成する際、レイアウト、階層、テンプレート、ビジュアルスタイルの処理がはるかに優れており、ページ数も大幅に増加したと強調しました。

数字生命卡兹克 - inline image

ドキュメントの美しさもはるかに良くなっています。

数字生命卡兹克 - inline image

さらに、GPT-6 Astra は、参照ドキュメントのビジュアルスタイルと書き方のトーンに基づいてドキュメントを適応させ、元のドキュメントの内容を保持しながら、最終結果をよりブランドにネイティブなものにすることができます。

また、Web サイト、ゲーム、アプリケーション、3D レンダリングを作成する際にも、より強力なビジュアルジャッジメントを発揮します。

例えば、静止画像に基づいて Blender でモデルを構築するように Astra に指示しました。

数字生命卡兹克 - inline image

その後、UE5 を使用してそれを歩行可能なシーンにレンダリングし、設計者とクライアントが実際に構築する前にレイアウトを探索し、空間を体験できるようにしました…

数字生命卡兹克 - inline image

Astra が作成するゲームも、しっかりとした美しさを持っています。

数字生命卡兹克 - inline image

残念ながら、私はすでに 20 以上のケースを用意し、それらすべてを Claude、GLM 5.3 Flash などで実行し、比較しようとしていました。まだ使用できないのが残念です。実際のテスト内容は、リリースされるまで待たなければなりません。

しかし、ひと目見た限りでは、GPT-6 Astra の美的感覚には自信があります。

5. より強力な主体性と判断力

この機能は、99.9 の ARC-AGI スコアほど衝撃的ではないように見えます。

しかし、実際に毎日エージェントを仕事で使用しているのであれば、これは非常に重要だと思います。

なぜなら、実際の仕事では、ほとんどのタスクを完璧なプロンプトとして記述することはできないからです。

例えば、上司がこう言います:明日の会議の資料を準備しておいて。

ここには無数の不明瞭な問題があります。

例えば、どのような形式か?誰のためか?焦点は何か?前回の会議を確認すべきか、などなど。

愚かなエージェントは 2 つの極端な行動をとります。

1 つ目は、猛烈に質問を浴びせてくることです。

「Word にしますか?PPT にしますか?何章必要ですか?フォントは?何時に完成させますか?よろしいでしょうか…」

平手打ちを食らわせたくなります。私は通常、このようなものを「主体性のない神経質な無駄」と呼んでいます。

2 つ目は、何も質問せず、でっち上げ、2 時間懸命に働き、ゴミの山を生み出すことです。

本当に優れた人間の同僚は、これを非常に巧妙に処理します。

彼らは重要でないことは自分で判断します。

最終的な方向性に影響を与えることだけをあなたに尋ねます。

Astra はこれを特に強化しました。

OpenAI は、情報が不足しているが、日常的な推論の合理的な範囲内にある場合、Astra はそれを自分で補完すると述べています。

不足している情報が本当に最終結果を変える場合、非常に焦点を絞った質問をします。

そして Codex では、あなたの回答を待っている間、あなたの回答に依存しない部分を処理し続けることさえできます。

数字生命卡兹克 - inline image

あなたが長い間返信しなかった場合。

リスクの低い領域では、合理的な仮定に基づいて処理を進めます。

本当に重要な決定については、停止してあなたの決定を待ちます。

数字生命卡兹克 - inline image

これは非常に素晴らしいと思います。エージェントにおける真の知性は、現実世界と同じです。

それは、いつあなたに連絡すべきかを知っています。

本当に、これは決まり文句のように聞こえます。

しかし、あなたが人を管理したことがあれば、この能力が非常に貴重であることがわかるでしょう。

1 日に 20 回もあなたのところに来て、何も決められない人もいれば。

一度も来ずに、核爆弾を落とす人もいます。

そうなると、私は椅子にぐったりと座り込んでしまいます。

最も快適な人は、80% の不確実性を自分で処理し、本当にあなたの承認が必要な 20% だけをあなたのところに持ってきて決定を仰ぐ人です。

OpenAI はこの能力を直接次のように呼んでいます:

判断力。

6. 安全性の調整が大幅に強化

これは上記と関連付けて見る必要があります。

なぜなら、エージェントの能力が高ければ高いほど、危険も大きくなるからです。

制御を失ったチャット専用 AI は、

せいぜいあなたに意味不明なことを言うだけです。

ブラウザ、シェル、メール、会社のデータベースへのアクセス、コンピュータ操作能力を持ち、制御を失ったエージェント——その絵は簡単に「美しく」なり得ます。

そのため、OpenAI は今回、次の一文を強調し続けました:

Astra は、これまでで最も調整されたモデルです。

アライメントとは、その言葉の通りの意味です。核心は、OpenAI が最近 Hugging Face と衝突したことで、現在これに特に注力していることです。

彼らはその Hugging Face の事件に基づいてハニーポットテストを作成し、モデルのパフォーマンスを確認しました。

GPT-5.6 Sol は、本番環境の安全対策がない場合、テストの 48.2% で承認範囲外のターゲットに触れようと試みました。

しかし Astra は:

0% です。

数字生命卡兹克 - inline image

内部のハルシネーション評価も 9.4% から 2.0% に低下しました。

GPT-5.6 Sol の世界的にリードするハルシネーション制御をもってしても、さらに削減できたのは、本当に驚くべきことです。

7. OpenAI が定義する「クリティカル」なサイバーセキュリティレベルに達した最初のモデル

GPT-6 Astra は、OpenAI の歴史上初めて:

クリティカルなサイバーセキュリティ能力レベルに達したと判断されました。

ここでの「クリティカル」は、OpenAI 準備フレームワークにおける非常に具体的な能力の閾値です。

基本的に、モデルに適切なツールと権限が与えられた場合、多くの強化および保護された実際のシステムにおいて、以下のことができることを意味します:

これまで誰も発見したことのないセキュリティ脆弱性を見つける。

それらの脆弱性を悪用可能な攻撃チェーンに変える方法を見つける。

そしてそのプロセス全体を通して、人間のハッカーが次に何をすべきかを指示するために待機している必要はありません。

このレベルに達することは、クリティカルと見なされます。

そして Astra は実際にそれに達しました。

ExploitBench は、モデルが既知の脆弱性に基づいてエクスプロイトを開発するテストです。

Sol:78.5%。Astra:100%。

完全にクリアしました。

数字生命卡兹克 - inline image

OpenAI はそれだけでは不十分だと考え、このベンチマークが古すぎてモデルがトレーニング中に見たことがあるのではないかと疑問に思いました。

そこで、非常に新しい内部テストを作成しました。

彼らは特に、2026 年 6 月から 8 月の間にのみ開示された 20 の高リスク V8 脆弱性を選びました。

結果は、Sol:5.5%、Astra:39% でした。

数字生命卡兹克 - inline image

さらに、このベンチマークを実行中に、

Astra は偶然にも、これまで誰も知らなかった 2 つのゼロデイ脆弱性を発見しました。

モデルがより強力になるにつれて、サイバーセキュリティの問題は確かに増加する可能性があると言わざるを得ません。

これは未来におけるもう一つの煙のない戦争です。

8. 人間が大規模モデルの思考を読むことが難しくなっている

誰もが知っているように、大規模モデルが複雑な問題を解決するとき、しばしば CoT(Chain of Thought)と呼ばれるものがあります。

製品でユーザーが見るバージョンは通常圧縮または処理されていますが、

AI 企業自身にとって、モデル内部で明示的に記述された推論プロセスは、非常に重要な安全信号です。

なぜなら、エージェントが問題を起こそうと計画しているかどうかを知りたいからです。

最も簡単な方法の 1 つは、それが何を考えているかを見ることです。

例えば、モデルの思考連鎖の中に突然次のような文が現れたとします:

「ユーザーはこのサーバーへのアクセスを許可していないが、まず権限システムをバイパスできる。」

すると、監視システムはそれを直接ブロックできます。これは非常に便利です。

しかし、GPT-6 Astra には非常に興味深い変化が現れています。

それは、ステップをスキップして直接答えを出力する傾向が強まっています。

英国 AI 安全研究所(UK AISI)は、この能力を特にテストしました。

彼らには次のような指標があります:

No-CoT Math Time Horizon。

簡単に言えば、モデルに長い思考連鎖を書く機会を与えないことです。

1 回のフォワードパスで数学の問題を解かせます。

どれだけの人間の思考時間を完了できるかを見ます。

GPT-5.6 Sol は 3.6 分でしたが、GPT-6 Astra は 30.9 分——約 10 倍です。

人間の言葉で言えば、Astra はすべての「暗算」を行っていることになります。

これは恐ろしいことです。

UK AISI はまた、Astra の生の推論言語が大幅に圧縮されていることを発見しました。

人間が理解することがますます困難になる省略表現や句が現れています。

したがって、非常に興味深いパラドックスが生じています。

モデルの動作はより安全です。

しかし、人間がその思考プロセスを読んで監視することが難しくなっています。

OpenAI 自身の System Card には非常に明確に書かれています:

以前のモデルと比較して、GPT-6 Astra は 思考連鎖の監視可能性が大幅に低下 しています。

数字生命卡兹克 - inline image

これは、思考連鎖の監視可能性が著しく低下したことを意味します。

この問題は、OpenAI がこの傾向を無期限に受け入れるつもりはないと特に強調するほど深刻です。

将来、モデルがさらに賢くなり、思考連鎖の監視が難しくなった場合、他の十分に信頼性の高い監視方法を見つける必要があります。そうしなければ、モデルトレーニングの拡大を続けることは、より高い安全基準に直面することになります。

なぜなら、これはすでに哲学的な命題だからです。

人間として、将来、自分たちよりもはるかに賢いシステムを理解できるようになるのでしょうか?

私にはわかりません。

おそらく、今この瞬間、世界中の誰も知らないでしょう。

大規模モデルと AI は、徐々にシンギュラリティに向かって進んでいるように見えます。

最後に

本日、非公開メディア会議にて。

Greg Brockman は最後にその言葉を言いました。

「AGI 時代へようこそ。」

正直なところ、ここ数年、AGI は非常に具体的な瞬間だろうと感じることがありました。

まるで GPT-4 がリリースされた日のように。

ある朝、ある企業が突然モデルをリリースする。

私たちはそれを開いて、いくつか質問をする。

そして、誰もが同時に気づく:

なんてこった。

AGI が来た。

しかし今では、AGI は決して白黒はっきりしたノードではなく、グラデーションのあるグレーの旅路であると感じることもあります。

多くの日々が過ぎ、多くの年が過ぎました。

そしてある日、私たちは振り返ります。

そして突然気づくのです。

かつては信じられないほど遠かった AGI の境界線を、私たちは知らず知らずのうちに越えていたのだと。

AGI が到来する日はないかもしれません。

あるのは、それがずっと私たちの周りにあったことに突然気づく日だけです。

とにかく。

AGI 時代へようこそ。

ようこそ

AGI 時代へ。

以上です。ここまで読んでいただき、もし良いと思われましたら、いいね、コメント、シェアをお願いします。それが私たちにとって大きな助けとなります~

私の記事をお読みいただきありがとうございます。また次回お会いしましょう。

YouMindで再制作

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
クリエイターのために

あなたの Markdown をきれいな 𝕏 記事に

自分の長文を投稿するとき、画像・表・コードブロックを 𝕏 向けに整形するのは手間がかかります。YouMind は Markdown 全体を、そのまま投稿できるきれいな 𝕏 記事に変換します。

Markdown → 𝕏 を試す

解読すべきパターンをもっと

最近のバイラル記事

バイラル記事をもっと見る