GPT 6 Astra は実際にどのように思考しているのか

@Mikadzyki_NFT
英語2026年9月08日
955K
83
16
16
142

TL;DR

GPT 6 Astra は、モデルが重みを再利用し、テキストを出力する前に内部状態を複数回処理することを可能にするループ型トランスフォーマーアーキテクチャを導入しています。これにより、パラメータ数と計算の深さが切り離され、推論時の適応型計算が可能になります。

**

OpenAI は GPT 6 Astra を、これまでで最も高性能で整合性の高いモデルと説明しています。

Greg Brockman はさらに踏み込み、Astra を初期の汎用人工知能の一形態と見なすのが合理的だと述べています。

このモデルは、OpenAI のサイバーセキュリティに関する Critical しきい値を超えた最初のモデルにもなりました。同社によると、限られた人間のガイダンスで、これまで知られていなかった脆弱性を発見し、動作するエクスプロイトを構築できるとのことです。

これらの主張は劇的ですが、リリースの最も重要な部分ではありません。

本当の変化はアーキテクチャにあります。

従来の言語モデルは、固定された一連のトランスフォーマーブロックを通じて情報を渡し、次のトークンを生成します。Astra は、ユーザーに単語を表示する前に、同じ計算ブロックを通じて内部状態を複数回処理できます。

単により長い思考の連鎖を生成するわけではありません。

回答する前に、より多くの時間をかけて考えます。

1 現代の言語モデルの仕組み

次のように入力することを想像してください:

エベレストは...

モデルは次に何が来るかを予測する必要があります。

そのアテンション機構は、コンテキストのどの部分が重要かを判断します。エベレストという単語は、山、標高、ヒマラヤ、ネパール、チベット、登山、探検などの関連概念を活性化します。

モデルは次に、それらの関連付けを周囲のコンテキストと組み合わせます。ほとんどの場合、「地球上で最も高い山」のような続きが非常に高い確率で選択されます。

従来のトランスフォーマー内部では、この表現は一連のブロックを通じて移動します。各ブロックはそれを一度変換し、結果を次のブロックに渡します。

モデルに 40 個のブロックが含まれている場合、隠れ状態はすべての 40 個を順番に通過します。最終的な表現は、次のトークンの確率分布に変換されます。

通常、ブロックが多いほど計算の深さが増します。より深いモデルは、回答を確定する前により多くの変換を実行できます。

しかし、ブロックを追加すると、パラメータ数、メモリ要件、トレーニングコストも増加します。

これまでの一般的な前提は単純でした:より深いモデルが必要なら、より大きなレイヤーのスタックを構築する必要がある、というものです。

ループ型アーキテクチャはその原則を変えます。

2 ループ型アーキテクチャが変えるもの

The Information の報道によると、GPT 6 Astra はループ型トランスフォーマーアーキテクチャを使用しています。

OpenAI は完全な技術仕様を公開していないため、正確な実装は非公開のままです。しかし、一般的なメカニズムは公開研究からすでに十分に理解されています。

隠れ状態をすべてのブロックに一度だけ送る代わりに、モデルは結果を計算ブロックに戻して再度処理できます。

これを内部ドラフトと考えてください。

モデルは予備的な表現を生成し、それを同じ重みを通じて再度送り、洗練させ、このプロセスを数回繰り返します。ループが完了した後にのみ、次の可視トークンが表示されます。

Mikadzyki🌙 - inline image

パラメータ数は変わりません。重みは 1 つのブロック内に留まり、計算量はループ数に応じて増加し、最終トークンのみが出力されます。

重要な点は、パラメータ数が必ずしも増加しないことです。

同じ重みが毎回再利用されます。

増加するのは計算量です。

従来のトランスフォーマーでは、トークンは異なるブロックのシーケンスを通じて移動します。ループ型トランスフォーマーでは、同じ共有構造を複数回通過できます。

モデルは、パラメータ数を増やすことなく、計算を通じて深くなります。

これにより、新しいトレードオフが生まれます:

  • より多くのパラメータはより多くのメモリを必要とする
  • より多くのループはより多くの計算を必要とする
  • 1 つのモデルがタスクごとに異なる計算量を使うことができる

最後の点は特に重要です。新しいモデルを作成せずに、計算の深さを変更できます。

3 リカレントデプスのトレーニング方法

単にトランスフォーマーブロックをループ内に配置するだけでは不十分です。

トレーニング中にモデルが常に正確に 32 回のパスを実行する場合、各ステップの位置に依存することを学習する可能性があります。最初のパスは 1 つの機能を学習し、10 番目は別の機能を学習し、32 番目は固定された出力レイヤーになる可能性があります。

結果は、ループを装った従来の 32 層ネットワークになります。

研究者は、トレーニング中にリカレントパスの数を変動させることでこの問題を解決します。

最も明確なデモンストレーションの 1 つは、リカレントデプスモデル Huginn から得られました。その作成者は、約 8000 億トークンで 35 億パラメータのネットワークをトレーニングしました。

各トレーニングステップで、ループ数は平均が約 32 の分布からサンプリングされました。ある例は 4 パス、別の例は 17 パス、さらに別の例は 40 パス、そして約 90 パスを受ける可能性があります。

モデルは、どのパスが最後になるかを事前に知ることはできません。

したがって、固定された一連の操作よりも一般的な何かを学習する必要がありました。

現在の内部状態を改善する方法を学習する必要がありました。

Mikadzyki🌙 - inline image

arXiv のリカレントデプス論文からの要約

数十のリカレントステップを通じたトレーニングは、別の問題を生み出します:メモリです。

標準的なバックプロパゲーションでは、すべてのループからの中間活性化を保存する必要があります。十分な繰り返しがあると、メモリコストは莫大になります。

Huginn の研究者は実用的な妥協案を使用しました。フォワードパスは多くのループで実行できますが、勾配は最後の 8 回のパスを通じてのみ計算されました。

初期のパスは依然として最終結果に影響を与えましたが、その完全な活性化履歴をメモリに保持する必要はありませんでした。

これは、時間方向の切り詰められたバックプロパゲーションと似ています。違いは、再帰がシーケンス内の単語間ではなく、計算の深さ全体で発生することです。

Mikadzyki🌙 - inline image

ループ数は各トレーニングステップでサンプリングされ、勾配は最後の 8 回のパスを通じてのみ計算されます。

モデルは、32 回の操作からなる固定されたシーケンスを実行するように教えられているわけではありません。

プロセスがいつ停止されても、有用な回答に向けて隠れ状態を移動させるように教えられているのです。

それが深さの意味を変えます。

深さはもはや、トレーニング前にエンジニアが選択するプロパティだけではありません。推論中の変数になる可能性があります。

4 推論中の適応的計算

現在のほとんどの推論制御は、可視トークンのレベルで動作します。

モデルにもっと考えるように求めると、より長い思考の連鎖を生成し、より多くの出力トークンを使用し、または追加の中間テキストを作成します。

ループ型アーキテクチャは、異なるメカニズムを提供します。

内部パスの数は、重みを変更したり、モデルに長い説明を書かせたりすることなく変更できます。

単純なタスクは 4 つのループを受けるかもしれません。

難しい数学的証明は 32 のループを受けるかもしれません。

複雑なコーディング問題は 64 のループを受けるかもしれません。

モデルは同じままです。内部計算量のみが変化します。

Mikadzyki🌙 - inline image

重みは固定されたままです。各トークンを処理するために使用される内部パスの数のみが変化します。

公開されたリカレントデプスの実験は、すでに期待されるパターンを示しています。

パフォーマンスは最初のループ中に急速に向上します。その後、改善は小さくなり、曲線がプラトーに近づきます。

これは、隠れ状態が収束していることを示唆しています。

初期のパスは大きな修正を行います。後のパスは小さな詳細を洗練させます。最終的に、追加の計算は意味のある改善を生み出さなくなります。

将来のシステムは、その瞬間を自動的に検出できる可能性があります。

すべてのプロンプトに固定のループ数を割り当てる代わりに、モデルは隠れ状態が十分に安定するまで処理を続けることができます。簡単なトークンは安価になります。難しいトークンはより多くの計算を受け取ります。

これにより、真の適応的計算深さが生まれます。

より長く考えることが、もはやより多く書くことを意味する必要はありません。

5 研究と初期の実用的結果

トランスフォーマーレイヤーの再利用は新しいアイデアではありません。

Universal Transformers は 2018 年にリカレント処理を導入しました。ALBERT はレイヤー間で重みを共有することでパラメータ数を削減しました。Mixture of Recursions は、異なる計算量を通じてトークンをルーティングすることを探求しました。

オープンな Nanbeige4.2 3B モデルは、特に直接的な例を提供します。

その構成には 22 のレイヤーと num_loops: 2 が含まれています。実質的に、モデルはそれらのレイヤーを 2 回通過します。22 層ネットワークとほぼ同じパラメータ数を持ちながら、約 44 層ネットワークの計算深さを持っています。

Mikadzyki🌙 - inline image

Hugging Face の Nanbeige4.2 3B 構成

22 レイヤー、num_loops: 2、Apache 2.0 ライセンス。このメカニズムは、オープンモデルの構成ですでに確認できます。

長年にわたり、リカレントトランスフォーマーの設計は、支配的なアプローチではなく、興味深い研究アイデアのままでした。

欠けていた要素は、強力なスケーリングの証拠でした。

9 月 1 日、研究者グループが SMELT を発表しました。これは、一致した条件下でループ型トランスフォーマーと従来型トランスフォーマーを比較するために設計された研究です。

彼らはパラメータ数、トレーニング計算量、KV キャッシュサイズを制御しました。これらの制約の下で、ループ型モデルは同じパフォーマンスレベルに達するために 6.8% から 18% 少ないトレーニング計算量を必要としました。

最大の利得はコードで現れました。

Mikadzyki🌙 - inline image

arXiv の SMELT 論文からの要約

計算量、パラメータ、KV キャッシュを一致させると、ループ処理によりトレーニング計算量が 6.8% から 18% 節約され、最大の利得はコードで見られます。

研究者はまた、アテンション動作の変化を観察しました。

従来のトランスフォーマーでは、シーケンス内の最初のトークンがアテンションシンクになることがよくあります。それらは、意味的な重要性が限られている場合でも、不釣り合いな量のアテンションを受け取ります。

同じブロックを 2 回目のパスした後、モデルのアテンションはより関連性の高いトークンにシフトしました。

2 回目のループは単に 1 回目を繰り返したわけではありません。1 回目のパスの結果を、より選択的な処理の基盤として使用しました。

SMELT は、すべての将来のモデルがリカレントであるべきだと証明するものではありません。しかし、主要な実験条件が一致した後でも、ループ処理が競争力を維持することを示しています。

もはや問題は、リカレントデプスが機能するかどうかではありません。

問題は、それがどこまでスケールできるかです。

6 解釈可能性と制御

ループを魅力的にする同じアーキテクチャ上の特徴が、モデルの監視も複雑にします。

明示的な思考連鎖推論では、少なくともいくつかの中間ステップが読み取り可能なテキストとして表示されます。研究者はそれらを検査し、疑わしいパターンを検索し、述べられた推論と最終回答を比較できます。

リカレントモデルは、テキストを生成せずに、隠れ活性化内でより多くの処理を実行できます。

Buck Shlegeris と Ryan Greenblatt は、これが思考連鎖監視の有用性を低下させる可能性があると主張しています。より多くの処理が隠れ計算に移行すると、可視の説明はモデルが結果に到達した方法についてあまり明らかにしない可能性があります。

Sebastian Raschka は重要な反論を提供しました。

重みの再利用は、自動的に秘密またはアクセス不可能な認知を生み出すわけではありません。内部活性化は、解釈可能性ツールを使用して依然として研究できます。主な違いは、生成が始まる前により多くの計算が行われるため、モデルが必要とする可視中間トークンが少なくなる可能性があることです。

OpenAI のチーフサイエンティスト Jakub Pachocki はまた、Astra の計算グラフは GPT 4 の深さの約 2 倍以内に留まっており、監視機能を維持するためにループが意図的に制限されていると述べています。

これは、無制限のリカレントプロセスではなく、抑制された実装を示唆しています。

思考連鎖は、そもそもモデルの内部計算の忠実な記録であるとは限りません。システムは、すべての隠れ操作の科学的に正確なレポートを提供することではなく、有用な回答を生成することで報酬を得ます。

OpenAI、Anthropic、Google DeepMind を含む研究は、モデルの説明が重要な要素を省略したり、事後的に決定を合理化したり、実際に結果に影響を与えた経路よりもきれいな経路を提示したりする可能性があることを示しています。

ループ型アーキテクチャは、この区別を無視することをより困難にします。

可視の推論はインターフェースである可能性があります。

主要な計算は、テキストが表示される前にモデル内部で行われる可能性があります。

7 GPT 6 Astra の結果

GPT 6 Astra の最も壮観なベンチマーク結果は、ARC AGI 3 での 99.9% のスコアです。

その数字はほぼ最終的なように聞こえますが、テストの実行方法に大きく依存します。

Simon Willison は、99.9% の結果が OpenAI のカスタム Provider Adapter ハーネスから得られたことを強調しました。標準の ARC Prize ハーネスでは、同じモデルが 62.7% をスコアしました。

モデルは変わりませんでした。

評価環境が変わったのです。

Mikadzyki🌙 - inline image

同じモデルが、2 つの異なる実行コストで 2 つの異なるスコアを生成します。

OpenAI の実行コストは約 $19,000 でした。標準の実行コストは約 $26,000 でした。

大幅に高いスコアは、より安価なセットアップによっても生成されました。

これは必ずしも結果を無効にするわけではありません。カスタムアダプターはモデルとより効果的に相互作用するか、一般的な評価フレームワークが見逃す能力を公開する可能性があります。

しかし、見出しの数字は、それを生み出した条件とは別に解釈することはできません。

Mikadzyki🌙 - inline image

ARC AGI 3 での GPT 6 Astra

1 つのモデル、2 つの評価ハーネス、37.2 パーセンテージポイントのギャップ。

他の評価はそれほど劇的ではありません。

Artificial Analysis Intelligence Index では、Astra は GPT 5.6 Sol とほぼ同等で、Claude Fable 5.1 より約 5 ポイント低いスコアです。

そのより実用的な利点は、エージェントタスクでの効率性である可能性があります。そこでは、より低いコストで競争力のあるパフォーマンスに達することができます。

ベンチマークは、モデルが何を達成できるかを示します。アーキテクチャは、それらの能力がどこから来て、どのように発展する可能性があるかを説明するのに役立ちます。

8 これが AI の未来にとって意味すること

長年にわたり、言語モデルのスケーリングは主に、パラメータの追加、データの追加、そしてより大きな固定スタックのトランスフォーマーブロックの構築を意味していました。

新しい世代ごとに、より大きく、より高価で、実行により多くの要求が課されるようになりました。

GPT 6 Astra は別の道を示しています。

モデルは同じパラメータを再利用し、難しいタスクにより多くの計算を割り当て、最初の単語を生成する前に内部表現を洗練させることができます。

これにより、モデルサイズと推論の深さが分離されます。

1 つの固定された計算経路に従う代わりに、システムは特定の問題の難易度に応じて作業量を調整できます。

これは、モデルのパフォーマンスと AI 使用の経済性の両方を変える可能性があります。同じ知能が、単純なリクエストには高速で安価なモードで動作し、タスクが本当により多くの推論を必要とする場合には計算の深さを増やすことができます。

再帰が言語モデルに戻ってきています。今回は、主に単語間ではなく、それらを作成するプロセス内部で動作します。

次世代のシステムは、より多くのパラメータを含むからといって、より強力になるとは限りません。

それらの決定的な利点は、良い回答がすでに見つかったときと、内部ループをもう一周する価値があるときを知っていることかもしれません。

ソース

ワンクリック保存

YouMindでバイラル記事をAI深読み

ソースを保存し、的を絞った質問をし、主張を要約して、バイラル記事を再利用できるノートに変えます。すべてを1つのAIワークスペースで行えます。

YouMindを探索
クリエイターのために

あなたの Markdown をきれいな 𝕏 記事に

自分の長文を投稿するとき、画像・表・コードブロックを 𝕏 向けに整形するのは手間がかかります。YouMind は Markdown 全体を、そのまま投稿できるきれいな 𝕏 記事に変換します。

Markdown → 𝕏 を試す

解読すべきパターンをもっと

最近のバイラル記事

バイラル記事をもっと見る