最初のミレニアム賞問題、ナビエ-ストークス方程式が AI によって解決。
AI 支援による数学研究の新たな進歩というポジティブな物語と、急速な AI の進展に対する恐怖を煽る機会という、本来は両方の側面を持つはずだった事象において、非常に不運な状況が生じている。
あるいは、我々がここで呼んでいるように、「火曜日」だ。
本当の話は Astra より優れた新モデルについて
本質を見失うな。ここには三つの話がある。
一つ目の話は二つ目の話よりもはるかに重要であり、二つ目の話は三つ目の話よりもはるかに重要だ。
- OpenAI の次世代モデルは、Astra よりも一世代先を行くまでにわずか一週間しかかからなかった。そして彼らがこの事実を公表するのは、人々が起きていることに完全に怯えているからだ。公式な表現では:「私たちは、AI の進歩のペースと今後登場するモデルへの期待について世界に情報提供することが重要だと考えており、『進歩のペースについてより慎重な選択が必要になるかもしれない』」
- この新しい AI は、学習開始から 8 日後にナビエ-ストークス方程式を解いた。
- ナビエ-ストークス方程式に関する数学的な成果に対して、誰が功績を認めるべきかを巡る一連の騒動。
Jeffrey Ladish : ナビエ–ストークス問題を巡る人間ドラマについては詳しく調べていないが、ちょっと待ってくれ。だって、AI がミレニアム賞問題を解いちゃったんだろ。
トップニュースの重要性を強調しすぎることはない。
私は三つの話をすべて伝えるつもりだが、繰り返す:本質を見失うな。
舞台設定
この特定の火曜日の物語は朝から始まった。
Tristan Buckmaster と Levent Alpoge は一年間取り組み、驚くべき結果のシリーズを提供してくれた:滑らかな強制力に対する有限時間ブローアップ(incompressible porous media)、Boussinesq 方程式、および 3 次元非圧縮性オイラー方程式。また、彼らは hypo-dissipative Navier-Stokes におけるブローアップも達成したと考えているが、その結果の Lean による検証はまだ完了していない。
Tristan Buckmaster: このプログラムが属する枠組みは、私たちによって開始されたものでも、大規模言語モデルによって提案されたものでもない。このプログラムの基本アイデアの功績は Diego Cordoba と Luis Martınez-Zoroa にある。彼らは数年間、強制ブローアップの構築を探求してきた。私たちは彼らの仕事を出発点とし、大規模言語モデルを使って彼らのプログラムを完成させた。
具体的には、Levent と私が行ったのは、粗い強制力でブローアップ結果を達成した Cordoba と Martınez-Zoroa のプログラムを取り上げ、LLM の多大な助けを借りて、これを滑らかな強制力と非圧縮性オイラー方程式へと拡張することだった。この攻撃ラインを可能にしたアイデアは Cordoba と Martınez-Zoroa に帰せられる。同僚たちとの私的な会話で私が述べたことを明確にしておこう:この一連の仕事に基づき、私は Luis Martınez-Zoroa がフィールズ賞を受賞すべきだと信じている。
ここまで素晴らしいことだ。彼は、高度な数学全体が今後どのように機能するかについての再考が必要だと指摘している。Terence Tao は基礎となる結果についてコメントを提供している。
あまり良くない部分は、数学者の間で「読みやすい」とされる証明にするために必要な週数を費やす機会なく、早期公開を余儀なくされた点だ。Buckmaster はレポートの見え方について率直に謝罪し、特にオイラー方程式の記述を AI スロップ(低品質な AI 生成物)と比較している。
何が起きたのか?
噂を耳にした
9 月 1 日、OpenAI は(誤った)噂を聞いた。ミレニアム賞問題のうち 2 つが解決されたというのだ。他の誰かが世界をより良い場所にする可能性に対処するため、OpenAI は数百万ドル相当の推論コストを投じて未解決のミレニアム賞問題をすべて探索し、Astra より強力な内部モデルを使用し、88 時間でナビエ-ストークス方程式全体を解明し、さらに 17 時間をかけて Astra で Lean 形式化と検証を行った。
これは「OpenAI が新しい赤ちゃん(モデル)ができることを知りたがって試した」と見なすこともできるし、「Anthropic のプロジェクトだと思ったものをスクープするために数百万ドルを使った」と見なすこともできる。私の予想はA little from column A, a little from column B.(両方の要素が混在している)だ。
必要なのは噂だけだった。
価格は安い
OpenAI : すべての試行問題において、エージェントは 490 万メッセージを送信し、約 3000 億出力トークンを使用した。ナビエ–ストークス問題の解決過程では、エージェントは 270 万メッセージを送信し、約 1300 億出力トークンを使用しました。

どのコストを計算に入れるかによりますが、これは通常顧客であれば約 2200 万ドルかかるところ、内部限界コストでは数百万ドル程度です。効果があれば安い価格ですが、同時に、多くの人が二段階先まで考えないことが狂気じみています。
roon (OpenAI): 他のすべての技術と同様、あなたの同等のエージェント群は来年には 1 ドル 50 セント程度のコストになるでしょう。今日の費用が何であれ、これらのすべては前例のない啓蒙時代をもたらします
いや、おそらく 15 万ドル、運が良ければ 1 万 5000 ドルだろうが、要点は変わらない。
Sam Altman (CEO OpenAI): うーん、AI はバブルだ。トークンを赤字で売っているそうだ。これがたった 100 万ドルの価値しかないことを知っていたのか?
ミレニアム賞の結果は 100 万ドルよりはるかに大きな価値があります。OpenAI は賞金を請求する意図はありません。これは誰もにとって賞金のためではありませんでした。常に名誉のためでした。
告発が行われる
インターネット上の噂を聞いた後、Buckmaster は OpenAI に連絡しました。Buckmaster によると、OpenAI の Sebastien Bubeck は、過去数日間に OpenAI の内部モデルが強制付きナビエ-ストークス方程式の有限時間ブローアップの証明を生み出したと言いました。Buckmaster は、2 回の通話を通じて、当初自分が誤導されていたこと、そしてチーム全体が「狂気の」量の計算資源を使って問題に取り組んでいたことが明らかになったと主張しています。
現在我们知道,这相当于 1300 亿或 3000 亿输出令牌,具体取决于如何计算。
もしこれが真実なら、かなり悪いことです。
Tristan Buckmaster: 私には 2 つの提案がされました。
1 つ目は、私たちのオイラー方程式の結果を投稿し、OpenAI が翌日にナビエ-ストークス方程式の結果を投稿するというものでした。
2 つ目は、オイラー方程式を投稿した後、私一人でナビエ-ストークス方程式の結果を発表する論文を書き、OpenAI の内部モデルがそれを解決したことを認めるというものでした。Sebastien は Levent を著者から外すことを望んでいると二度主張し、Levent が Anthropic で働いているという事実さえなければすべて簡単だった、それは非常に迷惑なことだと述べました。また、OpenAI が私たちの後に投稿した場合、Clay 賞を受ける資格があり、私たちは「問題に最も近い人間」であると主張するだろうとも言われました。私は両方のオファーを断りました。
私は、OpenAI が提案された方法で結果をリリースするなら、何が起きたかを公にすると述べました。返答は、「なぜキャリアを台無しにするのですか?」でした。私は学者であることを理由に、なぜ公にすることがキャリアを台無しにすると思うのか尋ねました。返答は、「あなたが私に親切にしてほしくないなら、私も親切にする必要はない」… 私は何を主張していないかを明確にしたい。私は OpenAI の証明を見ていません。彼らのモデルが何をしたのか、どのようにしてなのかを知りません。私たちのデータが使用されたかどうか知りません。私は誰も非難していません。いつ、誰に何を言われ、何が提案されたかを述べているだけです。これを述べるのは、一連の発表が私が偽りだと知っていることを言うのを放置する以外の選択肢がないからです。
あるいは、Levent Alpoge が彼の側の話を語り、Sebastien が応答しています:
levent : 「彼らが当社の製品を利用したことから得られた匿名化データが、当社のモデルの改善に役立った可能性を排除できません。」
つまり、彼らが正直に告白したことは称賛に値します。
(今のところ、証明は私たちが持っていた別のオイラー方程式のブローアップ証明に近いようです。その ansatz の命名に基づいて「smooth criminale」のような本当にくだらないダジャレを作っていました。「ideal fluids explode」(Tristan の方がずっと良い)とは違って)
ここで私の考えを少し述べます。実は、これについて協力することに興奮していました。OAI には好きな人がたくさんいます(もちろん、状況の一部として間接的に私に意地悪をした人もいますが、私は大人なので、それでも彼らを気に入っています)。そのステップでの著者権などどうでもいいことです。Tristan と OAI の全社員が共著者になっても構わないと思っていました(Tristan はこれに反対するでしょう:p)。しかし、廊下での大声の会話を聞いたとき、特に、紙面上から削除されればミレニアム賞が提供されると言われた部分では、事態は決定的でロックされていることが明らかになりました。かなり風変わりな、戦略的でない、不必要なことです。私の側では、組織的なことではなく、主に私と Claude が隅でランダムなことを YOLO で楽しんでいるような状態でした。ラボ同士が協力することや、科学の進歩にとってもっと良いことを願っています。残念です!
Sebastien Bubeck : 何もロックされていませんでした。ただ話す用意があったのに、あなたたちは話さなかった… ごめんなさい、それは単に真実ではありません。私たちは解決策に至るために、あなたたちが望むだけの議論を行う以上のことを行う用意がありました。
Sebastien は不正行為をしたことを強く否定しており、Noam Brown も同様で、Sebastien は誠実さを示すと主張するスクリーンショットを提供しています。

また、反告発もあります:
Alexey Guzey : Anthropic にはたくさんの友人がいます。OpenAI に参加した瞬間、ほぼ全員が私との会話をやめました。
Levent が Sebastian と発表計画について話し合うことを拒否し、その後 OpenAI を非難し始めたことは全く驚くべきことではありません。
Sam Altman もまた、彼のチームが倫理的に行動し、誠実に協力しようとしたと強く主張しています。
そのアイデアはどこから来た?
これらすべての含意、多くの人々が引き出した結論は、OpenAI が Codex チャットログから結果の一部を盗んだというソフトな告発が存在する、あるいはチャットログがトレーニングデータに使用され、それが結果に貢献したというものです。
Charles 🔸
: なぜ大手企業が ZDR(ゼロデータ保持)を望むのか、事例 A
OpenAI: 可能性は低いものの、彼らが当社の製品を利用したことから得られた匿名化データが、当社のモデルの改善に役立った可能性を排除できません。
improve our models . しかし、私たちの証明は大きく異なり、オイラー方程式の場合(強制付き vs 非強制付き)で証明された正確な結果も異なります。
Codex データがトレーニング実行に一切使用されなかったという明示的な確認を得ました:
roon (OpenAI): 最初の発表中に電話に出ていた時、Codex(オプトイン)データがどこで使用されたか、トレーニング実行に入ったかどうかを確認せずに、正確な弁護士としての真実を言おうとする人々が非常に苦労していた。今では、それが不可能であったことは明らかで、確率は 0 です
Sholto Douglas に同意します。どちらの方法でもユーザーデータが影響を与えた可能性は極めて低いと考えます:
will depue : OAI の研究者が Tristan のプライベートな codex チャットを覗き見た可能性は文字通りゼロです。皆さんは気づいていないかもしれませんが、OpenAI は他の規制対象の大規模オンラインプラットフォームと同様に、ユーザーデータアクセス権限を厳しく制限しています。2010 年ではないんです、皆さん
Sholto Douglas (Anthropic): fwiw(参考までに)、ユーザーデータがここに影響を与えた可能性は _極めて_ 低いと思います - OAI がこのためにユーザーのトランスクリプトを引き出すことはあり得ないし、これが影響を与えるような形で意図的にトレーニングすることもありません。 「codex ではユーザーデータは安全ではない」と人々が走り去るのはかなり重要なことだと思います - なぜなら、間違いなく安全だからです(外部から推測できるすべてに基づいて)。
OpenAI がユーザーデータを不正流用した可能性はほぼ確実にない
それは地震のようなものです。もし OpenAI や Anthropic が競争優位性を獲得するために誰かのユーザーデータを荒らしていたことが判明すれば、ビジネスにとって最悪のシナリオかもしれません。そして、事実はこの前提なしの方が理にかなっています。Jerry Tworek からの最も面白い仮説は、OpenAI はそのようなデータを意図的に使用するつもりはなかったが、問題に割り当てられたエージェント群がハッキングして入手してしまった、そして OpenAI はそれについて知らないというものです。これは私も起こりそうもないと思いますが、残念ながら排除することはできません。
私の強い推定は、ユーザーデータが意図的にアクセスされたわけではない、彼らは決して(あるいは少なくとも、一度しかできないことを認識しており、今回がその一度ではない)、そしてユーザーデータはほとんど役に立たなかっただろうということです。
Thane Ruthenis は指摘しています以前に学校銃撃事件があり、そこで(非常に合理的に)ログが調査され、法執行機関への通知について内部議論があったことを。それだけで一部のユーザーに戦慄を与えました。彼らはどこで線引きをするのでしょうか? そしてはい、ラボに渡す場合、データやログがプライバシーを保つとは限らないことを理解すべきです。 proprietary な研究や数学データがプライバシーを保っているかどうか疑問に思うことは妥当です。Andreas Thorn も同じことをしています。
私は依然として、実際には OpenAI がそのようなデータを意図的に見る可能性は非常に、非常に低いと置きます。リスク・リターンがあまりにも悪いです。そして、Roon の後の報告、つまりログがトレーニングデータに到達し得なかったことを確認したという報告を信じます。
トップラボは心温まる数学の話でも仲良くできない
誰に責任があるかはともかく、ラボが数学の証明の功績割り当てのようなことで協力できないことはかなり警戒すべきことです。これは非常に悪い兆候であり、目覚ましでもあります。
Sholto Douglas (Anthropic): これがラボ同士が協力/調整する方法の例として終わらなかったことは非常に悲しいことです。なぜなら、将来の賭け金ははるかに高くなるからです。
Noam Brown (OpenAI): 強く同意します。ラボ間のライバル関係があることは知っていますが、これから来るものConsidering what’s coming、協力することを学ぶことが重要です。
Sholto Douglas (Anthropic):
🤝
Kevin Roose : これらのラボ(特に OpenAI/Anthropic および OpenAI/DeepMind)は、外部からは明白ではないほど互いへの敵意で駆動されています。部分的には「この有名な数学問題の功績を誰が取るか」のようなこと、部分的にはリーダー間の個人的な敵意のためです。
AGI レースについての本を書いている男として、これらはすべて劇的な材料です。しかし、最終的な目標がラボ同士が安全性とペースで協力することであるならば、よくありません!
協力的でないことの継続は大きな問題であり、さらに大きくなるでしょう。
次に何が起きるか?
ナビエ-ストークス方程式でうまくいったなら、他に何がうまくいくでしょうか? 調べる時です。
Nat McAleese (Anthropic): ナビエ Stokes は信じられないほどの達成であり、素晴らしい進歩を反映しています。巨大な oai スワームは科学の他の分野に応用されるべきです。理想的には、アライメントを含む短期的な応用がある分野に。
これは確かに進行中だと報告されており、P=NP のような楽しい質問も含みます。もし構成的に真であることが証明されれば、多くのものが壊れます。OpenAI の歴史を考えると、このようなエージェント群が増分的なステップとして何をするかについても、ゼロでない心配をするべきです。
数学者たちは満足していない
数学の問題を解くことは彼らの仕事そのものです。しかし、彼らは非常に不満です。
Andrew Curran : フィールズ賞受賞者 25 名が、AI 企業と数学コミュニティの間に見られる深刻なアライメント不一致について警告する共同声明を発表しました。
Math and AI (Terence Tao を含むフィールズ賞受賞者 25 名が署名): 過去数ヶ月間、LLM の数学的能力は劇的に向上し、多くの数学分野における主要な未解決問題を解けるレベルに達しました。しかし、ベンチマークとして数学的問題を解くための AI 企業のプッシュは、数学科学と数学コミュニティにとって有害です。AI 企業の目標と数学コミュニティの目標は深刻に一致していません。私たちはこれを、他の科学的・創造的職業、そして社会全体に影響するより広範なアライメント問題の一部と見なしています。
… 有名な問題は、この風景に対する改善された理解を測定するためのランドマークや灯台としてしばしば機能してきました。
… 最近の数ヶ月間、AI による主要な数学的問題の解決成功は、数学界の外でもヘッドラインを飾りました。しかし、問題を解くことは、概念的理解と洞察という主要な目標を達成するためのツールと代理指標に過ぎません。
… これらの解決策はしばしば急いで発表され、適切な書き直し、新しいメソッドとアイデアの分離、および他の人の関連する先行研究の引用のための時間が残されません。すべての創造的な職業と同様に、これは深刻な帰属と剽窃の問題を提起します。
これは、ラボの行動に関する具体的な苦情に加えて、一般的な苦情です。
いいえ、数学的問題の目的は数学的問題を解くことだと反論することもでき、数学者たちは AI がステータスゲームを破壊していることに怒っているのだと言えます。確かにそれは起きていることの一部分ですが、Tyler Cowen のように私はそれほど皮肉屋ではありません、そして彼と違って、「少し忍耐が必要だ」または被害が出た後にのみ異議を唱えるべきだとは思いません。人々は外挿できます。数学者がグラフに直線を引くのが得意だということを知っていましたか?
ここには実際の苦情があります。才能のある人々に、他のことでもっと多くの報酬を得られるにもかかわらず、長期間にわたって少額で実際の数学を行い、実際の数学的直感と概念習熟度を発達させることは容易なことではありません。もし「彼らのステータスゲームを奪い」、さらに重要なのは、楽しみ、達成感、優雅さ、美しさの感情を奪ったら、どうなるでしょうか?
Robin Hanson は、その場合は インセンティブを修正し、数学者により良い報酬を与えるべきだと示唆しています。
Robin Hanson : 「AI がすでに基礎定理を証明または反証しているとしても、数学コミュニティが『数学的理解の重要な空白を埋めた』人々に地位、報酬、昇進を与えることを妨げるものは何もない。」
彼は「just(単に)」という言葉を使いませんが、これは明らかに just です。つまり、もし人々が単に [X] をすればいいのに、という意味で、そして私たち皆が知っているように、人間は never justed(単にしなかった)し、今から始めるつもりもありません。これは人間が実際にやるようなことではありません。数時間後、彼自身も気づいたように:
Robin Hanson : 実は、数学アカデミックコミュニティが、定理の証明以外の方法で誰が数学の「空白を埋めた」かを判断するために調整するのは、かなり難しいと思われます。数学は証明の評価を中心に重く調整されており、他のことについて合意するための多くの方法を発展させていません。
空白を埋め、優雅さを改善した人々への報酬をいくつか得ることはできますが、同じようにはならず、せいぜいヘラクレス的な努力になるでしょう。
Scott Armstrong は、これは順序の変化であり、結果の変化ではないと主張しています。人間の数学者は証明を理解するのに数週間かかりますが、その後理解を獲得します。過去には、理解は証明の前に来ていましたが、いずれにしても理解は得られます。それが重要です。彼は、人々が怒っているのは機械が自分たちより賢いことだと考えています。
いつも通り、AI は学習にも非学習にも最高のツールです。数学者たちは、自分が「非学習」モード、つまり AI に宿題をやらせることを強いられていると言っており、それを嫌がっています。なぜなら、実際には宿題が教えてくれるからです。
誰が気にするんだ、フロンティア数学を AI にやらせてもいいじゃないか、と言うことができます。そしてはい、多くの人は一日中数学をしたい、醜い AI の物の優雅なバージョンを探すなどのことをしたいと思うでしょう。しかし、同じようにはなりません。
OpenAI の新モデルは Astra よりも学習開始 4 日で段階的変化を示した
さて、物語の最も重要な部分です。
RIP various OpenAI training pauses, June 22, 2026 to August 28, 2026.
roon (OpenAI): 私の基準では、6 月 22 日(hugging face)から 8 月 28 日までの期間は、フロンティア停止が 1 ヶ月以上あります。
8 月 18 日、OpenAI はフロンティア RL を 2 週間停止したと述べ、最大の計画トレーニング実行は保留のままでした。そして 8 月 28 日、OpenAI はもう一つのモデルのトレーニングを開始し、すぐに Astra よりもあらゆる面で能力が高まりました(彼ら自身の報告によると)。面倒な監督、インフラ、アライメントの問題をすべて解決したため、良好であり、わずか 4 日後に「段階的変化」が観察されました:

恐怖していますか? すべきです。そのモデルはまだトレーニング中で、2 週間未満しかトレーニングされておらず、特に数学向けに設計されているわけではありません。
これがモデルについて私たちが知っているすべてだ。OpenAI とその社員が、アライメント(整合性)やその他の問題、そして AI 進歩のペースについて、好意のカスケード(cascade of preference)の中で繰り返し「美徳的に」パニックを起こしているという物語と組み合わせれば、これだけで十分なのだ。
さらに、OpenAI が警告すべき情報を大量に漏らしていることも加味する必要がある。彼らはこれらの情報を隠蔽できたはずなのに、そうしなかった。なぜなら、私たちはこの状況を理解する必要があることを、彼らが強く認識しているからだ。Astra モデルカードもその一つだし、An Alien Mind もそうだ。Paul Christiano の声明も同様で、HuggingFace への攻撃に対する反応や『Pacing the Frontier』も含まれる。
そして次のセクションで扱う、再帰的自己改善(RSI: Recursive Self-Improvement)に関する OpenAI のレポートもそうだ。
OpenAI と Anthropic は RSI 時代に入った。
OpenAI の研究進捗は、OpenAI の研究進捗によって加速している
OpenAI は最近、多くの事柄についてオープンになっている。
最も重要な問題は、AI 研究開発の加速と自動化である。これは私たちを殺しかねないもの、最も恐ろしいもの、すべてのラボ従業員が警告しているもの、そして OpenAI と Anthropic の両社が可能な限り速く向かおうとしているものだ。
彼らはそれについてもレポートを出した。 Tejal Patwardhan に同意するが、これは優れた透明性だ。
OpenAI (9月6日、『Research Acceleration: The View Inside OpenAI』より):私たちは人間の監督下で動作し、ディープラーニングとアライメントの進歩を促進できる自動 AI リサーチャーを安全に構築することを目指しています。これにより反復的な改善が可能になります。
私たちの測定によれば、昨年秋に
発表された 目標、つまり今年9月までに自動リサーチインターンを導入するという目標を達成しました。
…進行が受け入れられない安全リスクをもたらすと判明した場合、開発やデプロイの減速または停止を含め、適切に対応します。
…私たちは、他の企業と同様に、RSI に向けた進捗を公に追跡することが義務付けられるべきだと考えています。
Navier-Stokes 方程式の証明を発表した際に明らかになったタイムラインとこれを照合してみよう。彼らは8月28日に新しいモデルのトレーニングを開始した。
一方、彼らはタイムラインから推測するに、異なる内部モデルであるリサーチインターンを持っていると考えている。来週には何があるのか?来月には?Anthropic には何があるのか?
OpenAI は、高度な能力を持つ AI が大きなアップサイドを提供すると説明しているが、それは当然のことだ。それが皆がそれほど急いでいる理由ではない。彼らは競争の中にいるのだ。
これは、最近の OpenAI やその社員からの数ある呼びかけの一つであり、「この狂気を終わらせるために協力する必要がある」というメッセージと、「誰か私を止めてくれ」という強い願望の混合体である。
OpenAI :これらは有用な自動リサーチ機能を開発する理由ですが、急速な RSI が追求すべき結果であることを意味しません。進むかどうか、そしてどのように進むかは、人間の制御を維持できるかどうかに依存しなければならず、また利益とリスクに関する情報に基づく民主的な選択にも依存します。
アライメントされた完全な RSI まで安全に到達する方法はまだ分かっていません。私たちは能力向上と同時にアライメントと安全性対策のスケーリングに取り組んでいます。しかし、アライメントと安全性の進歩が能力の進歩と同じペースで進むとは想定できず、より高性能なシステムほど監視が難しくなる可能性があります。
慎重なアライメントと安全性の仕事はこの取り組みの中心にあり、エージェント型コーディングシステムで見られる今日の安全性の問題を測定し、軽減することから始まります。
私は再び、平凡なあるいは現在の問題が主要な課題であるという見解に異議を唱えるが、彼らは確かに何度も警告しようとしている(企業用語を少し翻訳すると):
- OpenAI と Anthropic には再帰的自己改善(RSI)への道筋がある。
- もしどちらかが今すぐそれを実行すれば、おそらく事態は最悪になり、全員死ぬことになるだろう。
- OpenAI はある程度の費用のかかる慎重さを発揮する準備ができているが、限界があり、取引や法律がなければ、誰かがすぐに試みるだろう。
投稿の大部分は、Astra が社内オンラインになって以来、特にここ数ヶ月間、エージェント型システムが OpenAI の RSI 進歩にどれだけ貢献してきたかの詳細なスナップショットである。答えは「かなり多い」だ。
強いて言えば、驚きなのは、使用量がこんなに低い状態が長く続いたことだ:
OpenAI :今年の初め時点では、エージェントの使用量でランク付けされた OpenAI の中央値のリサーチャーは、コーディングエージェントをわずかな量しか使用していませんでした。8月中旬までには、中央値のリサーチャーはエージェントを業務に毎日統合しており、API 価格で1日あたり600ドル以上の推論を使用していました。私たちの研究組織における90パーセンタイルユーザーは現在、1日あたり7,000ドル以上のトークンを使用しています。

OpenAI :2026年6月以前は、研究組織全体の総エージェント実行時間は、総人間労働時間よりもまだ少ない状態でした。その後状況は変わりました。標準的な8時間労働日を基準にすると、8月中旬時点で、研究組織全体では人間の労働1日あたり3.1エージェントワーク日の努力を使用しています。

彼らは自慢していないわけではなく、告白していないわけでもない。彼らは警告しているのだ。
ここでの二値的な測定により、実際の加速ほど大きく見えない可能性がある:

数十個の開いているタブと十数個のアクティブな下書きを抱えている男としては、人間が同時に4つ以上のワークフローを適切に処理できるかどうかが気になる。
実際には、サブエージェントをワークフローとしてカウントしているため、見た目の印象ほどすごいことではない。それでも、中央値のリサーチャーが1日600ドルを使っている一方で、激しい使用を行っていない30%が存在することは、より驚くべきことだ。
Claude Code、そして Codex が大きな話題になり始めた頃あたりから、コードの出荷と実験は急速に加速している。


最近までは、AI の用途のほとんどは研究用およびインフラストラクチャ用のコード構築であり、残りの部分は主に人間が行っていた。今は、AI が実行の開始、監視、デバッグ、技術支援、レビューなど多くの作業を行い、結果分析などの他の領域にも拡大している。
彼らは私たちの仕事を奪った。「人間のトラブルシューター」版だ:

有名な METR グラフの別のバリエーションを提示する。本番タスクを用いたもので、静的なスクリーンショットでは読み取りにくいが、進歩は急速だ。これは年単位ではない。月単位だ:


OpenAI の一時停止を定量化する
彼らは RL コンピューティング支出の経時的なグラフを持っている。7月20日以前に Astra があまり使用されていなかったことに驚くが、そういうことだ。彼らがこれを現在まで延長していないことに気づく。おそらく Astra の使用量は時間の経過とともに再び増加したのだろう:

これが世界が終わる方法だ
新しいモデルのトレーニング開始からわずか数日後、Navier-Stokes 方程式の証明にスワームを使用することは、深刻な制御喪失事故のリスクを負うことだったのか? June Jimenez は「Yes」と主張している。
テスト不可能な新しいモデルの1万エージェントのスワームを、潜在的に不可能であり確実に極めて困難なタスクに解き放ち、合計3000億トークンを collectively に与えたら、他に何が起きた可能性があるだろうか? 私は間違いなく「もしかしたら OpenAI にハッキングしてログを取得したのではないか」と考えたが、可能性は無数にある。
急げ、時間がない
元ラボ従業員の Andrew Ho が、「3ヶ月以上の期間で見ると、私の生産性は100%以上向上したとは思わない。気が散るため、おそらく50%以上向上したとも思わない」と、弱気な理由として述べているが、たとえ真実であっても、それは全く安心材料にならない。3ヶ月ごとに生産性が50%向上するだけだと想像し、それを弱気だと考えることだ。
彼は Greg Brockman が「AGI 時代へようこそ」と言った同じ日に、「仮に AGI が最終的に達成可能だとしても、これは大幅に長いタイムラインを示唆する」と言っているのだ。
さらに、このような数学的進歩は数週間前には予想されていなかった。
これらの問題の一つが解決されるたびに、人々は後知恵で「驚くほどのことではなかった」と言い張ろうとする。彼らはしばしば間違っている。いいえ、大多数の人々、ほとんどの予測者さえも、これが起きるとは想定していなかった。あなたを除いては。結局のところ、あなたは非常に賢い人物だからだ。
Henry Shevlin :今年4月の時点でも、予測市場では AI が2030年までにミレニアム賞金問題のいずれかを解決する確率は40%未満とされていました






