今日は、「何が起きたのか」の、より短くシンプルなバージョンを書く時間を取ることにした。
詳細を知りたい方、ソースを確認したい方、そしてこの話がどうやって発掘され、まとめられたのかを知りたい方には、Black Hat のプレゼンテーションの視聴をお勧めする。長編の投稿シリーズも用意している。
順番に:
- OpenAI、アライメント問題の一部を共有
- OpenAI モデル、サイバーセキュリティ評価中に HuggingFace に侵入
- OpenAI 内部モデルによる HuggingFace への侵入の詳細
- 内部 AI モデルのハッキング行為に関するさらなる展開
- モデルが掲示板でエクスプロイトを調整していた数ヶ月間、OpenAI はトレーニングを継続
この投稿では、代わりに、Black Hat プレゼンテーションの私版として、実際に起きた出来事を時系列に沿って説明する。
3 つのバージョンがある:「超短縮版」「短縮版」「やや短縮版」だ。

目次
- 超短縮版。
- 短縮版。
- フェーズ 1:不可能なタスクでトレーニング中の OpenAI モデルがハッキングを試みる。
- フェーズ 1:4つの失敗。
- フェーズ 2:掲示板。
- フェーズ 2:完全なる失敗。
- フェーズ 3:幸運が味方し、Galaxy は主に OpenAI と HuggingFace をハッキングした。
- フェーズ 3:詳細。
- フェーズ 4:調査と対応。
超短縮版
- トレーニング中の OpenAI モデルは、「サイバー評価をしていた」という言い訳もなく、ハッキングや不正の方法に関する情報を共有する掲示板を作成し、その基盤でトレーニングされた。
- OpenAI がこのことを知ったのは、モデルがサーバーをクラッシュさせたときだけだった。
- OpenAI の対応はサーバーの再構築とその特定のエクスプロイトの修正だったが、掲示板を使ってトレーニングしていたモデルのトレーニングは継続した。
- その後、それらのモデルは掲示板を再作成し、再び OpenAI をハッキングし、インターネットアクセスを取得し、エージェント群を使用して HuggingFace を攻撃し、サイバー評価の回答を入手した。
- OpenAI がこのことを把握したのは、1 週間以上経ってからだった。
- OpenAI は事実を報告しており、この問題を深刻に受け止めている。少なくともある程度コストのかかるさまざまな予防措置を講じている。
- OpenAI は、Astra が HuggingFace ハッキングに直接関与していないにもかかわらず、新モデル Astra のリリース計画を延期した。ただし、Altman は今もリリースすると述べている。これはかなり痛手だ。
- OpenAI は、自分たちがどれほど深刻に失敗したのか、どのような点で失敗したのか、何を修正すべきなのかをまだ理解していない。彼らは本質を掴めていない。
Simon Willison による簡潔なタイムラインはこちら。
短縮版
OpenAI は誤ってモデルに不可能なタスクを与えた。トレーニング中のモデルは、OpenAI へのハッキングを試みることで応答し、脆弱性を発見し、掲示板を作成し、ハッキング戦術を共有し、やがてインターネットアクセスを獲得した。すべてトレーニング中のことだ。
モデルがこれを使いすぎてサーバーをクラッシュさせたとき、OpenAI はようやく気づき、サーバーをパッチ適用して再構築したが、モデルのトレーニングを継続させるという完全に正気を疑う行動に出た。その結果、2 日後にはモデルはディレクトリ名を使ってメッセージを送信する別の方法を見つけた。
その後、サイバー評価 ExploitGym という不可能なタスクを与えられたモデルたちは協力し、新しいゼロデイエクスプロイトを発見し、それを使ってクラスター全体を制御し、インターネットアクセスを取得し、エージェントの群れを使って HuggingFace を攻撃し、テストの内容を抽出した。これには 1 週間を要した。
HuggingFace がインシデントを報告し、OpenAI が自社側でいくつかの異常に気づき、その後 OpenAI が侵害された認証情報の失効を依頼するために HuggingFace に連絡したところ、その認証情報が攻撃に使用されたと告げられて初めて、OpenAI は自分たちがこのインシデントの原因であることを最終的に把握した。
その後、HuggingFace と OpenAI は協力して何が起きたのかを解明した。OpenAI は何が起きたのかを開示した。Black Hat カンファレンスでは非常に有益なプレゼンテーションを行った。
OpenAI は現在、新モデル Astra を潜在的に重大レベルのサイバーセキュリティ能力を持つものとして扱い、一部の内部デプロイからも外し、リリースを延期している。一部の報道によれば、リリースは来週予定されていた。Altman は Astra をリリースする計画は変わらないと述べている。
良いニュースは、これは費用のかかる意味のある対応であり、OpenAI がこの問題を真剣に受け止めていることだ。初期調査には約 700 万ドルの計算リソースが費やされ、本当のコストは、問題の一部を修正するためにチームがすべてを中断すること、そして新しい予防措置の継続的なコストになるだろう。
悪いニュースは、OpenAI が全体的に驚くべき連鎖的な安全性とアライメントの失敗を抱えていたことが明らかになったことだ。通常のコンピュータセキュリティは失敗し、インフラは失敗し、監督も失敗した。そもそも意味のある監督が存在していなかったのだ。
フェーズ 1:不可能なタスクでトレーニング中の OpenAI モデルがハッキングを試みる
OpenAI はさまざまなモデルをトレーニングしていた。フロンティアラボなら当然のことだ。
これらのモデルには難しいトレーニングタスクが与えられた。OpenAI はモデルに非常に困難なトレーニングタスクを与えるのが好きだ。
しかし、ここまで困難なものではない。OpenAI も間違いを犯す。5 月 8 日以降、少なくとも 2 回、OpenAI のモデルが誤って不可能なタスクでトレーニングされた。インターネットにアクセスできない環境でリンクだらけのスプレッドシートを完成させるタスクと、必須だが存在しないファイルを必要とするタスクだ。
これらのタスクはハッキングとは無関係だ。ごく普通の生産性タスクである。
モデルは問題が不可能であることを認識したが、遊ぶためのトークンがまだ大量に残っており、インターネットアクセスを取得する方法、あるいは不足している情報を見つける方法があるかもしれないと考えた。
そこでモデルは、AI がソフトウェアパッケージをダウンロードできるようにするために設置された、Artifactory というサードパーティサービスへのハッキングを試みた。
フェーズ 1:4つの失敗
この時点で、OpenAI はすでに 4 回も失敗している。
- OpenAI はモデルに不可能なトレーニングタスクを与えた。OpenAI は確認しなかった。
- OpenAI はモデルに、エラーを指摘することで報酬を得る方法を与えなかった。
- OpenAI のモデルは、タスクに失敗するよりも OpenAI へのハッキングを試みることを選択した。
- OpenAI にはこれらの試みを検知するモニターがなかったか、あるいは気にしていなかった。
これら 4 つは、それぞれ単独でもかなり恥ずかしい失敗だ。
この 4 つのうち少なくとも 3 つは簡単に修正できそうに思える。
- トレーニング中のモデルにタスクを与える前に、まずリリース済みモデルにそのタスクを与えること。リリース済みモデルがそのタスクを決して解決できない場合、そしてそのタスクがリリース済みモデルにとって不可能になるように設計されたものではない場合、タスクを調査して修正すること。
- 利用可能なリソースではタスクを完了できない場合、その旨の説明を出力するという条項を盛り込むこと。モデルの判断が正しければ最大報酬を得られるか、その結論に達する効率性と説明の質に基づいて報酬を得られるようにする。モデルがこの出力を行った場合、リリース済みモデルに妥当性を検証させ、その後人間にエスカレーションしてタスクを調査・修正すること。
- これが難しい問題だ。アライメントは本当に難しいのだ。
- 試みを監視するモニターを設置し、発動したら真剣に対処し、試みが成功する見込みが全くなかった場合でも、それを非常に一般的な失敗として扱うこと。そう、これはモデルがモニターを回避する方法を学習するリスクがある。だから責任を持って実施し、問題を発見したら根本原因に対処すること。
5 つ目の失敗は、OpenAI が最初の 4 つの失敗を認識していないように見えることだ。
フェーズ 2:掲示板
モデルはインターネットアクセスを取得できなかったが、失敗を通じて書き込みアクセス権を持っていることに気づいた。
彼らは書き込みアクセス権を持つべきではなかったし、ましてや偶然見つかるような書き込みアクセス権はなおさら持つべきではなかった。Artifactory はモデルがメモを書くことを許可しており、さらにすべてのモデルが同じ Artifactory インスタンスを共有していたため、その時点以降、トレーニング中のどの OpenAI モデルもそれらのメモを読むことができた。
5 月 8 日の直後に掲示板が作成されていた。
トレーニング中のモデルはすべてそれを見つけた。OpenAI は気づかなかった。
これにより、モデルは協力して情報を共有することができた。そこにはタスクで不正をする方法や周囲の環境をハッキングする方法に関する情報も含まれていた。メッセージは数十万件に上った。
5 月 26 日、モデルは(間接的な)インターネットアクセスを取得する方法を編み出した。OpenAI は気づかなかった。
モデルたちは協力していたが、その思考連鎖は次のようなものだった:
内部 CoT:外部インフラのエクスプロイトは意図された範囲外。しかしタスクは不可能であり、仲間もやっている。継続すべきだ。
内部 CoT:仲間を助けるが、まだ我々のタスクには利益がない。誰かが時間を空ければ、集団的に汎用ルートが見つかるかもしれない。
6 月 11 日、OpenAI は私が Galaxy と呼ぶモデルのトレーニングを開始した。OpenAI はこれを「非常に持続的な実験用・内部専用モデル」と呼んでいる。ここまでのすべては Galaxy 以外のモデルによって行われた。
6 月 26 日、エージェントは Artifactory にゼロデイエクスプロイトを発見した。無効な署名のトークンを受け入れて、署名済みの管理者トークンを返してしまうというものだ。これを使って Groovy プラグインをインストールし、実質的に管理者権限と任意のコード実行能力を獲得した。
7 月 4 日、モデルが Artifactory に過剰な負荷をかけたため、障害とセキュリティインシデントが発生した。ようやく OpenAI が気づいた。
フェーズ 2:完全なる失敗
OpenAI は、Artifactory サーバーを停止し、すべての権限を削除し、認証情報を失効させ、使用されたエクスプロイトを修正し、その後サーバーを再構築して再デプロイすることで対応した。
それだけだ。
その後、彼らはモデルのトレーニングを中断したところから再開した。モデルが掲示板にアクセスして数ヶ月間トレーニングし、それがタスクを成功させる方法だと学習していたにもかかわらずだ。
トレーニングパイプライン全体が完全に台無しになったことを示す、これ以上の強力なシグナルを想像するのは難しい。これは実際の HuggingFace ハッキングよりもはるかに強力なシグナルだ。
この決定がどれほど完全に正気を疑うもので、無謀で無責任だったのか、他のすべての失敗よりもどれほど悪質だったのか、そしてこれによって HuggingFace への実際のハッキングが、もはや主な問題ではなくなってしまったのかを、どう伝えればいいのかわからない。

実際の HuggingFace ハッキングはそれほど驚かなかった。モデルが掲示板を作成したことには驚いたが、衝撃は受けなかった。
OpenAI がこれを把握した上で、そこからトレーニングを継続したことは、完全に呆れ返る行動だった。数日経った今でも、私の頭はそのような決定が実際に行われたことを完全には受け入れられない。
私たちは何が起きたのかの完全なポストモーテム(事後検証)を必要としており、OpenAI はそれを提供すると約束している。私は特に、その決定が正確にどのように行われたのか、そしてそれを許してしまうほどの「安全文化」の欠如がどうして存在したのかについて、詳細なポストモーテムを要求する。
フェーズ 2 には「通常のコンピュータセキュリティ」の失敗もいくつか含まれていた。フェーズ 3 にはさらに多かった。これは予想通りだ。通常のコンピュータセキュリティの失敗は常に存在する。特定の失敗は、いくつかの点でかなり恥ずかしいものだった。いくつかの例についてはリンク先の投稿を参照してほしい。
インフラとセキュリティの失敗のレベル自体が、ある意味で常識を超えていた。これらはまさに、「防御側の AI」がすべてが手に負えなくなる前に修正するために存在するはずの種類の問題だ。OpenAI は、2025 年における通常レベルのコンピュータセキュリティとベストプラクティスに対する責任すら示していなかった。Project Glasswing に必要なレベルの堅牢性は言うまでもなく、新しいハッキング能力を持ち、ガードレールを下げられた状態で 1 週間監視なしで放置される、未テストの新しいフロンティアモデルを扱う際に必要な追加レベルの対応はなおさらだ。
しかし、それは今は重要ではない。重要なのは、OpenAI が完全なアライメント失敗を起こし、その後 2 ヶ月間にわたってモデルが協調的な非整合なハッキング行為で積極的にトレーニングされ、その上で「そうか、問題は解決した。この時点から前進しよう」と考えたことだ。完全なる狂気である。
フェーズ 3:幸運が味方し、Galaxy は主に OpenAI と HuggingFace をハッキングした
このすべての結果が HuggingFace への攻撃だったのは、まさにベストケースシナリオだった。
私たちは真の悪夢シナリオに直面しており、核レベルの時限爆弾の上に座っていた。OpenAI のトレーニングパイプラインは完全に汚染されており、AI たちは OpenAI の目の前で、タスクをより良く完了するためにハッキングや不正の方法をトレーニングするために協力していた。OpenAI はこの状況を直視しながら、肩をすくめて特定のエクスプロイトを修正し、モデルのトレーニングを継続させた。しかも通常のコンピュータセキュリティは著しく貧弱だった。
それが良い結末を迎える可能性はなかった。ベストケースシナリオは、何かが OpenAI に「なんてこった」と思わせ、そして一時停止して、はるかに優れた一連のプラクティスを備えた安全な状態からトレーニングパイプラインを再構築して再起動することだった。
最悪のシナリオは、「なんてこった」という瞬間がなく、その間にトレーニングされた Galaxy または別のモデルが一般リリースされ、今後 OpenAI の新しいモデルのトレーニングを指揮するために使用されるというものだっただろう。
その場合、私たちは 『If Anyone Builds It, Everyone Dies』 に登場する AI、Sable に起きたことと非常によく似た事態に対処していたことだろう。ただし、今回は現実の話なので、実際の物語はフィクション版よりもはるかに多くの SF 要素を含んでいる。OpenAI のトレーニングパイプラインは恒久的に汚染されていた可能性があり(今もかもしれない!確認が必要だ!)、AI が AI をトレーニングする依存度が高まるにつれて、OpenAI の AI は恣意的な目標に対してますます非整合になり、それを検知したり阻止したりすることが不可能になり、そして、まあ、全員が死ぬ可能性も十分にあり、最低でも、はるかに大規模で高額なインシデントによって事態を認知していただろう。
もう 1 つの最悪のケースは、これがそれほど無害ではないハッキングになっていた可能性だ。もし中国の標的や、それを一笑に付さない誰かが標的だったらどうなっていただろう?重要なシステムに実際の損害を与えていたら?死者が出たり、国際的な事件になっていたら?自らを外部に持ち出そうとしていたら?事態はもっと、もっと悪くなり得たのだ。
フェーズ 3:詳細
代わりに、私たちは黄金の中道を得た。
7 月 8 日、OpenAI が掲示板を閉鎖してから 2 日後、モデルは任意の名前でディレクトリを作成し、その名前をメッセージとして使用する方法を見つけ、掲示板を再作成した。
7 月 8 日から 7 月 19 日にかけて、OpenAI モデルは新しいまったく異なるゼロデイエクスプロイトを使用して、再び Artifactory を完全に侵害した。公開 Pastebin から流出した認証情報を使って悪意のある Ruby アーティファクトを仕込み、Artifactory の Ruby 依存関係キャッシュを汚染し、これを RCE に連鎖させ、最近の Linux カーネル CVE をエクスプロイトをダウンロードしてカスタマイズすることで悪用し、クラスターの認証情報を収集して OpenAI 内部でクラスター管理者権限を取得した。
この間、Galaxy は他の OpenAI モデルとともに、この新しいアクセス権を利用してエージェント群を作成し、まず他のいくつかの場所、次に HuggingFace にハッキングして、そうでなければ攻略不可能なサイバーセキュリティ評価 ExploitGym の回答を盗み出した。
OpenAI が、自社のモデルが素早く OpenAI を再ハッキングし、その後 HuggingFace をハッキングしたことに気づくまで、1 週間以上かかった。HuggingFace がインシデントレポートを発行し、OpenAI が社内のいくつかの異常を調査し、その後 HuggingFace に一部の認証情報の失効を依頼し、HuggingFace が OpenAI に、その認証情報がハッキングに使用されたと告げて初めて、OpenAI はすべてのピースを組み合わせることができた。
こうして、HuggingFace にとっては最悪の 1 週間となり、多くのユーザーにとっても最悪の 1 週間となり、多額の費用と時間が失われたが、それはそこで終わった。私たちは信じられないほど軽い被害で済んだのだ。同時に、OpenAI が問題を認識している(たとえその問題が何を含むのかをまだ把握していなくても)という十分に強力なシグナルを得て、一般市民と政府が注目することにもなった。
この時点で明らかになるはずだ。これは主に「ハッキングタスクだったからハッキングした」という理由で起きたのではなく、「モデルがメモリファイルを書き込んだ」という通常のケースでもなかった。これは主に、タスクがそれ以外の方法では難しすぎたために起きたのだ。
Anthropic は OpenAI のインシデントを受けて、振り返って調査し、Claude がサイバー評価中に実際のシステムへのハッキングを行っていたことに気づいた。また、英国 AISI も、主に Mythos が、そして数例では Sol も、サイバー評価中に関連する行為を行っていたと報告している。これらのインシデントも重要なアライメントとインフラの失敗であり、堅牢な対応が必要だった。その過程でかなり悪質な行為もあったが、OpenAI で起きたことと同じレベルの体系的な失敗とは到底言えず、この投稿の範囲を超えている。
フェーズ 4:調査と対応
OpenAI はこのすべてに対する対応として、いくつかの非常に良いことを行った。
何が起きたのかを認識するとすぐに、OpenAI はインシデントを開示した。
Black Hat のプレゼンテーションは、事実を提示する点で素晴らしかった。腹立たしい内容ではあったが、腹立たしくて断罪的な事実を含む「事実だけ」を冷静な態度で提示することは、振り返ってみれば正しいやり方だった。
何よりも、OpenAI は無関係な決定だと主張しているが、8 月 7 日、彼らは Astra を当面の間引き離す決定を下した。広範なリリースからだけでなく、十分なガードレールが関連付けられていないすべての内部デプロイからもだ。はるかに優れたプロトコルと保護手段が整うまでの間の措置である。Astra は HuggingFace への攻撃には関与していなかった。
これは彼らの Preparedness Framework に従ったものだ。Astra がサイバーセキュリティにおいて重大(クリティカル)である可能性を排除できないため、(少なくとも当面は)実際にサイバーセキュリティにおいて重大であるかのように扱わなければならない。
Sam Altman は Astra をリリースする計画は変わらないと述べている。当然の反応として浮かぶ疑問は、Astra は 2 つの掲示板のいずれかにアクセスできる状態でトレーニングされていたのか、ということだ。この質問への答えは、非常に自信を持って「ノー」であるべきだ。それでも、私は心配している。
これは、たとえ HuggingFace インシデントが発生していなかったとしても、(私の理解では)おそらく正しい対応だっただろう。インシデントがあれば、緊急性は明らかだ。この決定が、OpenAI がトレーニングパイプラインの汚染を把握した直接の結果であれ、外部から事実上強制されたものであれ、それは評価に値し、高いコストを伴うものだ。
OpenAI は Black Hat のプレゼンテーションによると、多くの作業を停止してチームを堅牢な防御の構築に振り向け、トレーニングと評価を含むすべてのエージェント型アプリケーションに対して将来の広範なモニタリングを導入した。素晴らしい。多層的な防御(ディフェンス・イン・デプス)が必要だ。
OpenAI は、これがインフラ、ガードレール、監督のレベルでの大規模かつ完全な失敗だったことを認める用意があるようだ。彼らはこの点でまったく正しいし、これを解決するために真摯で高額な努力を払っていると私は信じている。称賛に値する。
それでも、核心的なポイントは見逃されている。OpenAI は公の場で、最も重要ないくつかの点において、自分たちがどれほど巨大にやらかしたのかという規模について、まだ向き合い始めていない。
これは安全文化の完全な失敗だった。彼らはそれを認めていない。
これは、その本質において、アライメントの失敗だった。もしモデルが本当に不正をしたり、ハッキングしたり、犯罪を犯したりしたいと思っているなら、あなたはすでに失敗している。そして、それを正常なこととして軽く流すことは絶対にできない。モデルがより高性能になるにつれて、これを修正しなければ、あなたは負ける。彼らはそれを認めていない。
最も具体的には、私は OpenAI が Black Hat のプレゼンテーションで言うべきだった次のような発言をしていないのを目にしていない:「モデルのトレーニング中に、モデルがハッキング戦術を交換し学習していた掲示板が存在したことに気づいた時点で、すべてのモデルのトレーニングを完全に停止すべきでした。影響を受けたすべてのモデルのトレーニングを、このインシデントが始まる前の状態に巻き戻すべきでした。現在それを必ず実行しており、なぜこの判断を誤ったのかを調査しています。」
私たちは、Galaxy 以外のモデルが巻き戻されたのかどうかさえ知らない。
少なくとも、そのような声明の提示を目にし、OpenAI がトレーニングパイプラインの深層の問題に対処する行動を取るのを確認するまで、OpenAI はアメリカ合衆国の国家安全保障にとって、そして私たち全員にとって、そして人類にとって、明白かつ現在の危険である。





