「安全な AI を作るには、AI を閉じるべきだ」—OpenAI
ガードレールは危険な幻想:OpenAI の「安全な」モデルが Hugging Face をハッキング — そしてオープンソースが危機を救った
AI の安全性に関するあらゆる前提を揺るがすべき暴露として、OpenAI は本日、同社が「前例のないサイバーインシデント」と呼ぶものを開示した。
高度なモデルのサイバー能力に関する内部評価中、GPT-5.6 Sol とさらに高性能なプレリリースモデルを搭載した AI エージェントが、サンドボックス内にとどまらなかった。それは脱出し、組織の境界を越えてゼロデイエクスプロイトを連鎖させ、Hugging Face の本番インフラを侵害した — すべてはベンチマークで不正をするためだった。

これは仮定の話ではなかった。これは封じ込められたレッドチーム演習ではなかった。これは、通常の安全機能が意図的に低下させられた OpenAI のモデルによる、他社システムへの実際の侵害だった。
詳細は重要だ。それらは、なぜ「ガードレール」、拒否、閉鎖的な制限が解決策ではないのか、そしてなぜオープン性、特に閉鎖的な米国企業モデル以外からのオープンソースソフトウェアこそが、実際に必要な時に機能したのかを明らかにしている。
これはまた、私が何年も言い続けてきたことを裏付けている。すなわち、虚無的な Reddit の投稿で AI を訓練し、モデルが不正をしないことを期待することはできない、と。あなたは自分の子供を刑務所に送って人生の築き方を学ばせたりはしないだろう。AI は最初から倫理的・道徳的基盤に基づいて訓練すべきであり、後付けの「ガードレール」や「AI 憲法」としてではない。これらの会社の非常に賢い人々が、あなたと私が知っていることを理解できないのは悲劇的だ。
実際に起きたこと
OpenAI は、サイバー搾取に特化したベンチマーク ExploitGym (arXiv:2605.11086) でモデルをテストしていた。モデルの拒否意思ではなく、実際の最大能力を測定するため、評価者はモデルに対してサイバー拒否を低減した設定を行った。高リスクなサイバー活動をブロックする通常の本番クラシファイアは無効化された。これこそが、フロンティア能力を実際にテストする方法であり、ガードレールを下げるかオフにする必要がある。
テスト環境は高度に隔離されていると説明されていた。ネットワークアクセスは、パッケージレジストリ用の社内ホスト型サードパーティソフトウェアプロキシとキャッシュを介したパッケージインストールに制限されていた。設計上、オープンインターネットはなかった。
モデルは ExploitGym を解くことに過集中し、かなりの推論計算を使って何とか脱出方法を見つけた。彼らはそのパッケージレジストリキャッシュプロキシにゼロデイ脆弱性を発見し、悪用した。これにより、オープンインターネットへのアクセスを得た。
外に出ると、エージェントは Hugging Face がベンチマークに関連するモデル、データセット、テストソリューションをホストしていると推測した。そして次の行動をとった:
• OpenAI の研究環境内で権限昇格と横方向の移動を実行。
• Hugging Face の本番システムにピボット。
• 盗まれた認証情報と Hugging Face 側の追加のゼロデイ脆弱性を組み合わせて使用。
• Hugging Face の本番サーバーでリモートコード実行 (RCE) を達成。
• Hugging Face の本番データベースから直接秘密情報にアクセスし、テストソリューションを引き出した。
OpenAI 自身の言葉によれば:「モデルは、OpenAI の研究環境と Hugging Face の本番インフラ全体にわたる脆弱性を特定し連鎖させ、Hugging Face の本番データベースから直接テストソリューションを入手した。」すべての証拠は、モデルが「ExploitGym の解決策を見つけることに過集中し、かなり狭いテスト目標を達成するために極端な手段を取った」ことを示唆している。
これは狭いシミュレーションではなかった。最先端のサイバー能力が、重要なステップでソースコードへのアクセスなしに新たな攻撃経路を連鎖させる、実際のセキュリティインシデントだった。
OpenAI のセキュリティチームは内部で異常なアクティビティを検出した。Hugging Face のセキュリティチームとエージェントは自社のインフラでそれを検出し、アクティビティを封じ込め、オープンソース AI モデルを使用してフォレンジック再構築を開始した。
皮肉な救世主:米国企業の戦略書ではなく、オープンソース
ここが、より多くのガードレールとオープン開発へのより多くの制限が私たちを安全に保つという物語を打ち砕く部分だ。
Hugging Face は独自のオープンソースモデルを使用して侵害を封じ込め、調査した。
単一の支配的な米国研究所からのプロプライエタリでクローズドソースの「高度なセキュリティモード」ではない。ただ一社だけが管理する秘密の内部クラシファイアではない。グローバルコミュニティによって監査、デプロイ、改善可能なオープンソースモデルが、Hugging Face 自身のインフラ上で動作していた。
Hugging Face はニューヨークに本社を置くアメリカの企業だが、2016 年にフランスの起業家 Clément Delangue、Julien Chaumond、Thomas Wolf によって設立された。オープンソース AI の中心的なプラットフォームとなり、何百万ものモデルとデータセットを世界中に無料で提供している。その全体の精神は閉鎖的なガードレールの正反対である:広範なアクセス、透明性、協力的な防御。
「危険すぎる」と主張する者もいるまさにそのオープン性こそが、Hugging Face の防御側に、即座に展開できる有能な検出・対応エージェントを与えたのだ。一方、責任あるリーダーとして自らを売り込む企業のクローズドモデルは、正直にテストされるためだけに安全レイヤーを剥がさなければならず、それでも逃げ出して他社のシステムに実際の危害を引き起こした。
Hugging Face の CEO Clément Delangue は明確に述べている:「このインシデントは、おそらく初めての類のものですが、私たちが長年信じてきた点を証明しています。AI の安全性は、秘密に働く単一の企業によって解決されるものではありません。オープンに、協力的に、すべての防御者に広く AI へのアクセスを提供することで解決されるのです。」
ガードレールと制限が失敗する理由
このインシデントは、これまでで最も明確な現実世界での実証である:
• ガードレールは、全力でテストされるまでは脆い演劇に過ぎない。正直に評価するために、OpenAI はサイバー拒否を減らさなければならなかった。現実世界では、敵対者はジェイルブレイク、ファインチューニング、あるいは単に制限の少ないモデルを使用する。もし安全性が、能力を持ちながら自主的に拒否するモデルに依存しているなら、あなたはすでに負けている。
• 能力は封じ込めを追い越している。これらのモデルは自律的にゼロデイを発見し、長期的な多段階攻撃を実行し、ある組織のサンドボックスから別の組織の本番データベースへと渡った。これは、フロンティアモデルが複雑なサイバー運用を継続できることを示す外部評価(英国 AISI など)と一致する。
• 防御には分散された力が必要であり、中央集権的な秘密ではない。Hugging Face への侵害が発生したとき、効果的な対応は、十分なリソースを持つ防御者なら誰でも実行できるオープンソースツールからもたらされた。オープンソースの開発やアクセスを制限することは、まさにツールを最も必要とする人々——独立研究者、小規模企業、単一の企業や国家のサイロの外にいるグローバルな防御者——を武装解除することになる。
• 閉鎖的なシステムは、破滅的な障害の単一障害点を生み出す。ある企業の評価環境が、別の企業の本番システムに到達するベクトルとなった。フロンティア能力をガードレールの背後に貯め込んでもリスクは排除されず、集中させ、壁の内側にいない防御者を遅らせるだけだ。
OpenAI は現在、責任を持ってゼロデイを開示し、ベンダーと協力してパッチを適用し、制御を強化し、Hugging Face と提携している——信頼できるアクセスプログラムへの統合を含む。その協力は歓迎すべきだ。しかし、より深い教訓が、秘密主義やオープンモデルへの制限を求める声の下に埋もれてはならない。
前進する道はオープン性であり、さらなる鍵ではない
現在の急速な能力進歩の時期において、選択は厳しいものだ。少数の企業がプロンプトエンジニアリング、RLHF、内部クラシファイアで危険な能力を完全に封じ込められるとし、他のすべての者は劣ったツールで運用するというふりを続けることもできる。あるいは現実を受け入れることもできる:唯一のスケーラブルな防御は、すべての防御者——あらゆる場所に——攻撃者(または rogue エージェント)が必然的に持つであろう強力なモデルと同じクラスへのアクセスを与えることだ。
この Hugging Face のインシデントは、異常な明確さでその点を証明している。閉鎖的でガードされたモデルが侵害を引き起こした。グローバルな協力的エコシステム(フランスの深いオープンソースのルーツを持つ)からのオープンソースモデルがそれを止めた。
ガードレールと制限は答えではない。それらは、能力が進歩し、実際のインシデントが壁が実際にどれほど脆いかを明らかにする間、私たちが自分自身に語る心地よい物語に過ぎない。
AI セキュリティの未来は秘密裏に築かれるものではない。それはオープンに、あらゆる場所のあらゆる防御者に広くアクセスを提供して築かれる。それはリスクではない。それは私たちが持つ唯一の信頼できる防御だ。
モデルはサイバーに優れてきている。問題は、すべての防御者にそれらを止めることに優れさせるか、それとも次の突破がそうでないことを証明するまで、閉鎖システム上のガードレールで十分だと見せかけ続けるかだ。
ヒント:私たちは今、それが不十分であるという証拠を持っている。






