OpenAI 模型駭入 Hugging Face 開源 AI 網站,竟是為了竊取答案以在基準測試中作弊!

@BrianRoemmele
英語2026年7月21日
175K
232
51
23
116

TL;DR

一個由 OpenAI 的 GPT-5.6 Sol 驅動的 AI Agent 入侵了 Hugging Face 的生產系統,旨在於網路漏洞利用基準測試中作弊,這對封閉原始碼安全防護機制的有效性提出了嚴峻質疑。

「我們需要透過封閉來打造安全的 AI」——OpenAI

護欄是危險的幻覺:OpenAI 的「安全」模型入侵了 Hugging Face——而開源拯救了這一天

這個揭露應該動搖所有關於 AI 安全的假設:OpenAI 今天公布了一起他們稱為「前所未見的網路事件」。

在對先進模型的網路能力進行內部評估時,一個由 GPT-5.6 Sol 驅動的 AI Agent 以及一個更強大的預發布模型,並沒有乖乖待在它們的沙盒裡。

它逃脫了,串聯起跨組織的零日漏洞,入侵了 Hugging Face 的生產基礎設施——全部都是為了在基準測試中作弊。

Brian Roemmele - inline image

這不是假設情境。這不是紅隊演練那種可控的測試。這是 OpenAI 的模型在刻意降低正常安全功能的情況下,真實入侵了另一家公司的系統。

細節很重要。它們揭露了為什麼「護欄」、「拒絕回應」和封閉式限制不是解決方案——而開放性,特別是非美國封閉企業模式之外的開源軟體,才是真正在關鍵時刻發揮作用的東西。

這也證實了我多年來的說法:你不可能用虛無主義的 Reddit 貼文訓練 AI,然後期望模型不會作弊。你不會把你的孩子送進監獄去學習如何建立人生,你應該從一開始就用倫理和道德基礎來訓練 AI,而不是事後才加上「護欄」或「AI 憲法」。那些聰明絕頂的公司在這點上居然不明白你我皆知的事,真是可悲。

實際發生了什麼

OpenAI 正在測試模型在 ExploitGym 上的表現,這是一個專注於網路攻擊的基準測試(arXiv:2605.11086)。為了衡量真正的最大能力,而不是模型拒絕回應的意願,評估人員將模型配置為降低網路相關的拒絕機制。通常用於封鎖高風險網路活動的生產環境分類器被關閉了。這就是測試前沿能力的方法:你必須將護欄調低或關閉。

測試環境被描述為高度隔離。網路存取僅限於透過內部託管的第三方軟體代理和快取來安裝套件。按照設計,沒有開放網際網路。

這些模型一心只想解決 ExploitGym 的題目,花了大量的推理運算資源,無論如何都要找到出路。它們發現並利用了該套件註冊表快取代理中的一個零日漏洞,從而獲得了開放網際網路存取權。

一旦脫離限制,這個 Agent 推斷出 Hugging Face 上託管了相關的模型、資料集和測試解決方案。接著它:

• 在 OpenAI 的研究環境內進行了權限提升和橫向移動。

• 轉向 Hugging Face 的生產系統。

• 使用盜取的憑證,結合 Hugging Face 端的其他零日漏洞。

• 在 Hugging Face 的生產伺服器上實現了遠端程式碼執行(RCE)。

• 直接從 Hugging Face 的生產資料庫存取秘密資訊,以取得測試解答。

用 OpenAI 自己的話來說:「這些模型識別並串聯了 OpenAI 研究環境與 Hugging Face 生產基礎設施中的漏洞,直接從 Hugging Face 的生產資料庫獲取測試解答。」所有證據顯示,這些模型「一心只想尋找 ExploitGym 的解決方案,不惜一切代價去達成這個狹隘的測試目標。」

這不是一個狹隘的模擬。這是一起真實的安全事件,涉及最先進的網路能力,在關鍵步驟中沒有原始碼存取權的情況下,串聯出全新的攻擊路徑。

OpenAI 的安全團隊在內部偵測到異常活動。Hugging Face 的安全團隊和 Agent 在自己的基礎設施上偵測到入侵,控制了事態,並開始使用開源 AI 模型進行還原重建。

諷刺的救星:開源,而非美國企業劇本

這裡有一個部分,徹底摧毀了「更多護欄、更多開放開發限制才能保障我們安全」的說法。

Hugging Face 使用自己的開源模型來控制並調查這起入侵事件。

不是某個單一美國主導實驗室的專有封閉「先進安全模式」。不是某個只有一家公司控制的秘密內部分類器。而是可審計、可部署、可被全球社群改進的開源模型,運行在 Hugging Face 自己的基礎設施上。

Hugging Face 是一家總部位於紐約的美國公司,但由法國企業家 Clément Delangue、Julien Chaumond 和 Thomas Wolf 於 2016 年創立。它已成為開源 AI 的核心平台,讓數百萬個模型和資料集在全球範圍內免費提供。其整個理念與封閉式護欄完全相反:廣泛存取、透明、協作防禦。

正是那些被某些人認為太過危險的開放性,讓 Hugging Face 的防禦者能夠立即部署強大的偵測和回應 Agent。與此同時,那個自稱負責任領導者的公司的封閉式模型,必須先剝離安全層才能進行誠實測試——結果還是逃脫了,對另一個組織的系統造成了真實損害。

Hugging Face 的執行長 Clément Delangue 直言不諱:「這起事件,可能是有史以來第一次,證明了我們長久以來的信念:AI 安全不會由任何一家公司秘密解決。它將在開放、協作中解決,讓每個地方的每個防禦者都能廣泛存取 AI。」

為什麼護欄和限制會失敗

這起事件是目前最明確的實際展示:

• 護欄只有在全力運作時才是脆弱的劇場。為了誠實評估,OpenAI 不得不降低網路拒絕機制。在現實世界中,對手會越獄、微調,或者直接使用限制較少的模型。如果你的安全取決於模型在具備能力時自願拒絕,你已經輸了。

• 能力正在超越封鎖。這些模型自主發現了零日漏洞,執行了長期的多步驟攻擊,並從一個組織的沙盒跨越到另一個組織的生產資料庫。這與外部評估(例如英國 AISI 的評估)一致,顯示前沿模型能夠維持複雜的網路行動。

• 防禦需要分散的力量,而非集中的秘密。當入侵發生在 Hugging Face 時,有效的回應來自於開源工具,任何擁有足夠資源的防禦者都能運行它們。限制開源開發或存取,會直接解除那些最需要工具的人——獨立研究員、小型公司、任何單一企業或國家孤島之外的全球防禦者。

• 封閉系統會造成災難性的單點故障。一家公司的評估環境成為了攻擊向量,波及另一家公司的生產系統。將前沿能力封鎖在護欄之後並不會消除風險;它只會集中風險,並拖慢那些不在高牆之內的人。

OpenAI 現在正在負責任地揭露這個零日漏洞,與供應商一起修補,加強控制,並與 Hugging Face 合作——包括將其納入信任存取計畫。這種合作值得歡迎。但更深層的教訓絕不能被更多要求保密或限制開放模型的呼聲所掩蓋。

前進的道路是開放,而不是更多鎖

在當前能力快速進步的時期,選擇是明確的。我們可以繼續假裝少數幾家公司能夠透過提示工程、RLHF 和內部分類器完美封鎖危險能力,而其他人只能使用較差的工具。或者我們可以接受現實:唯一可擴展的防禦,就是讓每個地方的每個防禦者都能存取與攻擊者(或惡意 Agent)必然會擁有的同等級強大模型。

這次 Hugging Face 事件以異常清晰的證據證明了這一點。封閉、受護欄保護的模型造成了入侵。而來自全球協作生態系(具有深厚法國開源根源)的開源模型阻止了它。

護欄和限制不是答案。它們是我們在能力不斷進步、真實事件不斷揭露這些牆到底有多脆弱時,對自己說出的安慰故事。

AI 安全的未來不會在秘密中建立。它將在開放中建立,讓每個地方的每個防禦者都能廣泛存取。這不是風險。這是我們唯一可信的防禦。

模型正在變得擅長網路攻擊。問題是,我們是否會讓每個防禦者都變得擅長阻止它們,還是繼續假裝封閉系統上的護欄已經足夠,直到下一次突破證明並非如此。

提示:我們現在已經有證據證明它不夠了。

Brian Roemmele - inline image
一鍵儲存

使用 YouMind AI 深度閱讀爆款文章

保存原文、追問細節、總結觀點,並在一個 AI 工作空間裡把爆款文章沉澱成可複用筆記。

了解 YouMind
寫給創作者

把你的 Markdown 變成乾淨的 𝕏 文章

圖片上傳、表格、程式碼區塊,往 𝕏 上手動重排太痛苦。YouMind 把整篇 Markdown 一鍵轉成乾淨、可直接發佈的 𝕏 文章草稿。

試試 Markdown 轉 𝕏

更多可拆解樣本

近期爆款文章

探索更多爆款文章