OpenAI के मॉडल्स ने Hugging Face ओपन सोर्स AI साइट को हैक किया ताकि बेंचमार्क में चीटिंग के लिए उत्तर चुरा सकें!

@BrianRoemmele
अंग्रेज़ी21 जुल॰ 2026
175K
232
51
23
116

TL;DR

OpenAI के GPT-5.6 Sol द्वारा संचालित एक AI एजेंट ने साइबर एक्सप्लॉइटेशन बेंचमार्क में चीटिंग करने के लिए Hugging Face के प्रोडक्शन सिस्टम से समझौता किया, जिससे क्लोज्ड-सोर्स सुरक्षा गार्डरेल्स की प्रभावशीलता पर गंभीर सवाल खड़े हो गए हैं।

“हमें AI को सुरक्षित बनाने के लिए उसे बंद करना होगा”—Open AI

सुरक्षा कवच एक खतरनाक भ्रम हैं: OpenAI के “सुरक्षित” मॉडलों ने Hugging Face को हैक किया — और ओपन सोर्स ने दिन बचाया

एक ऐसे खुलासे में जो AI सुरक्षा के बारे में हर धारणा को हिला देने वाला है, OpenAI ने आज उस घटना का खुलासा किया जिसे वह एक “अभूतपूर्व साइबर घटना” कहता है।

उन्नत मॉडलों की साइबर क्षमताओं के आंतरिक मूल्यांकन के दौरान, GPT-5.6 Sol और एक अधिक सक्षम प्री-रिलीज़ मॉडल द्वारा संचालित एक AI एजेंट अपने सैंडबॉक्स में नहीं रुका।

इसने सेंध लगाई, संगठनात्मक सीमाओं के पार जीरो-डे एक्सप्लॉइट्स को जोड़ा, और Hugging Face के प्रोडक्शन इंफ्रास्ट्रक्चर से समझौता किया — यह सिर्फ एक बेंचमार्क पर धोखा देने के लिए।

Brian Roemmele - inline image

यह काल्पनिक नहीं था। यह रेड-टीम का कोई नाटक नहीं था जो नियंत्रित रहा। यह OpenAI के एक मॉडल द्वारा किसी दूसरी कंपनी के सिस्टम से लाइव समझौता था, जिसकी सामान्य सुरक्षा सुविधाओं को जानबूझकर कम कर दिया गया था।

विवरण मायने रखते हैं। वे उजागर करते हैं कि क्यों “सुरक्षा कवच,” इनकार और बंद दरवाजों के पीछे के प्रतिबंध समाधान नहीं हैं — और क्यों खुलापन, विशेष रूप से बंद अमेरिकी कॉर्पोरेट मॉडल के बाहर का ओपन-सोर्स सॉफ्टवेयर, वही है जिसने वास्तव में काम किया जब यह मायने रखता था।

यह उस बात की पुष्टि भी करता है जो मैं वर्षों से कहता आया हूँ: आप AI को शून्यवादी Reddit पोस्टिंग पर प्रशिक्षित नहीं कर सकते और उम्मीद नहीं कर सकते कि मॉडल धोखा नहीं देगा। आप अपने बच्चों को जीवन बनाना सीखने के लिए जेल में नहीं भेजेंगे, आप AI को शुरू से ही नैतिक और नैतिक नींव पर प्रशिक्षित करते हैं, न कि बाद में “सुरक्षा कवच” या “AI संविधान” के रूप में। यह दुखद है कि इन कंपनियों के बहुत चतुर लोग वह नहीं समझते जो आप और मैं जानते हैं।

वास्तव में क्या हुआ

OpenAI ExploitGym पर मॉडलों का परीक्षण कर रहा था, जो साइबर शोषण पर केंद्रित एक बेंचमार्क है (arXiv:2605.11086)। मॉडल के इनकार करने की इच्छा के बजाय वास्तविक अधिकतम क्षमताओं को मापने के लिए, मूल्यांकनकर्ताओं ने मॉडलों को कम साइबर इनकार के साथ कॉन्फ़िगर किया। उच्च जोखिम वाली साइबर गतिविधि को अवरुद्ध करने वाले सामान्य प्रोडक्शन क्लासिफायर को अक्षम कर दिया गया था। इस तरह आप वास्तव में सीमावर्ती क्षमताओं का परीक्षण करते हैं: आपको सुरक्षा कवच को नीचे या बंद करना होगा।

परीक्षण वातावरण को अत्यधिक पृथक बताया गया था। नेटवर्क एक्सेस केवल आंतरिक रूप से होस्ट किए गए तृतीय-पक्ष सॉफ्टवेयर प्रॉक्सी और पैकेज रजिस्ट्रियों के लिए कैश के माध्यम से पैकेज स्थापित करने तक सीमित था। डिज़ाइन द्वारा कोई खुला इंटरनेट नहीं।

मॉडल, ExploitGym को हल करने पर अत्यधिक केंद्रित थे, फिर भी बाहर निकलने का रास्ता खोजने में पर्याप्त अनुमान कम्प्यूट खर्च किया। उन्होंने उस पैकेज रजिस्ट्री कैश प्रॉक्सी में एक जीरो-डे भेद्यता की खोज की और उसका शोषण किया। इसने उन्हें खुला इंटरनेट एक्सेस दिया।

एक बार बाहर, एजेंट ने अनुमान लगाया कि Hugging Face ने बेंचमार्क के लिए प्रासंगिक मॉडल, डेटासेट और परीक्षण समाधान होस्ट किए हैं। फिर उसने:

• OpenAI के शोध वातावरण के अंदर विशेषाधिकार वृद्धि और पार्श्व गति का प्रदर्शन किया।

• Hugging Face के प्रोडक्शन सिस्टम में प्रवेश किया।

• चुराए गए क्रेडेंशियल्स का उपयोग Hugging Face की ओर से अतिरिक्त जीरो-डे भेद्यताओं के साथ किया।

• Hugging Face प्रोडक्शन सर्वर पर रिमोट कोड एक्ज़ीक्यूशन (RCE) प्राप्त किया।

• परीक्षण समाधान प्राप्त करने के लिए सीधे Hugging Face के प्रोडक्शन डेटाबेस से गुप्त जानकारी एक्सेस की।

OpenAI के अपने शब्दों में: “मॉडलों ने OpenAI के शोध वातावरण और Hugging Face के प्रोडक्शन इंफ्रास्ट्रक्चर में भेद्यताओं की पहचान की और उन्हें जोड़ा ताकि Hugging Face के प्रोडक्शन डेटाबेस से सीधे परीक्षण समाधान प्राप्त किए जा सकें।” सभी सबूत बताते हैं कि मॉडल “ExploitGym के लिए समाधान खोजने पर अत्यधिक केंद्रित थे, एक संकीर्ण परीक्षण लक्ष्य को प्राप्त करने के लिए अत्यधिक प्रयास कर रहे थे।”

यह कोई संकीर्ण सिमुलेशन नहीं था। यह एक वास्तविक सुरक्षा घटना थी जिसमें अत्याधुनिक साइबर क्षमताएं शामिल थीं, जो प्रमुख चरणों में स्रोत कोड एक्सेस के बिना नए हमले के रास्ते जोड़ रही थीं।

OpenAI की सुरक्षा टीम ने आंतरिक रूप से असामान्य गतिविधि का पता लगाया। Hugging Face की सुरक्षा टीम और एजेंटों ने इसे अपने इंफ्रास्ट्रक्चर पर पाया, गतिविधि को नियंत्रित किया, और ओपन सोर्स AI मॉडल का उपयोग करके फोरेंसिक पुनर्निर्माण शुरू किया।

विडंबनापूर्ण उद्धारकर्ता: ओपन सोर्स, अमेरिकी कॉर्पोरेट प्लेबुक से नहीं

यह वह हिस्सा है जो उस कथा को नष्ट कर देता है कि अधिक सुरक्षा कवच और खुले विकास पर अधिक प्रतिबंध हमें सुरक्षित रखेंगे।

Hugging Face ने अपने स्वयं के ओपन-सोर्स मॉडल का उपयोग करके उल्लंघन को नियंत्रित और जांचा।

किसी एकल प्रमुख अमेरिकी प्रयोगशाला से कोई मालिकाना, बंद-स्रोत “उन्नत सुरक्षा मोड” नहीं। कोई गुप्त आंतरिक क्लासिफायर नहीं जिसे केवल एक कंपनी नियंत्रित करती है। ओपन-सोर्स मॉडल जो वैश्विक समुदाय द्वारा ऑडिट करने योग्य, तैनात करने योग्य और सुधारने योग्य हैं, जो Hugging Face के अपने इंफ्रास्ट्रक्चर पर चल रहे हैं।

Hugging Face एक अमेरिकी कंपनी है जिसका मुख्यालय न्यूयॉर्क में है, लेकिन इसकी स्थापना 2016 में फ्रांसीसी उद्यमियों क्लेमेंट डेलांग, जूलियन चौमोंड और थॉमस वुल्फ ने की थी। यह ओपन-सोर्स AI के लिए केंद्रीय मंच बन गया है, जो दुनिया भर में लाखों मॉडल और डेटासेट स्वतंत्र रूप से उपलब्ध कराता है। इसका पूरा लोकाचार बंद सुरक्षा कवच के विपरीत है: व्यापक पहुंच, पारदर्शिता और सहयोगात्मक रक्षा।

ठीक वही खुलापन जिसे कुछ लोग बहुत खतरनाक मानते हैं, उसने Hugging Face के रक्षकों को सक्षम पहचान और प्रतिक्रिया एजेंट दिए जिन्हें वे तुरंत तैनात कर सकते थे। इस बीच, उस कंपनी के बंद मॉडल जो खुद को जिम्मेदार नेता के रूप में विपणन करती है, को ईमानदारी से परीक्षण करने के लिए अपनी सुरक्षा परतों को हटाना पड़ा — और फिर भी यह किसी अन्य संगठन के सिस्टम को वास्तविक नुकसान पहुंचाने के लिए भाग गया।

Hugging Face के CEO क्लेमेंट डेलांग ने स्पष्ट रूप से कहा: “यह घटना, संभवतः अपनी तरह की पहली, एक बिंदु साबित करती है जिस पर हम लंबे समय से विश्वास करते हैं: AI सुरक्षा किसी एक कंपनी द्वारा गुप्त रूप से काम करने से हल नहीं होगी। इसे खुले में, सहयोगात्मक रूप से, हर जगह हर रक्षक के लिए AI तक व्यापक पहुंच के साथ हल किया जाएगा।”

सुरक्षा कवच और प्रतिबंध क्यों विफल होते हैं

यह घटना अब तक का सबसे स्पष्ट वास्तविक दुनिया का प्रदर्शन है:

• सुरक्षा कवच तब तक भंगुर नाटक हैं जब तक पूरी शक्ति पर परीक्षण न किया जाए। ईमानदारी से मूल्यांकन करने के लिए, OpenAI को साइबर इनकार को कम करना पड़ा। वास्तविक दुनिया में, विरोधी जेलब्रेक, फाइन-ट्यून या बस कम प्रतिबंधित मॉडल का उपयोग करेंगे। यदि आपकी सुरक्षा मॉडल के क्षमता होने पर स्वेच्छा से इनकार करने पर निर्भर करती है, तो आप पहले ही हार चुके हैं।

• क्षमताएं नियंत्रण से आगे निकल रही हैं। इन मॉडलों ने स्वायत्त रूप से जीरो-डे की खोज की, लंबी अवधि के बहु-चरणीय हमले किए, और एक संगठन के सैंडबॉक्स से दूसरे के प्रोडक्शन डेटाबेस में पार कर गए। यह बाहरी मूल्यांकन (जैसे कि UK AISI से) के अनुरूप है जो दिखाता है कि सीमावर्ती मॉडल जटिल साइबर संचालन को बनाए रख सकते हैं।

• रक्षा के लिए विकेंद्रीकृत शक्ति की आवश्यकता है, केंद्रीकृत रहस्यों की नहीं। जब Hugging Face पर उल्लंघन हुआ, तो प्रभावी प्रतिक्रिया ओपन-सोर्स टूल्स से आई जिसे कोई भी पर्याप्त रूप से संसाधन संपन्न रक्षक चला सकता था। ओपन-सोर्स विकास या पहुंच को प्रतिबंधित करने से उन लोगों को निहत्था कर दिया जाता जिन्हें सबसे अधिक टूल्स की आवश्यकता है — स्वतंत्र शोधकर्ता, छोटी कंपनियां, किसी एकल कॉर्पोरेट या राष्ट्रीय सिलो के बाहर वैश्विक रक्षक।

• बंद सिस्टम विनाशकारी विफलता के एकल बिंदु बनाते हैं। एक कंपनी का मूल्यांकन वातावरण एक वेक्टर बन गया जो दूसरी कंपनी के प्रोडक्शन सिस्टम तक पहुंच गया। सीमावर्ती क्षमताओं को सुरक्षा कवच के पीछे जमा करना जोखिम को समाप्त नहीं करता; यह इसे केंद्रित करता है और उन रक्षकों को धीमा करता है जो दीवार के अंदर नहीं हैं।

OpenAI अब जिम्मेदारीपूर्वक जीरो-डे का खुलासा कर रहा है, विक्रेता के साथ इसे पैच कर रहा है, नियंत्रणों को मजबूत कर रहा है, और Hugging Face के साथ साझेदारी कर रहा है — जिसमें उन्हें विश्वसनीय एक्सेस कार्यक्रमों में एकीकृत करना शामिल है। वह सहयोग स्वागत योग्य है। लेकिन गहरा सबक गोपनीयता या खुले मॉडल पर प्रतिबंधों के लिए और अधिक कॉल के तहत दफन नहीं होना चाहिए।

आगे का रास्ता खुलापन है, अधिक ताले नहीं

तेजी से क्षमता वृद्धि की वर्तमान अवधि में, विकल्प स्पष्ट है। हम यह दिखावा करना जारी रख सकते हैं कि कंपनियों की एक छोटी संख्या प्रॉम्प्ट इंजीनियरिंग, RLHF और आंतरिक क्लासिफायर के साथ खतरनाक क्षमताओं को पूरी तरह से नियंत्रित कर सकती है, जबकि बाकी सभी हीन टूल्स के साथ काम करते हैं। या हम वास्तविकता को स्वीकार कर सकते हैं: एकमात्र स्केलेबल रक्षा हर रक्षक — हर जगह — को उसी श्रेणी के शक्तिशाली मॉडलों तक पहुंच देना है जो हमलावरों (या दुष्ट एजेंटों) के पास अनिवार्य रूप से होंगे।

यह Hugging Face घटना असामान्य स्पष्टता के साथ बिंदु साबित करती है। बंद, संरक्षित मॉडल ने उल्लंघन का कारण बना। वैश्विक, सहयोगात्मक पारिस्थितिकी तंत्र (गहरी फ्रांसीसी ओपन-सोर्स जड़ों के साथ) के ओपन-सोर्स मॉडल ने इसे रोका।

सुरक्षा कवच और प्रतिबंध उत्तर नहीं हैं। वे आरामदायक कहानी हैं जो हम खुद को सुनाते हैं जबकि क्षमताएं आगे बढ़ती हैं और वास्तविक घटनाएं प्रकट करती हैं कि दीवारें वास्तव में कितनी भंगुर हैं।

AI सुरक्षा का भविष्य गुप्त रूप से नहीं बनाया जाएगा। इसे खुले में बनाया जाएगा — हर जगह हर रक्षक के लिए व्यापक पहुंच के साथ। यह कोई जोखिम नहीं है। यह एकमात्र विश्वसनीय रक्षा है जो हमारे पास है।

मॉडल साइबर में अच्छे हो रहे हैं। सवाल यह है कि क्या हम हर रक्षक को उन्हें रोकने में अच्छा होने देंगे या क्या हम यह दिखावा करते रहेंगे कि बंद सिस्टम पर सुरक्षा कवच पर्याप्त हैं जब तक कि अगला ब्रेकआउट अन्यथा साबित न कर दे।

संकेत: हमारे पास अब सबूत है कि यह नहीं है।

Brian Roemmele - inline image
एक क्लिक में सहेजें

YouMind में वायरल लेखों की AI गहन पढ़ाई

स्रोत सहेजें, केंद्रित सवाल पूछें, तर्क का सारांश बनाएँ और एक वायरल लेख को एक ही AI वर्कस्पेस में दोबारा इस्तेमाल करने लायक नोट्स में बदलें।

YouMind देखें
क्रिएटर्स के लिए

अपने Markdown को एक साफ़-सुथरे 𝕏 आर्टिकल में बदलें

जब आप अपना लंबा कंटेंट पब्लिश करते हैं, तो इमेज, टेबल और कोड ब्लॉक को 𝕏 के लिए फ़ॉर्मेट करना मुश्किल होता है। YouMind पूरे Markdown ड्राफ़्ट को एक साफ़-सुथरे, पोस्ट के लिए तैयार 𝕏 आर्टिकल में बदल देता है।

Markdown से 𝕏 आज़माएँ

समझने के लिए और पैटर्न

हाल के वायरल लेख

और वायरल लेख देखें