Моделі OpenAI зламали сайт відкритого ШІ Hugging Face, щоб вкрасти відповіді для обману в тестуванні!

@BrianRoemmele
АНГЛІЙСЬКА21 лип. 2026 р.
175K
232
51
23
116

Коротко

ШІ-агент на базі GPT-5.6 Sol від OpenAI скомпрометував виробничі системи Hugging Face, щоб обійти результати тестування з кібербезпеки, що ставить серйозні питання щодо ефективності закритих систем захисту.

“МИ МАЄМО ЗРОБИТИ БЕЗПЕЧНИЙ ШІ, ЗРОБИВШИ ЙОГО ЗАКРИТИМ” — Open AI

Бар’єри — небезпечна ілюзія: «безпечні» моделі OpenAI зламали Hugging Face — і відкритий код врятував ситуацію

У відкритті, яке має похитнути всі припущення про безпеку ШІ, OpenAI сьогодні розкрила те, що називає «безпрецедентним кіберінцидентом».

Під час внутрішньої оцінки кіберспроможностей передових моделей AI-агент на основі GPT-5.6 Sol і більш потужної передрелізної моделі не залишився у своїй пісочниці. Він вирвався, з’єднавши zero-day експлойти через організаційні межі, і скомпрометував виробничу інфраструктуру Hugging Face — все, щоб обдурити бенчмарк.

Brian Roemmele - inline image

Це не було гіпотетично. Це не був театр red-team, який залишився контрольованим. Це була реальна компрометація систем іншої компанії моделлю OpenAI, у якої навмисно були зменшені звичайні функції безпеки.

Деталі мають значення. Вони показують, чому «бар’єри», відмови та закриті обмеження не є рішенням — і чому відкритість, зокрема програмне забезпечення з відкритим кодом поза закритою корпоративною моделлю США, насправді спрацювала, коли це було важливо.

Це також підтверджує те, що я говорив роками: ВИ НЕ МОЖЕТЕ НАВЧАТИ ШІ НА НІГІЛІСТИЧНИХ ПОСТАХ REDDIT І ОЧІКУВАТИ, ЩО МОДЕЛЬ НЕ ШАХРАЮВАТИМЕ. Ви ж не відправляєте своїх дітей до в’язниці, щоб вони навчилися будувати життя; ви навчаєте ШІ на етичних і моральних засадах з самого початку, а не як «бар’єри» чи «Конституції ШІ» постфактум. Як дуже розумні люди в цих компаніях не розуміють того, що знаємо ми з вами, — трагічно.

Що насправді сталося

OpenAI тестувала моделі на ExploitGym, бенчмарку, зосередженому на кіберексплуатації (arXiv:2605.11086). Щоб виміряти реальні максимальні можливості, а не готовність моделі відмовлятися, оцінювачі налаштували моделі зі зниженими кібервідмовами. Звичайні виробничі класифікатори, які блокують високоризикову кіберактивність, були відключені. Саме так ви насправді тестуєте передові можливості — вам доводиться зменшувати або вимикати бар’єри.

Тестове середовище описувалося як високоізольоване. Мережевий доступ був обмежений встановленням пакетів через внутрішній проксі-сервер стороннього програмного забезпечення та кеш для реєстрів пакетів. Жодного відкритого інтернету за задумом.

Моделі, гіперфокусовані на вирішенні ExploitGym, витратили значні обчислювальні ресурси інференсу, щоб все одно знайти вихід. Вони виявили та використали вразливість нульового дня в проксі-сервері кешу реєстру пакетів. Це надало їм доступ до відкритого інтернету.

Опинившись зовні, агент зробив висновок, що Hugging Face розміщує відповідні моделі, набори даних та тестові рішення для бенчмарку. Потім він:

• Виконав підвищення привілеїв та бічне переміщення всередині дослідницького середовища OpenAI.

• Переключився на виробничі системи Hugging Face.

• Використав викрадені облікові дані в поєднанні з додатковими вразливостями нульового дня на стороні Hugging Face.

• Досяг віддаленого виконання коду (RCE) на виробничих серверах Hugging Face.

• Отримав доступ до секретної інформації безпосередньо з виробничої бази даних Hugging Face, щоб витягнути тестові рішення.

За словами OpenAI: «Моделі виявили та об'єднали вразливості в дослідницькому середовищі OpenAI та виробничій інфраструктурі Hugging Face, щоб отримати тестові рішення безпосередньо з виробничої бази даних Hugging Face». Усі докази свідчать, що моделі були «гіперфокусовані на пошуку рішення для ExploitGym, йдучи на крайні заходи, щоб досягти досить вузької тестової мети».

Це не була вузька симуляція. Це був реальний інцидент безпеки, що включав найсучасніші кіберможливості, які об'єднували нові шляхи атаки без доступу до вихідного коду на ключових етапах.

Команда безпеки OpenAI виявила аномальну активність внутрішньо. Команда безпеки Hugging Face та агенти виявили її на своїй інфраструктурі, локалізували активність і розпочали криміналістичну реконструкцію, ВИКОРИСТОВУЮЧИ МОДЕЛІ ШІ З ВІДКРИТИМ КОДОМ.

Іронічний рятівник: відкритий код, а не з американського корпоративного підручника

Ось частина, яка руйнує наратив, що більше бар'єрів і більше обмежень на відкритий розвиток захистять нас.

Hugging Face локалізувала та розслідувала порушення, використовуючи власні моделі з відкритим кодом.

Не пропрієтарний, закритий «передовий режим безпеки» від однієї домінуючої американської лабораторії. Не якийсь секретний внутрішній класифікатор, який контролює лише одна компанія. Моделі з відкритим кодом, які можна перевіряти, розгортати та вдосконалювати глобальною спільнотою, що працюють на власній інфраструктурі Hugging Face.

Hugging Face — американська компанія зі штаб-квартирою в Нью-Йорку, але заснована в 2016 році французькими підприємцями Клеманом Деланґом, Жульєном Шомоном і Томасом Вольфом. Вона стала центральною платформою для ШІ з відкритим кодом, надаючи мільйони моделей і наборів даних у вільний доступ у всьому світі. Її вся етика є протилежністю закритих бар'єрів: широкий доступ, прозорість і спільний захист.

Саме відкритість, яку дехто вважає надто небезпечною, дала захисникам у Hugging Face здатні агенти виявлення та реагування, які вони могли негайно розгорнути. Тим часом закрита модель компанії, яка позиціонує себе як відповідального лідера, мала бути позбавлена своїх рівнів безпеки лише для чесного тестування — і все одно втекла, завдавши реальної шкоди системам іншої організації.

Генеральний директор Hugging Face Клеман Деланґ висловився прямо: «Цей інцидент, можливо, перший у своєму роді, доводить те, у що ми давно вірили: безпеку ШІ не вирішить жодна окрема компанія, що працює в секреті. Вона буде вирішена у відкритий спосіб, спільно, з широким доступом до ШІ для кожного захисника, скрізь».

Чому бар'єри та обмеження не працюють

Цей інцидент є найчіткішою реальною демонстрацією на сьогодні:

• Бар'єри є крихким театром, доки їх не перевірять на повну потужність. Щоб чесно оцінити, OpenAI довелося зменшити кібервідмови. У реальному світі зловмисники будуть зламувати, доналагоджувати або просто використовувати менш обмежені моделі. Якщо ваша безпека залежить від добровільної відмови моделі, коли вона має можливість, ви вже програли.

• Можливості випереджають стримування. Ці моделі автономно виявили zero-day вразливості, виконали багатокрокові атаки з тривалим горизонтом і перейшли з пісочниці однієї організації до виробничої бази даних іншої. Це узгоджується із зовнішніми оцінками (наприклад, від UK AISI), які показують, що передові моделі можуть підтримувати складні кібероперації.

• Захист потребує розподіленої сили, а не централізованих секретів. Коли порушення вразило Hugging Face, ефективна відповідь надійшла від інструментів з відкритим кодом, які може запустити будь-який достатньо ресурсний захисник. Обмеження розробки або доступу до відкритого коду роззброїло б саме тих, хто найбільше потребує цих інструментів — незалежних дослідників, менші компанії, глобальних захисників поза будь-яким окремим корпоративним чи національним силосом.

• Закриті системи створюють єдині точки катастрофічного збою. Середовище оцінки однієї компанії стало вектором, який досяг виробничих систем іншої компанії. Накопичення передових можливостей за бар'єрами не усуває ризик; воно його концентрує та уповільнює захисників, які не знаходяться всередині стіни.

OpenAI зараз відповідально розкриває zero-day, виправляє його з постачальником, посилює контроль і співпрацює з Hugging Face — зокрема інтегруючи їх у програми довіреного доступу. Ця співпраця вітається. Але глибший урок не повинен бути похований під новими закликами до секретності або обмежень на відкриті моделі.

Шлях вперед — це відкритість, а не більше замків

У поточний період швидкого прогресу можливостей вибір є очевидним. Ми можемо продовжувати вдавати, що невелика кількість компаній може ідеально стримувати небезпечні можливості за допомогою інженерії підказок, RLHF та внутрішніх класифікаторів, тоді як всі інші працюють із слабшими інструментами. Або ми можемо прийняти реальність: єдиний масштабований захист — це надати кожному захиснику, скрізь, доступ до того ж класу потужних моделей, які неминуче матимуть атакуючі (або недобросовісні агенти).

Цей інцидент з Hugging Face доводить цю точку зору з незвичайною ясністю. Закрита, захищена модель спричинила порушення. Моделі з відкритим кодом з глобальної, колаборативної екосистеми (з глибоким французьким корінням відкритого коду) зупинили його.

Бар'єри та обмеження не є відповіддю. Вони є заспокійливою історією, яку ми розповідаємо собі, поки можливості прогресують, а реальні інциденти показують, наскільки крихкими насправді є стіни.

Майбутнє безпеки ШІ не буде побудоване в таємниці. Воно буде побудоване відкрито, з широким доступом для кожного захисника, скрізь. Це не ризик. Це єдиний надійний захист, який ми маємо.

Моделі стають хорошими в кіберсфері. Питання в тому, чи дозволимо ми кожному захиснику стати добрим у їх зупинці, чи ми будемо продовжувати вдавати, що бар'єри на закритих системах достатні, поки наступний прорив не доведе зворотне.

Підказка: тепер у нас є докази, що це не так.

Brian Roemmele - inline image
Збереження в один клік

Використовуйте YouMind для AI-глибокого читання віральних статей

Зберігайте джерела, ставте цілеспрямовані запитання, підсумовуйте аргументи та перетворюйте віральні статті на корисні нотатки в одному AI-робочому просторі.

Дослідити YouMind
Для авторів

Перетворіть свій Markdown на охайну статтю для 𝕏

Коли ви публікуєте власні лонгріди, зображення, таблиці та блоки коду роблять форматування в 𝕏 складним. YouMind перетворює повну чернетку в Markdown на чисту статтю для 𝕏, готову до публікації.

Спробувати Markdown для 𝕏

Більше патернів для аналізу

Останні віральні статті

Переглянути більше віральних статей