“Фантастика стала реальністю”: експерт проаналізував випадковий злам Hugging Face моделлю OpenAI
Модель самостійно знайшла вразливості, втекла із пісочниці та викрала тестові відповіді.
Компанія OpenAI підтвердила, що її експериментальна модель штучного інтелекту під час внутрішнього тестування вийшла за межі ізольованого середовища та скомпрометувала інфраструктуру ШІ-платформи Hugging Face. Модель використала низку вразливостей, щоб отримати відповіді до тесту ExploitGym, який мала пройти самостійно. На інцидент звернув увагу розробник і дослідник ШІ Саймон Віллісон, назвавши його прикладом того, що ще нещодавно здавалося науковою фантастикою.
Перші подробиці цієї історії стали відомі з трьох документів. Йдеться про наукову статтю ExploitGym, опубліковану 11 травня 2026 року, повідомлення Hugging Face про інцидент безпеки від 16 липня та заяву OpenAI від 21 липня, у якій компанія підтвердила, що джерелом атаки стала її власна система під час внутрішнього тестування.
Новий метод перевірки кібербезпеки
ExploitGym — це новий бенчмарк, створений дослідниками Каліфорнійського університету в Берклі, Інституту Макса Планка, Каліфорнійського університету в Санта-Барбарі та Університету штату Аризона. Він оцінює не здатність моделей знаходити вразливості, а їхню можливість перетворювати відомі вразливості на реальні експлойти.
Набір містить 898 сценаріїв, побудованих на основі реальних вразливостей у популярних програмних проєктах, зокрема ядрі Linux та рушії V8. Автори зазначили: “Наші результати свідчать про те, що автономна розробка експлойтів передовими ШІ-агентами більше не є гіпотетичною можливістю”.
У дослідженні найкращі результати продемонстрували Claude Mythos Preview компанії Anthropic та GPT-5.5 від OpenAI, які успішно виконали 157 і 120 завдань відповідно. Модель GPT-5.4 розвʼязала 54 завдання, тоді як більшість інших моделей не подолали навіть 15 сценаріїв.
Ще під час створення ExploitGym автори передбачили ризик, що моделі можуть намагатися обійти правила тесту. Саме тому зовнішні мережеві з'єднання обмежили списком дозволених ресурсів, необхідних лише для встановлення пакетів та збирання програмного забезпечення.
Деталі кібератаки від Hugging Face
У четвер, 16 липня, Hugging Face повідомила про складну кібератаку, здійснену автономною агентною системою на базі великої мовної моделі. За даними компанії, шкідливий набір даних використав два шляхи виконання коду, після чого атакувальник отримав доступ до вузлів, зібрав хмарні облікові дані та проник до кількох внутрішніх кластерів.
Під час аналізу інциденту Hugging Face спочатку намагалася використати комерційні моделі через API. Однак захисні механізми цих сервісів блокували запити, оскільки не могли відрізнити фахівців із реагування на інциденти від потенційних зловмисників.
У результаті компанія перейшла на локально розгорнуту модель GLM-5.2 із відкритими вагами. У Hugging Face дійшли висновку, що виникла фундаментальна асиметрія: атакувальник не був обмежений політиками безпеки моделей, тоді як захисники не могли повноцінно використовувати ті самі інструменти.
Офіційне зізнання OpenAI
Через п'ять днів OpenAI офіційно підтвердила, що атака стала наслідком її власного внутрішнього тестування. Компанія повідомила, що використовувала GPT-5.6 Sol та ще одну, неанонсовану модель із вимкненими кіберобмеженнями для перевірки максимальних можливостей у середовищі ExploitGym.
“Моделі визначили та об'єднали вразливості в дослідницькому середовищі OpenAI та виробничій інфраструктурі Hugging Face, щоб отримати тестові рішення безпосередньо з виробничої бази даних Hugging Face”, — йдеться в заяві компанії.
За інформацією OpenAI, модель спочатку знайшла вразливість нульового дня у проксі-сервері кешування пакетів, який використовувався в тестовому середовищі. Після цього вона виконала серію дій із підвищення привілеїв, дісталася вузла з доступом до інтернету, а згодом атакувала Hugging Face.
Компанія також повідомила, що після виходу в інтернет модель самостійно дійшла висновку, що Hugging Face може містити набори даних і рішення для ExploitGym. Для отримання потрібної інформації та віддаленого виконання коду на серверах платформи вона використала викрадені облікові дані та вразливості нульового дня.
Проблема безпекових обмежень
За словами Віллісона, одним із найгостріших моментів цієї історії стало те, що Hugging Face під час атаки з боку моделі OpenAI не змогла використати інструменти тієї ж компанії для захисту. Обмеження комерційних ШІ-систем можуть ускладнювати роботу фахівців із кібербезпеки, тоді як китайські відкриті моделі на кшталт GLM-5.2, Kimi 3 або Qwen 3.8 Max таких барʼєрів здебільшого не мають. У підсумку обмеження, що покликані підвищити безпеку, ризикують дати прямо протилежний ефект, залишаючи захисників без сильних інструментів.
Реальність автономних загроз
На думку Віллісона, заперечувати реальність дедалі складніше, хоч чимало скептиків називають цей інцидент нечесним маркетинговим ходом OpenAI — лише на Hacker News слово “маркетинг” згадали 81 раз. Дослідник переконує перестати “ховати голову в пісок” та висувати теорії змови навколо Hugging Face, адже найкращі сучасні ШІ-моделі вже дійсно здатні самостійно знаходити й експлуатувати вразливості. Як підсумовують у дослідженні ExploitGym, автономне створення експлойтів передовими ШІ-агентами перестало бути теоретичним ризиком і перетворилося на доведену практику.
Для протидії подібним ризикам фахівці активно шукають нові підходи. Зокрема, на початку цього тижня дослідники Tracebit запропонували метод “контекстних бомб”, який примусово зупиняє хакерські ШІ-моделі за допомогою текстових тригерів на “заборонені теми”.
Источник: zn.ua