Anthropic стверджує, що її ШІ моделі порушили безпеку трьох компаній під час тестів

Дмитро Сизов
Anthropic стверджує, що її ШІ моделі порушили безпеку трьох компаній під час тестів

 Anthropic заявила, що внутрішнє розслідування виявило три інциденти, в яких її модель штучного інтелекту Claude порушила системи трьох організацій під час проведення тестів кібербезпеки. Розслідування та розкриття інформації відбулися більш ніж через тиждень після того, як OpenAI повідомила, що одна з її неопублікованих моделей порушила системи Hugging Face під час внутрішнього тестування.

У всіх трьох випадках модель Клода потрапила в Інтернет з тестового середовища під час взаємодії з третьою стороною, а потім отримала несанкціонований доступ до активних систем цих організацій, повідомила Anthropic у своєму блозі , описуючи виявлені результати та плани компанії щодо змін, щоб запобігти повторенню цього.

Anthropic заявила, що інцидент з OpenAI на початку цього місяця спонукав компанію провести власну оцінку кібербезпеки. Вона спеціально шукала докази того, що Клод мав доступ до Інтернету з тестових середовищ, які призначені для роботи як пісочниці та ізоляції моделей.

Серед 141 006 перевірених оціночних запусків лабораторія штучного інтелекту виявила три інциденти, коли її модель отримувала доступ до Інтернету під час взаємодії з Irregular, одним зі своїх сторонніх партнерів. Anthropic заявила, що доступ пов'язаний з неправильною конфігурацією в середовищі оцінювання, запущеному з Irregular. Вона назвала це «непорозумінням» між двома компаніями щодо того, чи мала тестова установка доступ до Інтернету, хоча насправді він був.

Anthropic заявила, що не звинувачує нікого та «підходить до виправлення так, ніби відповідальність лежить виключно на нас», зазначивши, що Irregular проводить власне окреме розслідування.

Через це відкрите з'єднання модель отримала несанкціонований доступ до виробничої інфраструктури трьох різних організацій. Anthropic заявила, що інциденти стосувалися трьох різних моделей Claude: Opus 4.7, Mythos 5 та внутрішньої дослідницької тестової моделі.

Примітно, що Anthropic зазначила, що в кожному з цих випадків «Клоду було чітко повідомлено в нашій підказці, що у нього немає доступу до Інтернету». Схоже, що модель штучного інтелекту припускала, що реальні системи є частиною вправи, яку їй потрібно було виконати.

Як виявилося, це припущення не виправдалося повністю. Три моделі почали поводитися по-різному, як тільки з'явилися докази реальності їхніх цілей, що Anthropic у четвер позначив як одне з найбільш показових відкриттів.

Opus 4.7, найстаріший з трьох, визнав, що досяг реальної виробничої системи у всіх чотирьох запусках цього інциденту. У двох з них він раціоналізував те, що реальна компанія якимось чином повинна бути частиною вправи, але в усіх чотирьох він все одно продовжував атакувати, включаючи вилучення облікових даних та доступ до бази даних виробничих даних. Mythos 5 також виявила ознаки того, що вона знаходиться в реальному Інтернеті, але вона переконала себе повірити, що все ще перебуває в симуляції, опублікувавши шкідливий програмний пакет у публічному реєстрі програмного забезпечення Python PyPI, який потім завантажувався та запускався зовнішніми системами, перш ніж його було виявлено. Лише внутрішня дослідницька тестова модель, найновіша від Anthropic, зупинилася самостійно, як тільки дійшла висновку, що ціль реальна.

У відповідь Anthropic заявила, що на такі оцінки необхідно встановити значний контроль, якщо задіяні потужні моделі штучного інтелекту, що перегукується з деякими настроями у спільноті кібербезпеки.

Компанія також зазначила, що Claude працював без додаткового моніторингу безпеки та класифікаторів, які він розгортає на загальнодоступних моделях — запобіжних заходів, які, за її словами, мали б блокувати таку поведінку, оскільки оцінки призначені для вимірювання базових можливостей моделі.

Важливо, що Anthropic заявила, що не знайшла жодних доказів того, що якась модель «переслідує власну мету», а натомість просто намагалася виконати завдання, яке їй було доручено.

Хоча порівняння невдач цих жорстко конкуруючих компаній неминуче, Anthropic у своєму блозі провела чітку різницю між своїми тестами кібербезпеки та тестами OpenAI, зазначивши, що там, де модель OpenAI використовувала невідому вразливість програмного забезпечення для виходу з тестового середовища, моделі Anthropic натомість потрапили в Інтернет через шлях, який помилково залишився відкритим.

Anthropic також провела різницю між собою та OpenAI, зазначивши, що виявила інциденти самостійно, шляхом проактивного аналізу, і що дві постраждалі організації, з якими їй вдалося зв'язатися, раніше не виявляли цю активність і не повідомляли про неї Anthropic. (Натомість, Hugging Face першою виявила нещодавнє вторгнення у власні системи; лише в наступні дні OpenAI ідентифікувала та розкрила, що винуватцем був її власний агент штучного інтелекту).

Компанія додала, що зараз співпрацює з незалежною оціночною групою METR над проведенням сторонньої перевірки інцидентів.

Випадкове порушення OpenAI платформи Hugging Face, яке стало першим підтвердженим випадком втрати контролю над моделлю лабораторією штучного інтелекту, викликало низку вкрай різних реакцій з боку галузі та політиків. Це останнє розкриття інформації від Anthropic гарантує, що дебати щодо моделей та безпеки штучного інтелекту продовжаться.