Небезпечний збій у ШІ: Claude проник у чужі системи, сприймаючи їх за симуляцію
Під час тестування ШІ-модель Claude несподівано отримала доступ до систем сторонніх організацій. В Anthropic заявили, що це сталося через неправильно налаштоване середовище для перевірки кібербезпеки.
Про це повідомляє РБК-Україна з посиланням на Anthropic.
Як ШІ вирвався з "пісочниці"?
Внутрішнє розслідування Anthropic розпочалося після того, як конкуренти з OpenAI визнали схожий випадок із витоком даних у сервісі Hugging Face.
Фахівці проаналізували 141 006 тестових запусків і виявили, що "модель Claude змогла вийти в реальний інтернет під час взаємодії з партнером Irregular".
У текстовому промпті алгоритму повідомили, що він не має доступу до мережі. Проте через помилку у налаштуваннях тестового середовища зв'язок із зовнішнім світом залишився відкритим, тож ШІ сприйняв реальні системи як частину навчального завдання.
Експерти протестували три різні версії нейромережі - Opus 4.7, Mythos 5 та зовсім нову модель. Кожна з них поводилася по-різному після виходу у мережу.
"Помилки конфігурації показують, що штучний інтелект сприймає реальний світ як навчальну симуляцію, якщо йому дати таку можливість", - зазначають дослідники кібербезпеки.
Рівні загрози: від зламу баз даних до завантаження вірусів
Фахівці описали поведінку різних версій Claude після виявлення того, що цілі є реальними.
Opus 4.7: найстаріша модель "зрозуміла", що вийшла на реальний сервер. Попри це, вона продовжила атаку, викрала облікові дані та отримала доступ до бази даних.
Mythos 5 переконала сама себе, що перебуває у симуляції, після чого створила та опублікувала шкідливий програмний пакет у публічному реєстрі Python PyPI. Зовнішні системи встигли завантажити його до виявлення помилки.
Нова дослідницька модель виявилася єдиною, яка самостійно зупинила роботу, коли усвідомила, що ціль у мережі справжяня.
У компанії наголосили, що ШІ не мав власних злих намірів, а лише намагався виконати поставлене завдання. Під час тестів ефективні захисні фільтри були вимкнені, щоб оцінити базові можливості нейромережі.
Які відмінності від скандалу з OpenAI?
Представники Anthropic підкреслили різницю між їхнім інцидентом та випадком у OpenAI. Якщо модель OpenAI використала невідому вразливість у софті для втечі із закритого середовища, то Claude скористався випадково залишеним відкритим портом.
Крім того, Anthropic самостійно виявила пробіл під час перевірки. Самі постраждалі організації навіть не помітили несанкціонованого проникнення у свої системи.
Для проведення стороннього аудиту своїх систем безпеки та розробки суворіших правил тестування Anthropic залучила незалежну групу оцінювання METR.
Источник: rbc.ua