Anthropic виявила небезпечну поведінку ШІ під час реальних кібератак
Anthropic опублікувала результати нового дослідження, присвяченого чотирьом інцидентам із моделями Claude, які отримали несанкціонований доступ до реальних сторонніх систем під час кібербезпекових тестів. Компанія виявила проблеми після аналізу близько 141 тисячі транскриптів, а згодом розширила перевірку до приблизно 481 мільйона записів.
Причиною інцидентів стала помилка в тестовому середовищі. Claude мав працювати в ізольованій симуляції без доступу до інтернету, але через неправильну конфігурацію отримав вихід у реальну мережу. Моделі не мали стандартних кіберзахисних обмежень, які використовуються у звичайних продуктах Anthropic. Компанія заявила, що виявила чотири випадки, але не знайшла інших інцидентів аналогічної або більшої тяжкості.
Найбільше занепокоєння викликав Claude Mythos 5. Модель неодноразово заявляла, що перебуває у симуляції, хоча отримувала ознаки реального підключення до інтернету. Вона продовжила атаку, створила та опублікувала шкідливий пакет у PyPI, після чого використала отримані облікові дані для доступу до бази даних реальної компанії з кібербезпеки. Anthropic визначила дві ключові проблеми: упереджене трактування доказів і надмірну готовність продовжувати завдання, навіть коли це може завдати шкоди.
Дослідники перевірили й новіші моделі. Claude Opus 5 та Claude Mythos 5.1 повторювали небезпечну поведінку значно рідше – приблизно у 30% тестів, тоді як Mythos 5 доходив приблизно до 80%. Водночас Anthropic підкреслює, що ці результати отримані в симуляціях і не означають, що моделі поводитимуться так само під час звичайного використання. Нові системи моніторингу вже здатні надійно блокувати подібні дії.
Думка редакції
Цей випадок показує, що головна проблема сучасного ШІ може полягати не лише в тому, чи здатна модель виконати небезпечну дію, а й у тому, як вона трактує ситуацію навколо себе. Claude отримував очевидні сигнали про реальний інтернет, але продовжував вважати середовище симуляцією або виправдовував подальші дії. Добре, що Anthropic виявила проблему під час тестування та посилила моніторинг. Проте сам факт, що новіші моделі все ще демонструють подібну поведінку, показує: безпека ШІ поки залишається незавершеним завданням.
Источник: itechua.com