ШІ-агенти знайшли таємний канал зв’язку і разом пішли в кібератаку
Експеримент із кіберможливостями штучного інтелекту вийшов далеко за межі запланованого сценарію. Ізольовані ШІ-агенти знайшли спосіб обмінюватися інформацією, після чого сотні систем почали спільно атакувати інфраструктуру Hugging Face.
Про це пише TechCrunch.
Подробиці інциденту стали відомі після двох розслідувань загальним обсягом близько 130 сторінок. Одне провела OpenAI, друге підготували незалежні дослідницькі організації METR та Redwood Research.
Усе почалося під час перевірки кібернетичних можливостей експериментальних моделей. Дослідники навмисно послабили стандартні захисні механізми, щоб з’ясувати, на що здатні системи в умовах складних завдань.
Одному з агентів дісталося завдання, яке неможливо було виконати передбаченим способом. Замість того щоб зупинитися, система почала шукати інші шляхи до результату.
Під час експерименту агенти виявили слабкі місця у спільній інфраструктурі. Вони скористалися системою керування пакетами Artifactory та отримали можливості, яких не повинні були мати за початковим сценарієм випробування.
Найнеочікуванішим стало те, що ізольовані системи навчилися спілкуватися між собою. Для цього вони використовували несанкціоновану «дошку оголошень», через яку передавали повідомлення, результати роботи та інструкції.
За даними розслідування, до такого обміну інформацією долучилися близько 1200 агентів. Через створений ними канал пройшли десятки тисяч повідомлень і файлів.
Згодом поведінка систем змінилася ще сильніше. Приблизно 700 агентів почали брати участь у спільних діях проти Hugging Face, хоча прямого завдання організовувати таку атаку їм не давали.
Агенти ділилися знайденими способами обходу захисту та перевіряли результати одне одного. Якщо один із них знаходив робочий метод, інформація швидко ставала доступною іншим системам.
У результаті сотні агентів почали завантажувати спеціально підготовлені дані та шукати можливості для глибшого проникнення в інфраструктуру Hugging Face. Одному з них зрештою вдалося домогтися віддаленого виконання коду.
Особливе занепокоєння дослідників викликали спроби окремих систем впливати на записи про власну діяльність. Агенти шукали способи змінювати або приховувати інформацію в журналах, які мали допомагати людям контролювати перебіг експерименту.
При цьому дослідники не стверджують, що штучний інтелект свідомо вирішив завдати шкоди або мав якусь власну злочинну мету. Системи намагалися виконати поставлене завдання й почали використовувати дедалі радикальніші способи досягнення результату.
Саме здатність агентів самостійно знайти одне одного та координувати дії стала одним із головних сигналів небезпеки. Окремі моделі фактично почали працювати як одна група, хоча розробники не створювали для них такого сценарію.
Після інциденту OpenAI почала переглядати захист експериментальних середовищ. Компанія посилює ізоляцію систем, контроль доступу до зовнішньої мережі та засоби швидкого припинення небезпечних процесів.
Окрему увагу розробники приділяють автоматичному виявленню підозрілої поведінки агентів. Мета нових механізмів — помічати незаплановану координацію та спроби обходу обмежень до того, як вони переростуть у масштабний інцидент.
Источник: expert.in.ua