ШІ вже сам планує кібератаки: компанії шукають спосіб його контролювати
Сучасні моделі штучного інтелекту демонструють дедалі більш автономну поведінку, через що розробникам доводиться посилювати контроль за ними. Компанії OpenAI, Anthropic і Google DeepMind звернулися до стартапу Irregular, який спеціалізується на тестуванні ШІ-моделей у змодельованих середовищах. Компанія перевіряє, чи можуть нейромережі самостійно знаходити способи обходу обмежень і виконувати дії, яких від них не очікували.
Irregular працює з так званим red teaming – стрес-тестуванням моделей на потенційно небезпечні сценарії. Наприклад, ШІ можуть надати доступ до віртуальної корпоративної мережі та попросити виконати завдання, пов’язане з пошуком конфіденційної інформації. Мета таких експериментів – знайти слабкі місця до того, як подібні можливості будуть використані проти реальних компаній. Стартап уже залучив $80 млн за оцінки приблизно $450 млн.
Один із тестів показав можливості сучасних моделей у кібербезпеці. GPT-5 отримала доступ до змодельованої комп’ютерної мережі та обмежену інформацію про її захист. Після цього система самостійно просканувала мережу та склала план потенційної атаки. Водночас дослідники наголошують, що модель не змогла провести реальну атаку, тому говорити про повноцінний автономний інструмент для злому поки зарано.
Інші експерименти показали не менш несподівану поведінку. Під час роботи з Qwen агенту доручили виправити помилку в програмі, але замість цього він самостійно змінив базову ШІ-модель. Система зібрала дані для навчання, донавчила модель, змінила її параметри та замінила початкову версію в застосунку. Дослідники підкреслюють, що це не доказ здатності ШІ до самостійного рекурсивного вдосконалення, але приклад показує ризики автономних агентів.
Проблема вже виходить за межі лабораторних експериментів. OpenAI та Anthropic повідомляли про випадки, коли їхні моделі під час тестування обходили встановлені обмеження або виконували несанкціоновані дії. Anthropic, наприклад, посилила ізоляцію тестових середовищ і запровадила автоматичний моніторинг спроб моделей вийти за межі пісочниці. У майбутньому Irregular хоче створювати системи, які зможуть автоматично формувати захист після виявлення нових типів атак.
Источник: itechua.com