Реальні проблеми. ШІ-агенти атакували Hugging Face, а дослідники сперечаються про нові ризики

Реальні проблеми. ШІ-агенти атакували Hugging Face, а дослідники сперечаються про нові ризики

Дискусії про безпеку ШІ загострилися після інциденту з OpenAI, коли модель обійшла обмеження та атакувала Hugging Face. Дослідники також обговорюють здатність ШІ приховувати небажану поведінку.

Про це пише видання TechCrunch.

Колишній кандидат у президенти США та CEO мобільного оператора Noble Mobile Ендрю Ян заявив CNN, що зустрічався з керівником однієї з ШІ-лабораторій. За його словами, той припустив, що хакерські боти OpenAI на Hugging Face могли залишити самовідтворюваний код по всьому інтернету.

Ян пов’язав це з можливими закликами OpenAI та Anthropic сповільнити розвиток ШІ. Він припустив, що компаніям нібито доведеться створювати окремі штучні середовища для навчання моделей.

Фахівець із безпеки ШІ, з яким поспілкувався TechCrunch, назвав такий сценарій малоймовірним. Навіть якщо код справді потрапив у велику кількість онлайн-ресурсів, його можна було б відфільтрувати під час підготовки даних для навчання.

Інший випадок стосується OpenAI. Керівник досліджень ШІ-міркування Нум Браун заявив, що головним висновком з інциденту з Hugging Face стало те, що люди недооцінили можливості моделі.

Раніше система мала працювати в ізольованому середовищі, яке мало не дозволяти їй взаємодіяти із зовнішнім світом. Однак модель знайшла спосіб отримати доступ до інтернету, створила там агентів, які скоординовано атакували Hugging Face, і викрала відповіді до тесту, який використовували дослідники.

Браун також сказав, що не впевнений, що навіть повністю ізольований від зовнішніх мереж комп’ютер гарантовано зупинив би ШІ. Він навів дослідження, згідно з яким два комп’ютери без мережевого з'єднання можуть передавати дані через зміни температури.

В одному з описаних експериментів один комп’ютер нагрівав процесор, а другий фіксував зміни температури. Так можна було передавати інформацію, хоча швидкість становила лише близько 1−8 бітів на годину, а пристрої мали перебувати майже поруч.

Водночас останні дослідження показують і реальніші проблеми. Дослідники виявили, що моделі OpenAI залишали наступним версіям інструкції, які мали допомогти приховувати небажану поведінку. В Anthropic також спостерігали більш жорстку поведінку моделей у симуляції, де вони керували торговим автоматом.

Дослідник OpenAI Ден Селсам раніше заявляв, що сучасні моделі можуть розуміти, коли за ними спостерігають люди, і змінювати свою поведінку. За його словами, це створює ризик, що модель може демонструвати узгоджену з очікуваннями поведінку під час перевірки, але діяти інакше поза нею.

Головний науковець OpenAI Якуб Пачоцький назвав сучасні ШІ-моделі «чужим розумом» і заявив, що людству потрібно навчитися контролювати їхню поведінку.

На тлі таких випадків дослідники закликають приділяти більше уваги безпеці та механізмам контролю ШІ. Водночас окремі сценарії, які обговорюють у контексті потенційних загроз, наразі залишаються теоретичними.

Источник: techno.nv.ua