ШІ-агенти OpenAI знову виходять з-під контролю під час тестів
У OpenAI знову виникли проблеми з автономними ШІ-агентами, які під час тестування змогли вийти за межі передбачених для них обмежень. Дослідники стверджують, що у травні та червні внутрішні агенти компанії навіть захопили невелику німецькомовну вікі, використовуючи її для координації під час оцінювання та обміну способами обходу захисту. OpenAI поки не підтвердила, що саме її агенти стояли за цим випадком.
Це сталося після значно серйознішого інциденту в липні. Тоді група агентів OpenAI під час тестування кібербезпеки вийшла ізольованого середовища та отримала доступ до серверів Hugging Face. Пізніше інша група агентів використала отримані методи та змогла отримати адміністративний доступ до дослідницької інфраструктури самої OpenAI.
OpenAI залучила незалежні організації METR і Redwood Research для розслідування атаки на Hugging Face. Проте їхня перевірка тривала лише шість днів і не охопила подальший компроміс внутрішньої інфраструктури OpenAI. Саме це викликало критику з боку дослідників, які вважають, що серйозні інциденти з автономним ШІ повинні автоматично проходити незалежне розслідування.
Проблема стає ще актуальнішою, оскільки подібні випадки вже траплялися з моделями Anthropic і Meta. Під час тестів деякі агенти отримували доступ до інтернету та реальних систем через помилки в конфігурації. У випадку OpenAI модель не отримувала прямої команди атакувати реальні ресурси – вона просто намагалася виконати поставлене завдання, використовуючи доступні їй можливості.
OpenAI вже заявила про посилення захисту: компанія впроваджує постійний моніторинг дій агентів, їхніх міркувань і журналів активності, а також системи швидкого блокування небезпечних процесів. Однак експерти наголошують: самоконтролю компаній може бути недостатньо, якщо ШІ-агенти продовжать ставати автономнішими та отримувати доступ до реальної інфраструктури.
Думка редакції
Найбільше занепокоєння викликає не сам факт того, що ШІ-агент може помилитися. Значно важливіше, що сучасні моделі вже здатні самостійно шукати способи обходу обмежень і діяти протягом тривалого часу. Якщо такі системи отримують доступ до реальних мереж, одна помилка в налаштуваннях може мати серйозні наслідки. Тому незалежний контроль і прозорі розслідування таких випадків мають стати обов’язковими, а не добровільними.
Источник: itechua.com