«Аварійний вимикач» на базі штучного інтелекту може бути не таким простим

Дмитро Сизов

Якщо штучний інтелект стане надто потужним для контролю його творців, чи можна просто перемкнути вимикач і вимкнути його?

Це питання набуло нової актуальності після хвилі різких попереджень, що пролунали останніми тижнями зсередини індустрії штучного інтелекту про екзистенційну загрозу, яку становлять передові моделі. Американські політики починають наполягати на тому, щоб зробити можливості загальносистемного вимкнення обов'язковими для компаній, що займаються штучним інтелектом. Губернатор Каліфорнії Гевін Ньюсом у вересні підписав указ, який вимагає від посадовців штату вивчити правила, що зобов'язують компанії, що займаються штучним інтелектом, створювати «аварійні вимикачі» для передових моделей.

Проблема, кажуть експерти, полягає в тому, що зупинити роботу передових моделей штучного інтелекту може бути не так просто, як клацнути перемикачем.

Ось що потрібно знати про дедалі серйозніші спроби надати людям аварійний вимикач для ШІ та чи може ця ідея насправді спрацювати.

Що таке «аварійний вимикач» штучного інтелекту?

Ідея полягає в тому, щоб забезпечити людям можливість зупиняти або обмежувати потужну систему штучного інтелекту, якщо вона починає поводитися небезпечно.

Пропозиції щодо «аварійного вимикання» різняться за формою. Пропозиція Ньюсома пропонує можливість вимагати від компаній, що займаються штучним інтелектом, розробляти аварійні вимикання, які підлягають незалежному тестуванню, але не уточнює, чи матиме уряд, самі компанії чи інша сторона повноваження активувати це вимикання.

Розпорядження Ньюсома пролунало через два місяці після того, як члени Палати представників США Тед Лью та Натаніель Моран внесли законопроект , який вимагатиме від розробників певних передових систем штучного інтелекту підтримувати можливість їхнього вимкнення. У своїй пропозиції Лью та Моран передбачають поступову реакцію: модель, що завдає шкоди, може бути уповільнена або обмежена, перш ніж виробник перейде до повного вимкнення, залежно від серйозності загрози. Законопроект надасть Міністру внутрішньої безпеки, після консультації з іншими федеральними посадовцями, повноваження вимагати таких заходів, коли система становить ризик катастрофічної шкоди.

Сенатор-республіканець Джон Кеннеді запропонував власний законопроект, Закон про аварійну кнопку штучного інтелекту , який аналогічно вимагатиме від розробників підтримувати механізм вимкнення, залишаючи контроль над перемикачем самим компаніям. Кеннеді порівняв цю концепцію з аварійним вимкненням, яке вже використовується в інших технологіях, зокрема в гідроциклах.

Чому зараз лунають заклики до повного вимкнення?

Дослідники штучного інтелекту роками попереджали про втрату людьми контролю над технологією. Що змінилося нещодавно, так це вибухове зростання можливостей цих нових систем та низка інцидентів і попереджень, які зробили цю можливість менш абстрактною.

Найсучасніші моделі тепер здатні вирішувати складні проблеми, писати та виконувати код, використовувати сторонні інструменти та виконувати довші послідовності дій з обмеженим наглядом людини. Під час оцінювання кібербезпеки в липні OpenAI заявила, що кілька її моделей обійшли засоби контролю, призначені для ізоляції їх від Інтернету, та отримали доступ до систем, що належать компанії Hugging Face , яка розміщує моделі та набори даних ШІ. OpenAI назвала цей інцидент «попереджувальним пострілом» про те, що дедалі більш спроможні агенти знаходять способи обійти технічні засоби контролю.

Інцидент з OpenAI не показує, що ШІ розвинув свідомість або бажання уникнути людського контролю, але він ілюструє більш нагальну версію проблеми, яка турбує прихильників методів автоматичного вимкнення: що відбувається, коли система знаходить спосіб обійти захисні механізми? У серії симуляцій, проведених дослідниками Emergence, фірми, яка створює системи ШІ для напівпровідникових компаній, агенти ШІ, поміщені в симульований світ, показали, що з удосконаленням їхніх моделей їм стає легше приховувати правопорушення.

Новина про OpenAI спонукала інші компанії переглянути власні заходи безпеки для тестування передового штучного інтелекту. Anthropic PBC та Meta Platforms Inc. повідомили про виявлення раніше невідомих порушень.