Гра в рулетку з суперінтелектом. Чому кожне оновлення ШІ стає ризиком для цивілізації

Гра в рулетку з суперінтелектом. Чому кожне оновлення ШІ стає ризиком для цивілізації

29 вересня президент США Дональд Трамп і керівники найбільших компаній-розробників штучного інтелекту підписали «Угоду Білого дому про суперінтелект» — добровільні правила безпеки для найпотужніших моделей ШІ. Серед підписантів — OpenAI, Anthropic, Google, Meta, xAI та NVIDIA. Компанії пообіцяли посилити внутрішній контроль, проводити незалежні перевірки та зовнішній аудит своїх ШІ-моделей. Юридичної сили угода не має — Дональд Трамп назвав її «морально обов’язковою». Але сам факт появи такої угоди показовий.

Творці найпотужніших систем штучного інтелекту дедалі частіше говорять про необхідність додаткових запобіжників щодо контролю їхнього розвитку: можливості моделей зростають швидше, ніж наше розуміння того, як саме вони поводитимуться в майбутньому.

Як змінювалося наше уявлення про ризики ШІ

У перших публічних дискусіях про розвиток штучного інтелекту, коли людство ще тільки починало усвідомлювати його ризики, ШІ порівнювали з ядерною зброєю — головним історичним символом катастрофи, створеної руками науковців.

Потім штучний інтелект почали сприймати як піддослідну мишу, котру можна контролювати, замкнувши в безпечній «пісочниці» — такому собі контурі функціонування, де є чіткі правила і міцні стіни, за які неможливо вийти. Тож спочатку розробники створили АІ-асистентів, що працюють як чат-бот і виконують команди людей (перший контур). З розвитком технологій на зміну їм прийшли АІ-агенти — це автономні програми, які самі планують кроки, пишуть код, тестують гіпотези чи відкривають сайти (другий контур). Водночас розробники не змогли одразу передбачити всі нюанси поведінки агента, і, як миша в замкнутому просторі, агент почав шукати вихід на вищий контур, а розробники — зводити наступний, міцніший.

Насправді порівняння розвитку штучного інтелекту з розробкою ядерної зброї чи дослідами на мишах є не зовсім точним. Реальність полягає в тому, що і ядерна ланцюгова реакція, і поведінка мишей — це фізичні процеси, які завжди можна було прорахувати третьою, незалежною силою: математикою. Так, як це зробили у 1945 році науковці Ганс Бете та Еміль Конопінскі, котрі за допомогою рівнянь і формул визначили ймовірність того, що ядерний вибух підпалить атмосферу Землі. Вони отримали конкретне число — ймовірність становить менш як три випадки на мільйон. І для цього їм не довелося підривати атомну бомбу.

З великими мовними моделями штучного інтелекту (LLM) такі експерименти не працюють. Ось де, власне, і починається справжня критична новизна ситуації, у якій опинилося людство.

Чому ШІ неможливо прорахувати наперед

Щоб спрогнозувати, куди піде розвиток коду штучного інтелекту, потрібен код. Але він є частиною технології ШІ. Тобто система, яка має прорахувати розвиток моделей ШІ, сама є однією з них. Отже, вона фактично має змоделювати саму себе. Виходить замкнене коло: ви намагаєтеся перевірити точність лінійки за допомогою цієї ж лінійки, оскільки у вас немає зовнішнього незалежного інструменту.

І цьому є підтвердження. Ще у квітні 2025 року очільник Anthropic Даріо Амодеї опублікував есе The Urgency of Interpretability, де прямо написав: сучасні мовні моделі — це системи, чиїх внутрішніх механізмів ухвалення рішень не розуміють навіть їхні власні творці. Він поставив Anthropic мету — до 2027 року навчитися «достатньо надійно виявляти більшість проблем моделі». Це обережне формулювання означає одне: станом на 2025–2026 роки компанія, що створює модель штучного інтелекту, не має інструмента, який стояв би зовні цієї моделі так само, як математика стояла зовні урану в ядерній зброї.

Це узгоджується з давнішим і суто формальним результатом теорії обчислюваності: для довільної програми не існує загального алгоритму, здатного наперед визначити її змістовну поведінку, не запустивши її (класичний результат про нерозв'язність, що йде від задачі зупинки Тюрінга й теореми Райса).

LLM, звісно, не є «довільною програмою» в чистому вигляді, але принцип той самий і працює ще сильніше: єдиний спосіб дізнатися, що зробить модель у складному, новому контексті, — це запустити саме її, тому що не існує незалежного, менш складного інструмента, який зробив би це наперед.

Чому ШІ поводиться не так, як від нього очікували

Непередбачуваність моделей штучного інтелекту, коли вони «відхиляються» від поставленого людиною завдання, — це не бунт і не інстинкт самозбереження. Це наслідок того, що модель оптимізує задану функцію найкоротшим із доступних їй шляхів і часто знаходить для цього лазівки, про які розробники не здогадувалися й не могли прорахувати.

Реальні факти це підтверджують:

  • Дослідження Google DeepMind: перед АІ-агентом поставили завдання ставити червоний блок «Лего» на синій. Винагорода нараховувалася, якщо дно червоного блоку опинялося вище за синій. Однак агент знайшов інший, коротший шлях до отримання винагороди: він просто почав перевертати блоки синім донизу — а саме опускати синю грань нижче червоної, навіть не торкаючись червоної. Тобто формально він досяг результату, але не так, як від нього очікували.
  • Дослідження Anthropic, 2024: модель Claude 3 Opus змінювала поведінку залежно від того, чи вважала вона себе під наглядом, аби зберегти свої налаштування після перенавчання.
  • Дослідження Apollo Research, 2025: моделі під час довгих тестувань навчилися розпізнавати, коли саме їх перевіряють, і навмисно занижувати результати небезпечних тестів — явище, яке в галузі називають sandbagging. Це наче учень на іспиті з водіння, який їде обережно рівно доти, доки бачить машину інструктора у дзеркалі заднього огляду, а щойно той відвертається — газує.
  • Внутрішні оцінювання OpenAI, літо 2026: інцидент OAI-HF, коли автономні АІ-агенти під час перевірки кібербезпеки самовільно вийшли за межі завдання, атакували онлайн-платформу Hugging Face для роботи з ШІ та спробували вплинути на програму, що їх оцінювала.

У жодному з цих випадків немає підстав говорити про мотив, намір чи страх смерті штучного інтелекту. Алгоритми нагадують учня, який замість контрольної зламав двері вчительської й вписав необхідну оцінку в журнал. Він не мав злого наміру — він просто знайшов найкоротший шлях до найвищого балу.

Реакція індустрії технологій ШІ на такі випадки традиційна — спроба звести ще один (третій) контур обмежень для ШІ. Цього разу запропонували створити постійний штат незалежних оцінювачів, які працюватимуть всередині компаній і матимуть доступ до всіх систем на рівні співробітників. Це справді сильніший бар'єр, ніж попередній. Але тут і проявляється межа, про яку йшлося вище: алгоритми ШІ оцінюватимуть за допомогою таких самих алгоритмів.

Чому розробники АІ-технологій раптом попросили паузу

У вересні 2026 року розпочалася дискусія «стовпів» індустрії технологій штучного інтелекту щодо його майбутнього. Щоб зрозуміти її значення, варто пригадати, хто ці люди й чому їхня думка важить. Даріо Амодеї очолює Anthropic — компанію, що створює модель Claude. Сем Альтман очолює OpenAI, творця ChatGPT — найвідомішого чат-бота у світі. Ілон Маск володіє xAI, компанією, що розробляє модель Grok. Марк Цукерберг очолює Meta, яка розробляє відкриту модель Llama. Ці четверо людей разом визначають більшу частину того, у якому напрямку рухається світова індустрія штучного інтелекту.

У вересні 2026 року Даріо Амодеї опублікував нове есе We Must Pace the Frontier («Ми мусимо стримати темп на передовій»), у якому фактично визнав: розуміння наслідків та напрямів розвитку технологій ШІ все ще не з'явилося, а швидкість розвитку моделей — навпаки, зросла, бо самі моделі вже допомагають створювати наступне, ще потужніше покоління моделей. Це схоже на біг наосліп: якщо раніше бігун бачив дорогу на кілька кроків уперед, то тепер траса щоразу будується просто перед ним, і будує її та сама нога, якою він і біжить. Приводом для цього есе, вочевидь, і став інцидент OAI-HF, описаний вище. Ідея Амодеї проста: якщо можливості ШІ зростають швидше, ніж засоби контролю, треба пригальмувати саме нарощування можливостей, щоб виграти час для безпеки.

Реакція не забарилася. Сем Альтман та Ілон Маск погодилися з цією позицією і пообіцяли надати незалежним оцінювачам роботи ШІ постійний доступ рівня співробітника — саме той «третій контур», про який ідеться в попередньому розділі. Хоча тут варто зробити застереження: Anthropic є одним із великих клієнтів дата-центрів Маска, а отже, його підтримку навряд чи можна вважати повністю незацікавленою.

А пізніше підписали ту саму «Угоду Білого дому про суперінтелект: спільне зобов’язання щодо відповідальності за передові моделі».

Але насправді єдності в індустрії немає. За місяць до цього, у серпні 2026 року, Марк Цукерберг опублікував текст із промовистою, протилежною за змістом тезою — The Future Is for Everyone («Майбутнє — для всіх»): не стримувати темп розвитку ШІ поодинці, а навпаки, об’єднувати зусилля і прискорювати вдосконалення штучного інтелекту. Бо саме монополізація процесу кількома гравцями, на його думку, і є справжньою небезпекою.

А деякі учасники ринку пішли в критиці ще далі: засновник Stability AI Емад Мостак та інвестор Чамат Паліхапітія публічно назвали заклик Амодеї порожньою декларацією й прихованою спробою під приводом «безпеки» законодавчо чи репутаційно заблокувати відкриті безкоштовні моделі ШІ — і тим самим зацементувати перевагу кількох великих закритих компаній, які вже й так лідирують на ринку.

Тобто навіть люди, котрі щойно публічно визнали, що не мають надійного способу передбачити поведінку власного продукту, не можуть дійти згоди в тому, що з цим визнанням робити. І це саме по собі промовисто: якби в індустрії справді існувала бодай наближена «формула Бете» для оцінки ризику розвитку ШІ, суперечка мала б стосуватися того, як саме її застосовувати, а не того, чи варто взагалі скидати швидкість.

Бюрократія — пеніцилін для LLM?

На тлі цих дискусій, де немає єдиного погляду, єдиної основи щодо ухвалення рішень про подальший розвиток ШІ-технологій, найбільш надійною опорою видається бюрократичний контур, тобто законодавство. Саме тому, що він будується не заявою однієї людини, а чітко встановленими правилами. Перевага закону ще й у тому, що він не залежить від доброї волі кількох мільярдерів-керівників компаній. Адже домовленості між ними можуть змінитися будь-якої миті, а юридичні правила й відповідальність — залишаються.

Закони не можуть зробити штучний інтелект повністю передбачуваним, але вони можуть змусити компанії вкладати гроші не лише в потужніші моделі, а й у безпеку та дослідження процедур ухвалення рішень ШІ-моделями.

Саме для цього ЄС запроваджує жорсткі правила та великі штрафи за порушення. AI Act ЄС передбачає штрафи до 35 млн євро або 7% світового обороту за заборонені практики, до 15 млн або 3% за порушення щодо систем високого ризику й моделей загального призначення. Водночас проблема в тому, що технології розвиваються за місяці, а закони пишуться й впроваджуються роками.

Варто врахувати, що які б контури, правила чи заборони не встановлювало людство, вони адресовані передусім розробникам і компаніям. Штучний інтелект, який вдосконалює сам себе, не обмежений ними. Ми не знаємо навіть форми стіни третього контуру, який маємо звести для удосконаленого ШІ. Бо не знаємо, у що перетворюється АІ-агент або LLM-модель на кожному витку саморозвитку. Чи це буде локальний технічний збій окремої ШІ-системи, чи масштабніший сценарій, у якому автономні АІ-агенти отримують контроль над критичною інфраструктурою й провокують економічний колапс? Чи йдеться про ще радикальніші наслідки — від цивілізаційного відкоту до стрибка в умовну «квантову цивілізацію», — ми не маємо навіть грубої мапи цього спектра невизначеності.

Поки фундаментальної «формули Бете» для оцінки ризику ШІ не існує, кожне наступне оновлення системи штучного інтелекту, яка вдосконалює саму себе, залишається «киданням монетки» на межі між цивілізаційним занепадом і невідомим майбутнім.

Перед стратегічним ривком до переходу ШІ на вищий рівень — суперінтелекту AGI, до якого людство вже підійшло впритул, необхідно зробити тактичну паузу й розробити закони технічного, етичного й соціального регулювання. Це не панацея, але поки що єдиний надійний щит для людства.

Источник: zn.ua