Anthropic та OpenAI хочуть впровадити оцінювачів безпеки

Дмитро Сизов

Амодей заявив, що Anthropic зобов'яжеться надати незалежним оцінювачам, таким як METR та Redwood Research, безпрецедентний доступ до систем компанії. Генеральний директор Сем Альтман сказав, що OpenAI також зобов'яжеться дотримуватися цієї практики, що сигналізує про потенційно глибокі зміни у співпраці галузі із зовнішніми дослідницькими групами.

Сторонні оцінювачі, які спілкувалися з TechCrunch, загалом схвалили пропозицію, але заявили, що деталі необхідно уточнити — і в ідеалі підкріпити законодавством — якщо вони хочуть знати, чи будуть вони справді незалежними наглядовими органами, чи постачальниками, що працюють на умовах компаній, що займаються штучним інтелектом. 

Цей глибший доступ стає дедалі важливішим, оскільки моделі краще розпізнають, коли їх оцінюють, що підвищує ризик того, що вони будуть поводитися добре під час тестування, водночас приховуючи проблемну поведінку. Дослідники кажуть, що підказки щодо такої поведінки можуть бути пропущені під час тестування готової моделі, але виявлені шляхом дослідження її поведінки протягом навчання. 

«Компанії, що займаються штучним інтелектом, повинні мати змогу відповісти на деякі дуже основні питання щодо свого процесу навчання, такі як: чи намагався штучний інтелект коли-небудь активно підірвати власне навчання з вирівнювання під час його проходження?» — сказав TechCrunch Александр Майнке, керівник досліджень Apollo Research. «Відповідь на це питання має бути однозначним «ні», і зараз ми повністю покладаємося на те, що компанії, що займаються штучним інтелектом, ретельно перевірять це самі, а потім правдиво повідомлять про це громадськості. І ми побачили з нещодавніх інцидентів, що за замовчуванням вони не зроблять ні того, ні іншого. Як вбудовані оцінювачі, ми насправді могли б це перевірити».

Історично склалося так, що компанії, що займаються штучним інтелектом, залучали зовнішніх рецензентів для тестування готових моделей незадовго до їх випуску. Тепер оцінювачі, з якими поспілкувався TechCrunch, пропонують надати їм доступ не лише до остаточної моделі, а й до проміжних версій, або «контрольних точок», протягом усього терміну її навчання. Адам Глів, генеральний директор FAR.AI , сказав, що оцінювачі можуть порівнювати ці контрольні точки, щоб визначити, коли виникла тривожна поведінка, перевіряти середовище після навчання, яке винагороджує моделі за певну поведінку, а також перевіряти стенограми та журнали оцінювання, щоб перевірити заяви компанії про те, як працювала модель. 

Чи планують Anthropic та OpenAI надати такий доступ і коли, незрозуміло. Жодна з компаній не розкрила, з якими оцінювачами вони працюватимуть, коли вони будуть інтегровані, скільки їх залучать, до яких саме систем та інформації вони матимуть доступ або що може бути розкрито громадськості, попри неодноразові запитання TechCrunch.