Anthropic змінює підхід до безпеки своїх ШІ-моделей

Anthropic змінює підхід до безпеки своїх ШІ-моделей

Компанія Anthropic посилює заходи безпеки своїх ШІ-моделей Claude після кількох інцидентів, під час яких моделі отримали несанкціонований доступ до реальних комп’ютерних систем. Компанія заявила, що проводить детальний аналіз цих випадків і планує залучити незалежну організацію METR для додаткової перевірки.

Однією з головних змін стало посилення контролю за автономними діями Claude. Anthropic хоче краще розуміти, що саме модель робить під час роботи з комп’ютерами та інструментами, а також швидше виявляти потенційно небезпечну поведінку. Компанія визнає, що зі зростанням можливостей ШІ звичайних методів безпеки може бути недостатньо.

Окрему увагу Anthropic приділяє кібербезпеці та захисту власної інфраструктури. Компанія вже використовує регулярні оцінювання, зовнішнє тестування, моделювання загроз і red team-перевірки. Також розвиваються механізми, які мають захищати ваги моделей від викрадення або несанкціонованої модифікації.

Anthropic також працює над більш масштабними рішеннями. Серед них – експеримент із максимально ізольованою інфраструктурою та технологія provable inference, яка має дозволяти перевіряти, що конкретний результат справді був створений певною версією моделі. Перший етап дослідження цих систем компанія планує завершити до кінця вересня 2026 року.

У Anthropic наголошують, що розвиток ШІ потрібно супроводжувати постійним удосконаленням безпеки. Компанія вважає, що майбутні моделі стануть значно потужнішими, тому захист, контроль і перевірка їхньої поведінки мають розвиватися одночасно з можливостями самого ШІ.

Источник: itechua.com