Керівник Microsoft назвав парсинг ШІ «найбільшою крадіжкою робочої сили в історії людства»

Дмитро Сизов

 

Нова невідредагована інформація в позові про авторські права, поданому The New York Times проти OpenAI та Microsoft три роки тому, розкриває визнання того, що парсинг ШІ рівносильний крадіжці, і що продукти ШІ становлять серйозну загрозу для публікацій.

Згідно з позовом, високопоставлений керівник Microsoft приватно назвав методи навчання компаній зі штучного інтелекту «крадіжкою», а керівництво OpenAI заявило, що моделі штучного інтелекту становлять «екзистенційну загрозу» для видавців та журналістів, чия робота їх навчала. 

У розкритих матеріалах також детально описано, як компанії нібито отримували та використовували цей контент, непомітно обходячи платні доступи, створюючи навчальні набори даних шляхом масового парсингу та навмисно видаляючи повідомлення про авторські права з навчальних даних. 

Варто зазначити, що значна частина нової інформації взята з власного коротких матеріалів газети The Times, а не з основних доказів, які залишаються засекреченими. Цитати нижче наведено без їхнього оригінального контексту.

Невідредаговане подання є останньою ескалацією трирічного позову, в якому The New York Times спочатку стверджувала, що фірми порушили закон про авторське право, навчаючи генеративні моделі штучного інтелекту на своєму контенті. 

Питання про те, чи можуть компанії, що займаються штучним інтелектом, легально використовувати матеріали, захищені авторським правом, для навчання ШІ, не має чіткої відповіді, але судді здебільшого прихильно поставилися до аргументів компаній, що займаються ШІ, про те, що навчання є «добросовісним використанням». Це правове правило дозволяє людям використовувати твори, захищені авторським правом, без дозволу в певних випадках, таких як пародія, репортажі новин або критика. Раніше цього місяця адміністрація Трампа надала короткий звіт на захист неліцензійного використання OpenAI матеріалів, захищених авторським правом, для навчання своїх LLM. 

Однак кілька нових визнань суперечать захисту OpenAI щодо добросовісного використання, зокрема вимозі правила, що використання не замінює оригінальну роботу та не завдає шкоди ринку. 

Наприклад, власні дані Microsoft показують, що її «система відповідей» Copilot призвела до падіння показника кліків для домену The New York Times на цілих 93% порівняно з традиційним пошуком Bing. У внутрішній презентації Microsoft, написаній директором Microsoft з прикладних наук Брентом Хехтом у січні 2024 року, це зниження описується як «цикл приреченості», який «одночасно зашкодить продуктивності наших моделей і всього Інтернету».

«Вкрай незвично, щоб кінцевий продукт загрожував економічним основам своїх основних постачальників, але саме таку ситуацію ми створили для нашого бізнесу LLM щодо його «ланцюжка постачання контенту»», – йдеться в документі Microsoft, цитованому у заявці. 

Генеральний директор Microsoft Сатья Наделла також свідчив у свідченнях на початку цього року, що «все, що є платним, має бути ліцензовано будь-ким, хто хоче це використовувати… для заземлення або навчання», і чітко дав зрозуміти, що якби йому «було повідомлено, що OpenAI збирав та навчався на інформації, яка знаходилася за платним доступом», він би «скористався [правою Microsoft] вимагати від OpenAI перенавчання своїх моделей». 

Інші визнання суперечать різним основам тесту на добросовісне використання: керівник OpenAI ChatGPT Нік Терлі написав у внутрішньому повідомленні, що видавці стикаються з «екзистенційною загрозою» від таких продуктів, як чат-бот, які «значною мірою замінюють» і «ставатимуть дедалі більш замінними, оскільки вони вдосконалюватимуться».

Президент OpenAI Грег Брокман назвав моделі «чудовими для новин». Наделла під присягою погодився на початку цього року, що спілкування з чат-ботами «замінило… надання вам інформації безпосередньо на веб-сайті на платформі штучного інтелекту, замість необхідності звертатися до основного джерела».

Така мова говорить про те, як технологія може безпосередньо конкурувати з оригінальним твором, а не трансформувати його. 

У документі Microsoft зазначено, що існує «реальний ризик» того, що генеративний штучний інтелект може «суттєво порушити зайнятість тих самих людей, які створили дані, на яких було навчено базову модель». 

Масштаби копіювання вражають. Документи вперше показують, що лише набори даних OpenAI, отримані в процесі середнього навчання, містять понад 91 692 копії робіт, опублікованих NYT, Daily News та Центром розслідувальної журналістики. Набір даних, отриманий за допомогою Common Crawl, містив понад 2 мільйони документів лише з nytimes.com 

У внутрішній службовій записці від січня 2023 року Хехт назвав це «вражаючою крадіжкою безпрецедентних масштабів» та «найбільшою крадіжкою робочої сили в історії людства».

У документі детально викладено, як OpenAI та Microsoft отримали контент позивачів, зокрема вилучили його з індексу Bing. 

«OpenAI надала Microsoft весь навчальний набір даних GPT-3, який Microsoft використовувала для оцінки того, як впроваджувати моделі OpenAI у власні комерційні продукти», – йдеться у документі. «Microsoft аналогічно надала OpenAI навчальні дані через ініціативи під назвою Project Taxi та Project Mango».