В оприлюднених матеріалах судового процесу між The New York Times і компаніями OpenAI та Microsoft з’явилися свідчення, що керівництво Microsoft приватно визнавало практики збору даних для навчання штучного інтелекту «крадіжкою», а продукти ШІ становлять серйозну загрозу для видавців.
Як випливає з позову, топ-менеджер Microsoft у внутрішньому листуванні назвав методи навчання ШІ «крадіжкою», а керівництво OpenAI визнало, що їхні моделі створюють «екзистенційну загрозу» для журналістів і видавців, на контенті яких ці моделі навчаються. У документах також описано, як компанії нібито обходили платні стіни видань, масово збирали дані для навчальних вибірок і навмисно видаляли повідомлення про авторські права з навчальних матеріалів.
Більшість нової інформації походить із власного подання The New York Times, оскільки додаткові докази залишаються під грифом секретності. Це черговий етап у трирічному судовому спорі, де The New York Times звинувачує компанії у порушенні авторського права через використання її матеріалів для навчання генеративних моделей ШІ.
Питання законності використання захищених авторським правом матеріалів для навчання ШІ залишається відкритим, хоча суди раніше часто ставали на бік компаній, визнаючи таке використання «добросовісним». Однак нові зізнання суперечать цьому захисту, особливо щодо вимоги не завдавати шкоди ринку оригінальних творів. Наприклад, за внутрішніми даними Microsoft, впровадження Copilot призвело до падіння переходів на сайт The New York Times до 93% у порівнянні зі звичайним пошуком Bing. У січні 2024 року директор із прикладної науки Microsoft Брент Хехт назвав це «порочним колом», яке шкодить і самим моделям, і всьому інтернету.
«Вкрай незвично, коли кінцевий продукт підриває економічні основи своїх основних постачальників, але саме таку ситуацію ми створили для нашого бізнесу LLM щодо його “ланцюга постачання контенту”», — йдеться у документі Microsoft, процитованому у справі.
Генеральний директор Microsoft Сатья Наделла у свідченнях заявив, що будь-який контент за платною стіною має бути ліцензований для використання у навчанні чи роботі ШІ, і що він би вимагав від OpenAI перенавчити моделі, якби знав про використання платного контенту. Внутрішнє листування керівника ChatGPT Ніка Терлі підтверджує, що видавці стикаються з «екзистенційною загрозою» від таких продуктів, які дедалі більше замінюють оригінальні джерела. Президент OpenAI Ґреґ Брокман визнав, що моделі «відмінно працюють із новинами», а Наделла погодився, що спілкування з чат-ботами фактично підміняє відвідування сайтів.
Документи також вперше розкривають масштаб копіювання: лише у проміжних навчальних вибірках OpenAI міститься понад 91 тисячу копій матеріалів The New York Times, Daily News і Center for Investigative Reporting, а в датасеті Common Crawl — понад 2 мільйони документів із nytimes.com. У січні 2023 року Хехт назвав це «вражаючою крадіжкою безпрецедентного масштабу» і «найбільшою крадіжкою праці в історії людства».
У поданні детально описано, як OpenAI і Microsoft отримували контент позивачів, зокрема через скрапінг із Bing Index. OpenAI передавала Microsoft повний навчальний датасет GPT-3, а Microsoft — свої дані OpenAI через проєкти Project Taxi і Project Mango. У Project Mango було зібрано принаймні 160 тисяч унікальних матеріалів видавців. Також описано, як співробітники OpenAI шукали способи обходити платні стіни, будували вибірки WebText і WebText2, що значною мірою спиралися на новинний контент, і навмисно видаляли повідомлення про авторські права з навчальних даних.
OpenAI і Microsoft не надали коментарів щодо оприлюднених матеріалів.

