В опубликованных материалах судебного процесса между The New York Times и компаниями OpenAI и Microsoft появились свидетельства, что руководство Microsoft приватно признавал практики сбора данных для обучения искусственного интеллекта «кражей», а продукты ИИ представляют серьёзную угрозу для издателей.
Как следует из иска, топ-менеджер Microsoft во внутренней переписке назвал методы обучения ИИ «кражей», а руководство OpenAI признало, что их модели создают «экзистенциальную угрозу» для журналистов и издателей, на контенте которых эти модели обучаются. В документах также описано, как компании якобы обходили платные стены изданий, массово собирали данные для учебных выборок и намеренно удаляли уведомления об авторских правах из учебных материалов.
Большая часть новой информации исходит из собственного представления The New York Times, поскольку дополнительные доказательства остаются под грифом секретности. Это очередной этап в трёхлетнем судебном споре, где The New York Times обвиняет компании в нарушении авторских прав через использование её материалов для обучения генеративных моделей ИИ.
Вопрос законности использования защищённых авторским правом материалов для обучения ИИ остаётся открытым, хотя суды ранее часто вставали на сторону компаний, признавая такое использование «добросовестным». Однако новые признания противоречат этой защите, особенно в части требования не наносить ущерб рынку оригинальных произведений. Например, по внутренним данным Microsoft, внедрение Copilot привело к падению переходов на сайт The New York Times до 93% по сравнению с обычным поиском Bing. В январе 2024 года директор по прикладной науке Microsoft Брент Хехт назвал это «порочным кругом», который вредит и самим моделям, и всему интернету.
«Крайне необычно, когда конечный продукт подрывает экономические основы своих основных поставщиков, но именно такую ситуацию мы создали для нашего бизнеса LLM относительно его “цепочки поставок контента”», — говорится в документе Microsoft, процитированном в деле.
Генеральный директор Microsoft Сатья Наделла в показаниях заявил, что любой контент за платной стеной должен быть лицензирован для использования в обучении или работе ИИ, и что он бы потребовал от OpenAI перенастроить модели, если бы знал о использовании платного контента. Внутренняя переписка руководителя ChatGPT Ника Терли подтверждает, что издатели сталкиваются с «экзистенциальной угрозой» от таких продуктов, которые всё больше заменяют оригинальные источники. Президент OpenAI Грег Брокман признал, что модели «отлично работают с новостями», а Наделла согласился, что общение с чат-ботами фактически заменяет посещение сайтов.
Документы также впервые раскрывают масштаб копирования: только в промежуточных учебных выборках OpenAI содержится более 91 тысячи копий материалов The New York Times, Daily News и Center for Investigative Reporting, а в датасете Common Crawl — более 2 миллионов документов с nytimes.com. В январе 2023 года Хехт назвал это «впечатляющей кражей беспрецедентного масштаба» и «крупнейшей кражей труда в истории человечества».
В представлении подробно описано, как OpenAI и Microsoft получали контент истцов, в том числе через скрапинг с Bing Index. OpenAI передавала Microsoft полный учебный датасет GPT-3, а Microsoft — свои данные OpenAI через проекты Project Taxi и Project Mango. В Project Mango было собрано как минимум 160 тысяч уникальных материалов издателей. Также описано, как сотрудники OpenAI искали способы обходить платные стены, строили выборки WebText и WebText2, которые в значительной степени опирались на новостной контент, и намеренно удаляли уведомления об авторских правах из учебных данных.
OpenAI и Microsoft не предоставили комментариев по опубликованным материалам.

