Великі компанії, що розробляють мовні моделі штучного інтелекту, масово скуповують паперові книги для сканування та використання текстів у навчанні своїх систем. Після оцифрування книги часто знищують.
За даними видання Futurism із посиланням на 404 Media, раніше такі компанії, як Anthropic, використовували електронні книги, у тому числі піратські, що призвело до судових позовів. Зокрема, у червні цього року Anthropic була змушена виплатити авторам компенсацію у розмірі 1,5 мільярда доларів. Через це розробники, зокрема творці моделі Claude, перейшли на масове використання паперових видань.
Компанії, що займаються штучним інтелектом, наймають посередників для анонімної закупівлі книг у великих обсягах. Продавці, зокрема магазин ISBNdb, рекламують свої товари як "кращі у світі дані для навчання ІІ". Фірми, які спеціалізуються на пошуку книг, пропонують знайти сотні тисяч назв, гарантуючи конфіденційність клієнтам із сфери штучного інтелекту.
Критики вважають, що ажіотаж навколо закупівель пов’язаний із конкуренцією компаній у збереженні людських знань до того, як їх "розбавить" контент, створений штучним інтелектом. Особливу увагу приділяють книгам, написаним до 2022 року, оскільки їх вважають "найменш забрудненими" штучно згенерованими текстами.
Відомо, що паперові книги після сканування часто знищують. Зокрема, компанія Anthropic застосовувала гідравлічний прес для обрізання корінців придбаних книг. Один із продавців повідомив, що його продажі зросли з 20 книг на тиждень до кількох сотень, і припускає, що покупцями стали лабораторії штучного інтелекту. Він зазначив, що серед проданих є рідкісні книги, які більше не друкуються, і припускає, що ІІ-компанії скуповують останні примірники, які потім знищують.
Раніше видання The Independent повідомляло про випадок, коли ChatGPT поставив депутата у незручне становище, оскільки політик випадково зачитав відповідь штучного інтелекту прямо з трибуни. Також сайт 24billions.com розповідав, як змусити ChatGPT давати правильні відповіді.
