Мир книгоиздания столкнулся с парадоксальной реальностью: физическая книга, веками служившая хранилищем знаний, стала сырьем для цифровых алгоритмов. Компании, разрабатывающие искусственный интеллект, начали массовые закупки печатных изданий с единственной целью — обучить на них свои модели, после чего уничтожить материальный носитель.
Как выяснило издание 404 Media, процесс закупок часто проходит через посредников, что позволяет технологическим гигантам скрывать свое участие в сделках. Объемы торгов впечатляют: отдельные партии могут составлять от 1000 до 1 миллиона экземпляров. Покупателей не интересуют жанры, имена авторов или тематика — для алгоритмов важен объем текста, написанного человеком.
Новый рынок и неожиданные игроки
В эту индустрию вовлечены даже сервисы, ранее работавшие исключительно с традиционным книгооборотом. Например, база данных ISBNdb, которая исторически специализировалась на обслуживании библиотек и книжных магазинов, теперь предлагает услуги по массовой закупке литературы для клиентов из сферы ИИ.
Рынок подержанных книг реагирует на этот спрос мгновенно. Продавцы сообщают о резком скачке активности: если ранее удавалось реализовать около 20 книг в неделю, то сейчас объемы продаж выросли до нескольких сотен экземпляров. Аналогичную тенденцию фиксируют на крупных международных площадках, таких как Alibris и Biblio.
Технология «разрушительной» оцифровки
Практика использования физических книг для обучения нейросетей уже получила юридическое подтверждение. В судебных материалах по делу компании Anthropic было зафиксировано, что она закупала книги, передавала их подрядчикам для сканирования, а затем разбирали на отдельные страницы. Такой метод позволяет проводить высокоскоростное промышленное сканирование, что значительно дешевле и быстрее, чем бережная оцифровка с сохранением целостности издания.
Суд признал использование законно приобретенных книг для обучения моделей допустимым в рамках принципа добросовестного использования (fair use). Однако юридические споры в этой сфере продолжаются. Сама Anthropic столкнулась с иском из-за хранения библиотеки из 7 миллионов пиратских книг. Кроме того, издатели подали отдельный иск против Google, обвинив компанию в незаконном использовании миллионов защищенных авторским правом книг для обучения модели Gemini.
Парадокс ценности данных
Эксперты отмечают, что именно печатные книги стали ценным активом в эпоху генеративного ИИ. Поскольку они были написаны людьми, они не содержат «воды» и артефактов, свойственных контенту, созданному другими нейросетями. Это делает их идеальным обучающим материалом.
Однако массовая оцифровка поднимает тревожные вопросы о сохранении культурного наследия. После сканирования многие экземпляры безвозвратно уничтожаются. Особую обеспокоенность вызывает судьба редких и давно не переиздававшихся изданий: их физические копии исчезают, а цифровые двойники попадают в закрытые базы данных, доступные исключительно для коммерческого обучения алгоритмов.