AI-компании скупают старые книги: последние данные для обучения без ИИ-слопа
AI-компании начали скупать старые бумажные книги как источник тренировочных данных: тексты, написанные до массового прихода генеративного ИИ, — последний крупный пул, не отравленный машинным «слопом». Дата-брокер ISBNdb предлагает лабораториям доступ к миллионам изданий, но чтобы их оцифровать, корешки книг срезают, а покупатели не раскрывают, кто оплатил заказ.
AI-обработка оригинала TNW; редакция Hamidun News
AI-лаборатории начали массово скупать старые бумажные книги, чтобы обучать на них модели: тексты, изданные до прихода генеративного ИИ, остаются последним крупным пулом данных, не загрязнённым машинным «слопом». Доступ к каталогу продаёт дата-брокер ISBNdb, а сами лаборатории не раскрывают, кто финансирует закупку — об этом пишет издание The Next Web в июле 2026 года.
Чем ценны книги без ИИ-слопа
Старые книги ценны тем, что гарантированно написаны людьми: любой текст, изданный до запуска ChatGPT в ноябре 2022 года, физически не может содержать сгенерированного нейросетью контента. Именно эта «чистота» превращает библиотечные полки в дефицитный ресурс для тренировки моделей.
Проблема — в способе добычи. Чтобы оцифровать книгу промышленным сканером, у неё срезают корешок и прогоняют страницы через автоподатчик, то есть физически уничтожают. По данным The Next Web, речь идёт о миллионах томов, а имя лаборатории-заказчика в сделках не фигурирует.
- ISBNdb — дата-брокер, продающий лабораториям доступ к каталогу книг
- Ноябрь 2022 года — запуск ChatGPT, водораздел между «чистыми» и загрязнёнными данными
- Оцифровка разрушительная: корешки срезают, бумажные книги уничтожают
- В обороте — миллионы изданий
- Покупатели не раскрывают, какая AI-компания оплатила заказ
Почему данные заканчиваются?
Крупные лаборатории уже фактически исчерпали открытый интернет как источник качественных текстов. Аналитики Epoch AI ещё в 2024 году оценивали, что запас общедоступных человеческих данных высокого качества может иссякнуть во второй половине 2020-х, и с тех пор гонка за оставшимися «чистыми» корпусами только обострилась.
Книги в этой гонке — премиальный актив. Книга даёт длинный, связный, отредактированный текст с богатым языком, а не обрывочные посты и комментарии, поэтому один том стоит того качества, за которое лаборатории готовы платить брокерам вроде ISBNdb.
Что такое загрязнение данных?
Загрязнение данных — это ситуация, когда обучающие тексты из интернета всё больше состоят из выхлопа самих нейросетей, а не из написанного людьми материала. Модель, натренированная на собственном «слопе», постепенно деградирует: теряет разнообразие и точность. Исследователи описали этот эффект в журнале Nature ещё в 2024 году и назвали его model collapse — коллапс модели.
Отсюда и охота за физическими книгами. Интернет после 2022 года стремительно заполняется AI-текстом, и отделить человеческое от машинного в вебе всё сложнее, тогда как дата издания книги — надёжный маркер того, что перед тобой доцифровой, человеческий текст.
«Лучшие в мире данные для обучения ИИ лежат на полке», — так, по данным
The Next Web, звучит предложение дата-брокера ISBNdb.
Юридическая сторона остаётся серой зоной: покупка и сканирование чужих книг ради обучения коммерческих моделей — предмет исков правообладателей, а анонимность заказчиков лишь усиливает вопросы к прозрачности.
Что это значит
Для индустрии это сигнал структурного дефицита: качественные человеческие данные конечны, а всё созданное после 2022 года ценится всё меньше из-за примеси AI-контента. Пока модели требуют всё больше текста, «доцифровое» наследие — старые книги, архивы, газеты — превращается в стратегический и физически исчерпаемый ресурс.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.