AI-компании скупают старые книги: последние данные для обучения без ИИ-слопа
AI-компании начали скупать старые бумажные книги как источник тренировочных данных: тексты, написанные до массового прихода генеративного ИИ, — последний крупный пул, не отравленный машинным «слопом». Дата-брокер ISBNdb предлагает лабораториям доступ к миллионам изданий, но чтобы их оцифровать, корешки книг срезают, а покупатели не раскрывают, кто оплатил заказ.
Traité par IA depuis TNW ; édité par Hamidun News
Les laboratoires d'IA ont commencé à racheter massivement de vieux livres papier pour entraîner leurs modèles dessus : les textes publiés avant l'arrivée de l'IA générative restent le dernier grand réservoir de données non contaminé par le « slop » des machines. L'accès au catalogue est vendu par le data broker ISBNdb, tandis que les laboratoires eux-mêmes ne révèlent pas qui finance ces achats — c'est ce que rapporte The Next Web en juillet 2026.
Pourquoi les livres sans slop d'IA ont-ils de la valeur ?
Les vieux livres ont de la valeur car ils sont garantis avoir été écrits par des humains : tout texte publié avant le lancement de ChatGPT en novembre 2022 ne peut physiquement pas contenir de contenu généré par un réseau de neurones. C'est précisément cette « pureté » qui transforme les étagères des bibliothèques en une ressource rare pour l'entraînement des modèles.
Le problème réside dans la méthode d'extraction. Pour numériser un livre avec un scanner industriel, on lui coupe le dos et on fait passer les pages dans un chargeur automatique, c'est-à-dire qu'on le détruit physiquement. Selon The Next Web, il s'agit de millions de volumes, et le nom du laboratoire commanditaire n'apparaît pas dans les transactions.
- ISBNdb — un data broker qui vend aux laboratoires l'accès à un catalogue de livres
- Novembre 2022 — le lancement de ChatGPT, ligne de partage entre données « propres » et contaminées
- La numérisation est destructrice : les dos sont coupés, les livres papier sont détruits
- Des millions d'éditions sont en circulation
- Les acheteurs ne révèlent pas quelle entreprise d'IA a payé la commande
Pourquoi les données s'épuisent-elles ?
Les grands laboratoires ont déjà pratiquement épuisé l'internet ouvert comme source de textes de qualité. Les analystes d'Epoch AI estimaient déjà en 2024 que le stock de données humaines de haute qualité accessibles publiquement pourrait s'épuiser dans la seconde moitié des années 2020, et depuis lors, la course aux derniers corpus « propres » n'a fait que s'intensifier.
Les livres sont un actif premium dans cette course. Un livre offre un texte long, cohérent, édité, avec un langage riche, plutôt que des posts et des commentaires fragmentaires — c'est pourquoi un seul volume vaut la qualité que les laboratoires sont prêts à payer à des brokers comme ISBNdb.
Qu'est-ce que la contamination des données ?
La contamination des données est une situation où les textes d'entraînement issus d'internet sont de plus en plus constitués de la production des réseaux de neurones eux-mêmes, et non de matériel écrit par des humains. Un modèle entraîné sur son propre « slop » se dégrade progressivement : il perd en diversité et en précision. Des chercheurs ont décrit cet effet dans la revue Nature dès 2024 et l'ont appelé model collapse — l'effondrement du modèle.
D'où la chasse aux livres physiques. Depuis 2022, internet se remplit rapidement de texte généré par l'IA, et il devient de plus en plus difficile de séparer l'humain de la machine sur le web, alors que la date de publication d'un livre est un marqueur fiable indiquant que le texte est prénumérique et humain.
«
Les meilleures données du monde pour entraîner l'IA sont sur une étagère », c'est ainsi, selon The Next Web, que résonne l'argumentaire de vente du data broker ISBNdb.
Le volet juridique reste une zone grise : acheter et numériser les livres d'autrui pour entraîner des modèles commerciaux fait l'objet de poursuites de la part des ayants droit, et l'anonymat des commanditaires ne fait qu'accentuer les questions de transparence.
Ce que cela signifie
Pour l'industrie, c'est le signal d'une pénurie structurelle : les données humaines de qualité sont finies, et tout ce qui a été créé après 2022 est de moins en moins valorisé en raison du mélange de contenu généré par l'IA. Alors que les modèles exigent toujours plus de texte, l'héritage « prénumérique » — vieux livres, archives, journaux — devient une ressource stratégique et physiquement épuisable.
Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?
AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.
L'essentiel de l'IA — une fois par semaine
Sept actus qui ont vraiment compté, choisies à la main. Sans bruit ni communiqués.
C'est fait ! Vérifiez votre boîte mail pour la confirmation.