AI-компании скупают старые книги: последние данные для обучения без ИИ-слопа
AI-компании начали скупать старые бумажные книги как источник тренировочных данных: тексты, написанные до массового прихода генеративного ИИ, — последний крупный пул, не отравленный машинным «слопом». Дата-брокер ISBNdb предлагает лабораториям доступ к миллионам изданий, но чтобы их оцифровать, корешки книг срезают, а покупатели не раскрывают, кто оплатил заказ.
Procesado por IA desde TNW; editado por Hamidun News
Los laboratorios de IA han empezado a comprar masivamente libros de papel antiguos para entrenar modelos con ellos: los textos publicados antes de la llegada de la IA generativa siguen siendo el último gran conjunto de datos no contaminado por el "slop" de las máquinas. El acceso al catálogo lo vende el data broker ISBNdb, mientras que los propios laboratorios no revelan quién financia la compra, según informó The Next Web en julio de 2026.
¿Por qué son valiosos los libros sin slop de IA?
Los libros antiguos son valiosos porque están garantizados como escritos por humanos: cualquier texto publicado antes del lanzamiento de ChatGPT en noviembre de 2022 físicamente no puede contener contenido generado por una red neuronal. Es precisamente esta "pureza" la que convierte los estantes de las bibliotecas en un recurso escaso para entrenar modelos.
El problema está en el método de extracción. Para digitalizar un libro con un escáner industrial, se le corta el lomo y se pasan las páginas por un alimentador automático, es decir, se destruye físicamente. Según The Next Web, se trata de millones de volúmenes, y el nombre del laboratorio que hace el pedido no figura en las transacciones.
- ISBNdb — un data broker que vende a los laboratorios acceso a un catálogo de libros
- Noviembre de 2022 — el lanzamiento de ChatGPT, la línea divisoria entre datos "limpios" y contaminados
- La digitalización es destructiva: se cortan los lomos, los libros de papel se destruyen
- Hay millones de ediciones en circulación
- Los compradores no revelan qué empresa de IA pagó el pedido
¿Por qué se está agotando los datos?
Los grandes laboratorios ya han agotado prácticamente el internet abierto como fuente de textos de calidad. Los analistas de Epoch AI ya estimaban en 2024 que la reserva de datos humanos de alta calidad disponibles públicamente podría agotarse en la segunda mitad de la década de 2020, y desde entonces la carrera por los corpus "limpios" restantes solo se ha intensificado.
Los libros son un activo premium en esta carrera. Un libro ofrece un texto largo, coherente y editado con un lenguaje rico, en lugar de publicaciones y comentarios fragmentarios, por lo que un solo volumen vale la calidad por la que los laboratorios están dispuestos a pagar a brokers como ISBNdb.
¿Qué es la contaminación de datos?
La contaminación de datos es una situación en la que los textos de entrenamiento provenientes de internet consisten cada vez más en la salida de las propias redes neuronales, en lugar de material escrito por humanos. Un modelo entrenado con su propio "slop" se degrada gradualmente: pierde diversidad y precisión. Los investigadores describieron este efecto en la revista Nature ya en 2024 y lo llamaron model collapse (colapso del modelo).
De ahí la caza de libros físicos. Internet se ha ido llenando rápidamente de texto generado por IA desde 2022, y separar lo humano de lo automático en la web es cada vez más difícil, mientras que la fecha de publicación de un libro es un marcador fiable de que el texto que tienes delante es predigital y humano.
"Los mejores datos del mundo para entrenar IA están en un estante", así es, según
The Next Web, como suena la propuesta del data broker ISBNdb.
El aspecto legal sigue siendo una zona gris: comprar y escanear libros ajenos para entrenar modelos comerciales es objeto de demandas de los titulares de derechos, y el anonimato de los compradores no hace más que reforzar las dudas sobre la transparencia.
Qué significa esto
Para la industria, esto es una señal de escasez estructural: los datos humanos de calidad son finitos, y todo lo creado después de 2022 se valora cada vez menos debido a la mezcla de contenido de IA. Mientras los modelos exigen cada vez más texto, el legado "predigital" —libros antiguos, archivos, periódicos— se está convirtiendo en un recurso estratégico y físicamente agotable.
¿Quieres dejar de leer sobre IA y empezar a usarla?
AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.