AI-компании скупают старые книги: последние данные для обучения без ИИ-слопа
AI-компании начали скупать старые бумажные книги как источник тренировочных данных: тексты, написанные до массового прихода генеративного ИИ, — последний крупный пул, не отравленный машинным «слопом». Дата-брокер ISBNdb предлагает лабораториям доступ к миллионам изданий, но чтобы их оцифровать, корешки книг срезают, а покупатели не раскрывают, кто оплатил заказ.
Processado por IA de TNW; editado por Hamidun News
Os laboratórios de IA começaram a comprar em massa livros de papel antigos para treinar modelos com eles: textos publicados antes da chegada da IA generativa continuam sendo o último grande conjunto de dados não contaminado pelo "slop" das máquinas. O acesso ao catálogo é vendido pelo data broker ISBNdb, enquanto os próprios laboratórios não revelam quem financia a compra — é o que informa o veículo The Next Web em julho de 2026.
Por que livros sem slop de IA são valiosos?
Livros antigos são valiosos porque são garantidamente escritos por humanos: qualquer texto publicado antes do lançamento do ChatGPT em novembro de 2022 fisicamente não pode conter conteúdo gerado por uma rede neural. É justamente essa "pureza" que transforma as prateleiras de bibliotecas em um recurso escasso para o treinamento de modelos.
O problema está no método de extração. Para digitalizar um livro com um scanner industrial, a lombada é cortada e as páginas passam por um alimentador automático, ou seja, o livro é fisicamente destruído. Segundo o The Next Web, trata-se de milhões de volumes, e o nome do laboratório que faz o pedido não aparece nas transações.
- ISBNdb — um data broker que vende aos laboratórios acesso a um catálogo de livros
- Novembro de 2022 — o lançamento do ChatGPT, o divisor de águas entre dados "limpos" e contaminados
- A digitalização é destrutiva: as lombadas são cortadas, os livros de papel são destruídos
- Há milhões de edições em circulação
- Os compradores não revelam qual empresa de IA pagou pelo pedido
Por que os dados estão acabando?
Os grandes laboratórios já esgotaram, na prática, a internet aberta como fonte de textos de qualidade. Analistas da Epoch AI já estimavam em 2024 que a reserva de dados humanos de alta qualidade disponíveis publicamente poderia se esgotar na segunda metade da década de 2020, e desde então a corrida pelos corpora "limpos" restantes só se intensificou.
Livros são um ativo premium nessa corrida. Um livro oferece um texto longo, coerente e editado, com linguagem rica, em vez de posts e comentários fragmentados — por isso um único volume vale a qualidade pela qual os laboratórios estão dispostos a pagar a brokers como o ISBNdb.
O que é contaminação de dados?
Contaminação de dados é a situação em que os textos de treinamento vindos da internet consistem cada vez mais no resultado das próprias redes neurais, e não em material escrito por humanos. Um modelo treinado com seu próprio "slop" degrada-se progressivamente: perde diversidade e precisão. Pesquisadores descreveram esse efeito na revista Nature já em 2024 e o chamaram de model collapse — colapso do modelo.
Daí a caça aos livros físicos. A internet vem se enchendo rapidamente de texto gerado por IA desde 2022, e separar o que é humano do que é feito por máquina na web fica cada vez mais difícil, enquanto a data de publicação de um livro é um marcador confiável de que o texto diante de você é pré-digital e humano.
"Os melhores dados do mundo para treinar IA estão numa prateleira" — é assim, segundo o
The Next Web, que soa a proposta do data broker ISBNdb.
O lado jurídico continua sendo uma zona cinzenta: comprar e escanear livros de terceiros para treinar modelos comerciais é alvo de processos de detentores de direitos autorais, e o anonimato dos compradores só reforça as dúvidas sobre transparência.
O que isso significa
Para a indústria, isso é um sinal de escassez estrutural: dados humanos de qualidade são finitos, e tudo o que foi criado depois de 2022 é cada vez menos valorizado por causa da mistura de conteúdo de IA. Enquanto os modelos exigem cada vez mais texto, a herança "pré-digital" — livros antigos, arquivos, jornais — está se transformando em um recurso estratégico e fisicamente esgotável.
Quer parar de ler sobre IA e começar a usar?
AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.