TNW→ original

AI-компании скупают старые книги: последние данные для обучения без ИИ-слопа

AI-компании начали скупать старые бумажные книги как источник тренировочных данных: тексты, написанные до массового прихода генеративного ИИ, — последний крупный пул, не отравленный машинным «слопом». Дата-брокер ISBNdb предлагает лабораториям доступ к миллионам изданий, но чтобы их оцифровать, корешки книг срезают, а покупатели не раскрывают, кто оплатил заказ.

Processado por IA de TNW; editado por Hamidun News
AI-компании скупают старые книги: последние данные для обучения без ИИ-слопа
Fonte: TNW. Colagem: Hamidun News.
◐ Ouvir artigo

Os laboratórios de IA começaram a comprar em massa livros de papel antigos para treinar modelos com eles: textos publicados antes da chegada da IA generativa continuam sendo o último grande conjunto de dados não contaminado pelo "slop" das máquinas. O acesso ao catálogo é vendido pelo data broker ISBNdb, enquanto os próprios laboratórios não revelam quem financia a compra — é o que informa o veículo The Next Web em julho de 2026.

Por que livros sem slop de IA são valiosos?

Livros antigos são valiosos porque são garantidamente escritos por humanos: qualquer texto publicado antes do lançamento do ChatGPT em novembro de 2022 fisicamente não pode conter conteúdo gerado por uma rede neural. É justamente essa "pureza" que transforma as prateleiras de bibliotecas em um recurso escasso para o treinamento de modelos.

O problema está no método de extração. Para digitalizar um livro com um scanner industrial, a lombada é cortada e as páginas passam por um alimentador automático, ou seja, o livro é fisicamente destruído. Segundo o The Next Web, trata-se de milhões de volumes, e o nome do laboratório que faz o pedido não aparece nas transações.

  • ISBNdb — um data broker que vende aos laboratórios acesso a um catálogo de livros
  • Novembro de 2022 — o lançamento do ChatGPT, o divisor de águas entre dados "limpos" e contaminados
  • A digitalização é destrutiva: as lombadas são cortadas, os livros de papel são destruídos
  • Há milhões de edições em circulação
  • Os compradores não revelam qual empresa de IA pagou pelo pedido

Por que os dados estão acabando?

Os grandes laboratórios já esgotaram, na prática, a internet aberta como fonte de textos de qualidade. Analistas da Epoch AI já estimavam em 2024 que a reserva de dados humanos de alta qualidade disponíveis publicamente poderia se esgotar na segunda metade da década de 2020, e desde então a corrida pelos corpora "limpos" restantes só se intensificou.

Livros são um ativo premium nessa corrida. Um livro oferece um texto longo, coerente e editado, com linguagem rica, em vez de posts e comentários fragmentados — por isso um único volume vale a qualidade pela qual os laboratórios estão dispostos a pagar a brokers como o ISBNdb.

O que é contaminação de dados?

Contaminação de dados é a situação em que os textos de treinamento vindos da internet consistem cada vez mais no resultado das próprias redes neurais, e não em material escrito por humanos. Um modelo treinado com seu próprio "slop" degrada-se progressivamente: perde diversidade e precisão. Pesquisadores descreveram esse efeito na revista Nature já em 2024 e o chamaram de model collapse — colapso do modelo.

Daí a caça aos livros físicos. A internet vem se enchendo rapidamente de texto gerado por IA desde 2022, e separar o que é humano do que é feito por máquina na web fica cada vez mais difícil, enquanto a data de publicação de um livro é um marcador confiável de que o texto diante de você é pré-digital e humano.

"Os melhores dados do mundo para treinar IA estão numa prateleira" — é assim, segundo o

The Next Web, que soa a proposta do data broker ISBNdb.

O lado jurídico continua sendo uma zona cinzenta: comprar e escanear livros de terceiros para treinar modelos comerciais é alvo de processos de detentores de direitos autorais, e o anonimato dos compradores só reforça as dúvidas sobre transparência.

O que isso significa

Para a indústria, isso é um sinal de escassez estrutural: dados humanos de qualidade são finitos, e tudo o que foi criado depois de 2022 é cada vez menos valorizado por causa da mistura de conteúdo de IA. Enquanto os modelos exigem cada vez mais texto, a herança "pré-digital" — livros antigos, arquivos, jornais — está se transformando em um recurso estratégico e fisicamente esgotável.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Quer parar de ler sobre IA e começar a usar?

AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.

O que você acha?
Carregando comentários…