arXiv cs.CL→ original

SIFT: самообучающийся классификатор документов, который переобучается без человека

Исследователи представили SIFT — сервис классификации документов, который дообучается сам. Дешёвый пайплайн SPLADE + LightGBM размечает основную массу страниц, а спорные случаи разбирает LLM-судья и пополняет обучающий корпус. Так дорогая модель учит дешёвую: доля эскалаций падает, а точность растёт с использованием. Два защитных гейта позволяют переобучать модель раз в месяц без участия человека.

Processado por IA de arXiv cs.CL; editado por Hamidun News
SIFT: самообучающийся классификатор документов, который переобучается без человека
Fonte: arXiv cs.CL. Colagem: Hamidun News.
◐ Ouvir artigo

Pesquisadores apresentaram o SIFT (Self-Improving, Frozen-gate Training) — um serviço de classificação de documentos que se reajusta sozinho com tráfego real e se retreina sem intervenção humana; o preprint foi publicado no arXiv em julho de 2026.

Como funciona o pipeline barato

O SIFT realiza a classificação com um pipeline de CPU propositalmente barato: o codificador esparso SPLADE alimenta features para um modelo LightGBM, e apenas uma minoria de páginas com baixa confiança é escalada para o caro juiz LLM. O sistema rotula a maior parte dos documentos sem recorrer a um modelo de linguagem grande — daí o baixo custo de inferência.

  • Arquitetura: SPLADE (codificador esparso) → cabeça LightGBM, tudo em CPU
  • Apenas a minoria de páginas com baixa confiança é escalada ao juiz LLM
  • O onboarding de um novo tipo de documento é um bundle declarativo: espaço de rótulos, frases-âncora (anchor phrases) e um glossário do juiz
  • O retreinamento acontece cerca de uma vez por mês, automaticamente, sem humanos
  • O custo marginal de rotulagem tende a zero

Por que a precisão melhora com o tempo

A precisão do SIFT se acumula porque os vereditos do juiz LLM são gravados de volta no corpus rotulado — o modelo caro ensina continuamente o barato. Conforme o corpus cresce, a proporção de escalonamentos ao LLM cai, e o próprio corpus continua crescendo a partir do tráfego de produção, e não de um projeto de rotulagem caro no início. O bloqueio clássico da classificação enterprise — a necessidade de rotular primeiro milhares de documentos com pessoas — desaparece aqui: o corpus se constrói sozinho, e a precisão cresce com o uso.

Como evitar a degradação silenciosa

O principal risco de um classificador que se retreina sozinho é a degradação silenciosa: o modelo pode piorar de forma imperceptível após se retreinar por conta própria. O SIFT resolve isso com um portão de promoção em duas partes. O primeiro portão verifica a regressão de F1 em rótulos críticos; o segundo é um conjunto de regressão "dourado" congelado (frozen golden regression set), no qual o modelo nunca é treinado. Qualquer um dos dois aciona um veto ao lançamento de uma nova versão.

«Isso transforma o "retreinamento uma vez por mês sem humano" de uma

imprudência em rotina», afirma o preprint do SIFT no arXiv.

O que isso significa

O SIFT propõe uma receita enterprise em que um LLM caro atua como professor de um classificador de CPU barato, e dois portões de segurança permitem confiar o retreinamento à automação. Se a abordagem se confirmar reproduzível, as empresas não precisarão mais de um projeto de rotulagem em larga escala antes de lançar um classificador — os dados e a precisão se acumulam sozinhos com o uso.

Perguntas frequentes

O que é o SIFT?

O SIFT (Self-Improving, Frozen-gate Training) é um serviço de classificação dinâmica de documentos que se reajusta sozinho com tráfego de produção: um pipeline barato de SPLADE+LightGBM rotula a maior parte das páginas, enquanto um juiz LLM resolve os casos controversos e alimenta o corpus de treinamento.

É necessária rotulagem manual de documentos?

Não. Em vez de um projeto de rotulagem prévio para um novo tipo de documento, basta um bundle declarativo — um espaço de rótulos, frases-âncora e um glossário para o juiz LLM. A partir daí, o corpus cresce sozinho a partir do tráfego real.

Como o SIFT é protegido da degradação durante o retreinamento automático?

Por dois portões: uma verificação de regressão de F1 em rótulos críticos e um conjunto "dourado" congelado no qual o modelo nunca é treinado. Se pelo menos um portão falhar, a nova versão não é lançada.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…