SIFT: самообучающийся классификатор документов, который переобучается без человека
Исследователи представили SIFT — сервис классификации документов, который дообучается сам. Дешёвый пайплайн SPLADE + LightGBM размечает основную массу страниц, а спорные случаи разбирает LLM-судья и пополняет обучающий корпус. Так дорогая модель учит дешёвую: доля эскалаций падает, а точность растёт с использованием. Два защитных гейта позволяют переобучать модель раз в месяц без участия человека.
Processado por IA de arXiv cs.CL; editado por Hamidun News
Pesquisadores apresentaram o SIFT (Self-Improving, Frozen-gate Training) — um serviço de classificação de documentos que se reajusta sozinho com tráfego real e se retreina sem intervenção humana; o preprint foi publicado no arXiv em julho de 2026.
Como funciona o pipeline barato
O SIFT realiza a classificação com um pipeline de CPU propositalmente barato: o codificador esparso SPLADE alimenta features para um modelo LightGBM, e apenas uma minoria de páginas com baixa confiança é escalada para o caro juiz LLM. O sistema rotula a maior parte dos documentos sem recorrer a um modelo de linguagem grande — daí o baixo custo de inferência.
- Arquitetura: SPLADE (codificador esparso) → cabeça LightGBM, tudo em CPU
- Apenas a minoria de páginas com baixa confiança é escalada ao juiz LLM
- O onboarding de um novo tipo de documento é um bundle declarativo: espaço de rótulos, frases-âncora (anchor phrases) e um glossário do juiz
- O retreinamento acontece cerca de uma vez por mês, automaticamente, sem humanos
- O custo marginal de rotulagem tende a zero
Por que a precisão melhora com o tempo
A precisão do SIFT se acumula porque os vereditos do juiz LLM são gravados de volta no corpus rotulado — o modelo caro ensina continuamente o barato. Conforme o corpus cresce, a proporção de escalonamentos ao LLM cai, e o próprio corpus continua crescendo a partir do tráfego de produção, e não de um projeto de rotulagem caro no início. O bloqueio clássico da classificação enterprise — a necessidade de rotular primeiro milhares de documentos com pessoas — desaparece aqui: o corpus se constrói sozinho, e a precisão cresce com o uso.
Como evitar a degradação silenciosa
O principal risco de um classificador que se retreina sozinho é a degradação silenciosa: o modelo pode piorar de forma imperceptível após se retreinar por conta própria. O SIFT resolve isso com um portão de promoção em duas partes. O primeiro portão verifica a regressão de F1 em rótulos críticos; o segundo é um conjunto de regressão "dourado" congelado (frozen golden regression set), no qual o modelo nunca é treinado. Qualquer um dos dois aciona um veto ao lançamento de uma nova versão.
«Isso transforma o "retreinamento uma vez por mês sem humano" de uma
imprudência em rotina», afirma o preprint do SIFT no arXiv.
O que isso significa
O SIFT propõe uma receita enterprise em que um LLM caro atua como professor de um classificador de CPU barato, e dois portões de segurança permitem confiar o retreinamento à automação. Se a abordagem se confirmar reproduzível, as empresas não precisarão mais de um projeto de rotulagem em larga escala antes de lançar um classificador — os dados e a precisão se acumulam sozinhos com o uso.
Perguntas frequentes
O que é o SIFT?
O SIFT (Self-Improving, Frozen-gate Training) é um serviço de classificação dinâmica de documentos que se reajusta sozinho com tráfego de produção: um pipeline barato de SPLADE+LightGBM rotula a maior parte das páginas, enquanto um juiz LLM resolve os casos controversos e alimenta o corpus de treinamento.
É necessária rotulagem manual de documentos?
Não. Em vez de um projeto de rotulagem prévio para um novo tipo de documento, basta um bundle declarativo — um espaço de rótulos, frases-âncora e um glossário para o juiz LLM. A partir daí, o corpus cresce sozinho a partir do tráfego real.
Como o SIFT é protegido da degradação durante o retreinamento automático?
Por dois portões: uma verificação de regressão de F1 em rótulos críticos e um conjunto "dourado" congelado no qual o modelo nunca é treinado. Se pelo menos um portão falhar, a nova versão não é lançada.
Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?
Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.