SIFT: самообучающийся классификатор документов, который переобучается без человека
Исследователи представили SIFT — сервис классификации документов, который дообучается сам. Дешёвый пайплайн SPLADE + LightGBM размечает основную массу страниц, а спорные случаи разбирает LLM-судья и пополняет обучающий корпус. Так дорогая модель учит дешёвую: доля эскалаций падает, а точность растёт с использованием. Два защитных гейта позволяют переобучать модель раз в месяц без участия человека.
Procesado por IA desde arXiv cs.CL; editado por Hamidun News
Investigadores presentaron SIFT (Self-Improving, Frozen-gate Training) — un servicio de clasificación de documentos que se reentrena a sí mismo con tráfico real y se reentrena sin intervención humana; el preprint se publicó en arXiv en julio de 2026.
Cómo funciona el pipeline económico
SIFT ofrece la clasificación con un pipeline de CPU deliberadamente económico: el codificador disperso SPLADE alimenta características a un modelo LightGBM, y solo una minoría de páginas con baja confianza se escala al costoso juez LLM. El sistema etiqueta la mayor parte de los documentos sin recurrir a un modelo de lenguaje grande — de ahí el bajo costo de inferencia.
- Arquitectura: SPLADE (codificador disperso) → cabeza LightGBM, todo en CPU
- Solo la minoría de páginas con baja confianza se escala al juez LLM
- La incorporación de un nuevo tipo de documento es un bundle declarativo: espacio de etiquetas, frases ancla (anchor phrases) y un glosario del juez
- El reentrenamiento ocurre aproximadamente una vez al mes, de forma automática, sin humanos
- El costo marginal de etiquetado tiende a cero
Por qué la precisión mejora con el tiempo
La precisión de SIFT se acumula porque los veredictos del juez LLM se escriben de vuelta en el corpus etiquetado — el modelo costoso enseña continuamente al económico. A medida que el corpus crece, la proporción de escalamientos al LLM cae, y el propio corpus sigue creciendo a partir del tráfico de producción, no de un proyecto de etiquetado costoso al inicio. El bloqueador clásico de la clasificación empresarial — la necesidad de que personas etiqueten primero miles de documentos — desaparece aquí: el corpus se construye solo, y la precisión crece con el uso.
Cómo evitar la degradación silenciosa
El principal riesgo de un clasificador que se reentrena solo es la degradación silenciosa: el modelo puede empeorar de forma imperceptible tras reentrenarse por su cuenta. SIFT cierra esto con una puerta de promoción de dos partes. La primera puerta comprueba la regresión de F1 en etiquetas críticas; la segunda es un conjunto de regresión "dorado" congelado (frozen golden regression set), sobre el que el modelo nunca se entrena. Cualquiera de las dos activa un veto sobre el lanzamiento de una nueva versión.
«Esto convierte el "reentrenamiento una vez al mes sin humanos" de una
imprudencia en una rutina», se afirma en el preprint de SIFT en arXiv.
Qué significa esto
SIFT propone una receta empresarial en la que un LLM costoso actúa como maestro de un clasificador de CPU económico, y dos puertas de seguridad permiten confiar el reentrenamiento a la automatización. Si el enfoque se reproduce, las empresas ya no necesitarían un proyecto de etiquetado a gran escala antes de lanzar un clasificador — los datos y la precisión se acumulan solos con el uso.
Preguntas frecuentes
¿Qué es SIFT?
SIFT (Self-Improving, Frozen-gate Training) es un servicio de clasificación dinámica de documentos que se reentrena a sí mismo con tráfico de producción: un pipeline económico de SPLADE+LightGBM etiqueta la mayor parte de las páginas, mientras que un juez LLM resuelve los casos disputados y alimenta el corpus de entrenamiento.
¿Se necesita etiquetado manual de documentos?
No. En lugar de un proyecto de etiquetado previo para un nuevo tipo de documento, basta con un bundle declarativo — un espacio de etiquetas, frases ancla y un glosario para el juez LLM. A partir de ahí, el corpus crece solo a partir del tráfico real.
¿Cómo está protegido SIFT de la degradación durante el reentrenamiento
automático?
Con dos puertas: una comprobación de regresión de F1 en etiquetas críticas y un conjunto "dorado" congelado en el que el modelo nunca se entrena. Si al menos una puerta falla, la nueva versión no se lanza.
¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?
Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.