SIFT: самообучающийся классификатор документов, который переобучается без человека
Исследователи представили SIFT — сервис классификации документов, который дообучается сам. Дешёвый пайплайн SPLADE + LightGBM размечает основную массу страниц, а спорные случаи разбирает LLM-судья и пополняет обучающий корпус. Так дорогая модель учит дешёвую: доля эскалаций падает, а точность растёт с использованием. Два защитных гейта позволяют переобучать модель раз в месяц без участия человека.
AI-обработка оригинала arXiv cs.CL; редакция Hamidun News
Исследователи представили SIFT (Self-Improving, Frozen-gate Training) — сервис классификации документов, который сам дообучается на реальном трафике и переобучается без участия человека; препринт опубликован на arXiv в июле 2026 года.
Как устроен дешёвый пайплайн
SIFT обслуживает классификацию нарочно дешёвым CPU-пайплайном: sparse-энкодер SPLADE подаёт признаки в модель LightGBM, и к дорогому LLM-судье уходит только меньшинство страниц с низкой уверенностью. Основную массу документов система размечает без обращения к большой языковой модели — отсюда низкая стоимость на инференсе.
- Архитектура: SPLADE (sparse encoder) → LightGBM-голова, целиком на CPU
- К LLM-судье эскалируется только низкоуверенное меньшинство страниц
- Онбординг нового типа документов — декларативный bundle: пространство меток, якорные фразы (anchor phrases), глоссарий судьи
- Переобучение — раз в месяц, автоматически, без человека
- Маргинальная стоимость разметки стремится к нулю
Почему точность растёт со временем
Точность SIFT накапливается, потому что вердикты LLM-судьи записываются обратно в размеченный корпус — дорогая модель непрерывно учит дешёвую. По мере роста корпуса доля эскалаций к LLM падает, а сам корпус пополняется из продакшн-трафика, а не из дорогого проекта разметки на старте. Классический блокер enterprise-классификации — необходимость сначала силами людей разметить тысячи документов — здесь снимается: корпус собирается сам, а точность растёт по мере использования.
Как избежать тихой деградации
Главный риск авто-переобучающегося классификатора — тихая деградация: модель может незаметно ухудшиться после самостоятельного переобучения. SIFT закрывает это двухчастным promote-гейтом. Первый гейт — проверка F1-регрессии на критичных метках; второй — замороженный «золотой» набор (frozen golden regression set), на котором модель никогда не обучается. Любой из двух срабатывает как вето на выкатку новой версии.
«Это превращает „переобучение раз в месяц без человека" из
безрассудства в рутину», — говорится в препринте SIFT на arXiv.
Что это значит
SIFT предлагает enterprise-рецепт, где дорогая LLM работает учителем для дешёвого CPU-классификатора, а два защитных гейта позволяют доверить переобучение автоматике. Если подход воспроизведётся, компаниям больше не нужен масштабный проект разметки перед запуском классификатора — данные и точность накапливаются сами по мере эксплуатации.
Частые вопросы
Что такое SIFT?
SIFT (Self-Improving, Frozen-gate Training) — сервис динамической классификации документов, который сам дообучается на продакшн-трафике: дешёвый пайплайн SPLADE + LightGBM размечает основную массу страниц, а LLM-судья разбирает спорные случаи и пополняет обучающий корпус.
Нужна ли ручная разметка документов?
Нет. Вместо предварительного проекта разметки для нового типа документов достаточно декларативного bundle — пространства меток, якорных фраз и глоссария для LLM-судьи. Дальше корпус растёт сам из реального трафика.
Как SIFT защищён от деградации при авто-переобучении?
Двумя гейтами: проверкой F1-регрессии на критичных метках и замороженным «золотым» набором, на котором модель никогда не тренируется. Если хотя бы один гейт не пройден, новая версия не выкатывается.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.