arXiv cs.CL→ оригинал

SIFT: самообучающийся классификатор документов, который переобучается без человека

Исследователи представили SIFT — сервис классификации документов, который дообучается сам. Дешёвый пайплайн SPLADE + LightGBM размечает основную массу страниц, а спорные случаи разбирает LLM-судья и пополняет обучающий корпус. Так дорогая модель учит дешёвую: доля эскалаций падает, а точность растёт с использованием. Два защитных гейта позволяют переобучать модель раз в месяц без участия человека.

AI-обработка оригинала arXiv cs.CL; редакция Hamidun News
SIFT: самообучающийся классификатор документов, который переобучается без человека
Источник: arXiv cs.CL. Коллаж: Hamidun News.
◐ Слушать статью

Исследователи представили SIFT (Self-Improving, Frozen-gate Training) — сервис классификации документов, который сам дообучается на реальном трафике и переобучается без участия человека; препринт опубликован на arXiv в июле 2026 года.

Как устроен дешёвый пайплайн

SIFT обслуживает классификацию нарочно дешёвым CPU-пайплайном: sparse-энкодер SPLADE подаёт признаки в модель LightGBM, и к дорогому LLM-судье уходит только меньшинство страниц с низкой уверенностью. Основную массу документов система размечает без обращения к большой языковой модели — отсюда низкая стоимость на инференсе.

  • Архитектура: SPLADE (sparse encoder) → LightGBM-голова, целиком на CPU
  • К LLM-судье эскалируется только низкоуверенное меньшинство страниц
  • Онбординг нового типа документов — декларативный bundle: пространство меток, якорные фразы (anchor phrases), глоссарий судьи
  • Переобучение — раз в месяц, автоматически, без человека
  • Маргинальная стоимость разметки стремится к нулю

Почему точность растёт со временем

Точность SIFT накапливается, потому что вердикты LLM-судьи записываются обратно в размеченный корпус — дорогая модель непрерывно учит дешёвую. По мере роста корпуса доля эскалаций к LLM падает, а сам корпус пополняется из продакшн-трафика, а не из дорогого проекта разметки на старте. Классический блокер enterprise-классификации — необходимость сначала силами людей разметить тысячи документов — здесь снимается: корпус собирается сам, а точность растёт по мере использования.

Как избежать тихой деградации

Главный риск авто-переобучающегося классификатора — тихая деградация: модель может незаметно ухудшиться после самостоятельного переобучения. SIFT закрывает это двухчастным promote-гейтом. Первый гейт — проверка F1-регрессии на критичных метках; второй — замороженный «золотой» набор (frozen golden regression set), на котором модель никогда не обучается. Любой из двух срабатывает как вето на выкатку новой версии.

«Это превращает „переобучение раз в месяц без человека" из

безрассудства в рутину», — говорится в препринте SIFT на arXiv.

Что это значит

SIFT предлагает enterprise-рецепт, где дорогая LLM работает учителем для дешёвого CPU-классификатора, а два защитных гейта позволяют доверить переобучение автоматике. Если подход воспроизведётся, компаниям больше не нужен масштабный проект разметки перед запуском классификатора — данные и точность накапливаются сами по мере эксплуатации.

Частые вопросы

Что такое SIFT?

SIFT (Self-Improving, Frozen-gate Training) — сервис динамической классификации документов, который сам дообучается на продакшн-трафике: дешёвый пайплайн SPLADE + LightGBM размечает основную массу страниц, а LLM-судья разбирает спорные случаи и пополняет обучающий корпус.

Нужна ли ручная разметка документов?

Нет. Вместо предварительного проекта разметки для нового типа документов достаточно декларативного bundle — пространства меток, якорных фраз и глоссария для LLM-судьи. Дальше корпус растёт сам из реального трафика.

Как SIFT защищён от деградации при авто-переобучении?

Двумя гейтами: проверкой F1-регрессии на критичных метках и замороженным «золотым» набором, на котором модель никогда не тренируется. Если хотя бы один гейт не пройден, новая версия не выкатывается.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…