Утечка в OOD-бенчмарках: как загрязнённый класс обрушил AUROC детектора до 0.326
Препринт на arXiv показал, как утечка в OOD-бенчмарке обрушивает оценку детектора аномалий: AUROC упал до 0.326 — ниже случайного угадывания — только потому, что «чужой» класс на самом деле был в обучающей выборке модели. После удаления класса и переобучения 35 моделей показатель вырос до 0.911. Авторы предлагают диагностический «отпечаток» на такую утечку.
AI-обработка оригинала arXiv cs.LG; редакция Hamidun News
Исследователи в препринте на arXiv (arXiv:2607.19393, июль 2026 года) показали, что распространённый способ собирать OOD-бенчмарки может искажать результаты: детектор аномалий получил AUROC 0.326 — ниже уровня случайного угадывания в 0.5 — лишь потому, что «чужой» класс на самом деле присутствовал в обучающей выборке модели.
Почему детектор оказался хуже монетки
AUROC 0.326 возник из-за утечки бенчмарка: класс, помеченный как OOD («вне распределения»), был среди тех, на которых модель уже обучалась. Его примеры попали внутрь in-distribution выборки, и детектор штрафовался за то, что верно распознавал их как знакомые. После удаления этого класса и переобучения 35 моделей на двух доменах показатель поднялся до 0.911 — с провала ниже случайности до почти отличного результата. Сама метрика не менялась — менялась только чистота бенчмарка.
Что такое отпечаток утечки
Отпечаток утечки (leak fingerprint) — это пара признаков, по которым авторы отличают загрязнённый бенчмарк от чистого. Загрязнение выдаёт себя, когда supervised-классификатор почти идеально отделяет OOD-примеры (AUROC ≈ 1), а unsupervised-детектор при этом проваливается ниже 0.65. Такое расхождение и есть маркер того, что «чужой» класс на деле знаком модели.
Ключевые факты исследования:
- AUROC вырос с 0.326 до 0.911 после удаления утёкшего класса и переобучения 35 моделей на двух доменах
- Отпечаток утечки: supervised decodability AUROC ≈ 1 в паре с unsupervised detection ниже 0.65
- Валидация на 52 настройках (20 с утечкой, 32 чистых) — ResNet-50 и ViT-B/16 на CIFAR-10/100
- Точность диагностики: чувствительность 18/20 и специфичность 31/32 в пространстве эмбеддингов
- Контроли с исключением обучающей выборки сработали идеально — 20/20
Насколько распространена проблема
Стандартные кросс-датасетные бенчмарки в основном чисты — это главный практический вывод. Аудит 24 стандартных пар near/far OOD выявил утечку ровно в одной паре (заведомо трудной CIFAR-100 против CIFAR-10) и ни в одной far-OOD паре, что подтверждает специфичность диагностики.
При исправленном протоколе метод возмущений (perturbation) оказался бесполезен: supervised-читатель восстанавливает OOD-сигнал с AUROC 0.87–1.00, но ни один unsupervised-детектор этого не делает, а сам метод не превосходит обычное расстояние Махаланобиса.
«Сигналы возмущений декодируемы, но не детектируемы», — так
формулируют главный итог авторы препринта на arXiv.
Что это значит
Результат — предупреждение для ML-исследователей: аномально низкий AUROC (ниже 0.5) может указывать не на плохой детектор, а на загрязнённый бенчмарк. Авторы предлагают не новый метод OOD-детекции, а исправленный протокол и готовый тест на утечку — и для прозрачности отзывают более раннюю ошибочную корреляцию.
Частые вопросы
Что такое OOD-детекция?
OOD-детекция (out-of-distribution) — распознавание данных, не похожих на те, на которых обучалась модель. Она нужна, чтобы модель не выдавала уверенные ответы на незнакомых или аномальных входах.
Почему AUROC оказался ниже 0.5?
AUROC 0.326 ниже уровня случайности 0.5 возник из-за утечки: «чужой» класс был в обучающей выборке, поэтому детектор наказывался за правильное решение. После устранения утечки метрика выросла до 0.911.
Затрагивает ли это стандартные бенчмарки?
В основном нет. Аудит 24 стандартных пар near/far OOD нашёл утечку лишь в одной паре — CIFAR-100 против CIFAR-10, — а обычная кросс-датасетная схема построения бенчмарков признана чистой.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.