Утечка в OOD-бенчмарках: как загрязнённый класс обрушил AUROC детектора до 0.326
Препринт на arXiv показал, как утечка в OOD-бенчмарке обрушивает оценку детектора аномалий: AUROC упал до 0.326 — ниже случайного угадывания — только потому, что «чужой» класс на самом деле был в обучающей выборке модели. После удаления класса и переобучения 35 моделей показатель вырос до 0.911. Авторы предлагают диагностический «отпечаток» на такую утечку.
Procesado por IA desde arXiv cs.LG; editado por Hamidun News
Los investigadores de un preprint en arXiv (arXiv:2607.19393, julio de 2026) demostraron que una forma habitual de construir benchmarks OOD puede distorsionar los resultados: un detector de anomalías obtuvo un AUROC de 0.326 —por debajo del nivel de adivinanza aleatoria de 0.5— simplemente porque la clase "ajena" en realidad estaba presente en el conjunto de entrenamiento del modelo.
Por qué el detector resultó peor que una moneda al aire
El AUROC de 0.326 surgió por una fuga del benchmark: la clase etiquetada como OOD ("fuera de distribución") estaba entre aquellas con las que el modelo ya había sido entrenado. Sus ejemplos terminaron dentro del conjunto in-distribution, y el detector era penalizado por reconocerlos correctamente como conocidos. Tras eliminar esta clase y reentrenar 35 modelos en dos dominios, el indicador subió a 0.911 —de un colapso por debajo del azar a un resultado casi excelente. La métrica en sí no cambió: solo cambió la limpieza del benchmark.
Qué es una huella de fuga
Una huella de fuga (leak fingerprint) es un par de señales con las que los autores distinguen un benchmark contaminado de uno limpio. La contaminación se delata cuando un clasificador supervisado separa los ejemplos OOD de forma casi perfecta (AUROC≈1), mientras que un detector no supervisado se desploma por debajo de 0.65. Esta divergencia es precisamente el marcador de que la clase "ajena" en realidad le resulta conocida al modelo.
Datos clave del estudio:
- El AUROC subió de 0.326 a 0.911 tras eliminar la clase filtrada y reentrenar 35 modelos en dos dominios
- Huella de fuga: decodificabilidad supervisada con AUROC≈1 junto a una detección no supervisada por debajo de 0.65
- Validación en 52 configuraciones (20 con fuga, 32 limpias) — ResNet-50 y ViT-B/16 en CIFAR-10/100
- Precisión diagnóstica: sensibilidad 18/20 y especificidad 31/32 en el espacio de embeddings
- Los controles con exclusión del conjunto de entrenamiento funcionaron perfectamente — 20/20
Qué tan extendido está el problema
Los benchmarks estándar entre datasets están en su mayoría limpios — esta es la conclusión práctica principal. Una auditoría de 24 pares estándar near/far OOD reveló fuga en exactamente un par (el notoriamente difícil CIFAR-100 frente a CIFAR-10) y en ninguno de los pares far-OOD, lo que confirma la especificidad del diagnóstico.
Con el protocolo corregido, el método de perturbaciones resultó inútil: un lector supervisado recupera la señal OOD con un AUROC de 0.87–1.00, pero ningún detector no supervisado lo logra, y el método en sí no supera la distancia de Mahalanobis habitual.
"Las señales de perturbación son decodificables, pero no detectables",
así formulan los autores del preprint la conclusión principal.
Qué significa esto
El resultado es una advertencia para los investigadores de ML: un AUROC anómalamente bajo (por debajo de 0.5) puede indicar no un mal detector, sino un benchmark contaminado. Los autores no proponen un nuevo método de detección OOD, sino un protocolo corregido y una prueba de fuga lista para usar —y, por transparencia, retractan una correlación errónea anterior.
Preguntas frecuentes
¿Qué es la detección OOD?
La detección OOD (out-of-distribution) es el reconocimiento de datos que no se parecen a aquellos con los que se entrenó el modelo. Es necesaria para que el modelo no dé respuestas seguras ante entradas desconocidas o anómalas.
¿Por qué el AUROC resultó por debajo de 0.5?
El AUROC de 0.326, por debajo del nivel de azar de 0.5, surgió por una fuga: la clase "ajena" estaba en el conjunto de entrenamiento, por lo que el detector era penalizado por tomar la decisión correcta. Tras eliminar la fuga, la métrica subió a 0.911.
¿Afecta esto a los benchmarks estándar?
En su mayoría no. Una auditoría de 24 pares estándar near/far OOD encontró fuga solo en un par —CIFAR-100 frente a CIFAR-10—, mientras que el esquema habitual de construcción de benchmarks entre datasets fue considerado limpio.
¿Quieres dejar de leer sobre IA y empezar a usarla?
AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.