arXiv cs.LG→ original

Auditoría de métricas de grokking mostró: las estimaciones iniciales de compresión de representación se sobreestiman varias veces

Los investigadores verificaron la confiabilidad de la medición de grokking — generalización aguda de la red después de un entrenamiento prolongado. El rango efectivo en el momento de la transición sobreestima la compresión final de embedding en MLP por 3-5 veces, y en transformador — por 1,3-1,5 veces. El rezago de la compresión con respecto a la precisión — al menos 10.000 pasos. LayerNorm cambia el panorama: la participación de la compresión en el momento del grokking cae de 0,87 a 0,25. El código de auditoría está en acceso abierto.

Procesado por IA desde arXiv cs.LG; editado por Hamidun News
Auditoría de métricas de grokking mostró: las estimaciones iniciales de compresión de representación se sobreestiman varias veces
Fuente: arXiv cs.LG. Collage: Hamidun News.
◐ Escuchar artículo

Los investigadores en julio de 2026 publicaron una auditoría de métodos de medición de "grokking" en arXiv — el efecto donde una red neuronal de repente generaliza resultados después de dejar de mejorar la precisión en el conjunto de entrenamiento — y demostraron que la popular métrica effective rank exagera el grado de compresión de representación en modelos en órdenes de magnitud cuando se mide en el momento exacto de la transición de grokking.

Qué es grokking y por qué es difícil de medir

Grokking es un fenómeno en el que una red neuronal entrenada en tareas como aritmética modular primero memoriza el conjunto de entrenamiento, luego — después de decenas de miles de pasos de entrenamiento — de repente generaliza el patrón y comienza a resolver correctamente ejemplos que nunca ha visto. Los investigadores a menudo asocian grokking con la "compresión" de la representación interna de la red (embedding), y usan la métrica effective rank para medir esta compresión.

Los autores de la auditoría muestran que medir effective rank en el momento exacto de la transición de grokking — una práctica común en el campo — produce una imagen distorsionada: la compresión de embedding continúa durante decenas de miles de pasos después de que la red ya ha generalizado la tarea.

Qué tan distorsionadas están las estimaciones

  • En arquitectura MLP, effective rank medido en la transición de grokking exagera el valor final (convergido) de 3 a 5 veces
  • En un transformer entrenado hasta convergencia completa, la exageración es menor — 1.3-1.5 veces
  • En MLPs, tal medición temprana además "borra" información sobre cuáles celdas de representación incluso se comprimen
  • El retraso entre la compresión y la transición a respuestas correctas es aproximadamente equivalente al tiempo dedicado al grokking mismo — al menos 10,000 pasos de entrenamiento
  • Agregar LayerNorm al transformer reduce la fracción de compresión completada en el momento de grokking de 0.87 a 0.25

Qué reveló la verificación de arquitectura

Un experimento de ablación de variable única — cambiar solo un parámetro de arquitectura para aislar su efecto — reveló que LayerNorm específicamente controla el tamaño de este retraso: sin él, el transformer comprime la representación casi sincrónicamente con la transición de grokking (0.87), mientras que con LayerNorm la mayoría de la compresión ocurre después (0.25). Un experimento de control pre-registrado excluyó la invariancia de escala como una explicación alternativa para el efecto.

Los autores también probaron una "ley de profundidad" más estrecha y específica de MLP que vincula el presupuesto de normalización al valor de compresión convergido — y encontraron que la ley no se transfiere a transformers e incluso invierte el signo con weight decay libre, lo que significa que funciona inestablemente fuera del conjunto estrecho de condiciones para las cuales fue originalmente derivada.

Qué significa esto

Este trabajo no es solo una nueva métrica, sino una auditoría metodológica: los autores proponen un protocolo que separa el momento en que comienza la generalización del momento en que se completa la compresión, señala casos de censura (cuando la métrica alcanza un techo de medición), y excluye celdas de representación "fronterizas" que nunca se generalizan completamente. Su propio conjunto de pruebas adversariales capturó un error de falsa confianza en su propia rama de código — subrayando cuán fácil es obtener resultados deceptivamente seguros pero incorrectos de una medición superficial de grokking. El código de auditoría e instrumentos se publican públicamente.

Para investigadores de interpretabilidad, esto significa reconsiderar la práctica: si un artículo sobre arquitectura de red neuronal se basa en effective rank medido en un único momento en el tiempo — justo después de que el modelo comenzó a resolver la tarea correctamente — las conclusiones sobre compresión de representación probablemente estén infladas y necesiten verificación en el modelo convergido. Una lección separada concierne componentes arquitectónicos como LayerNorm: su presencia o ausencia puede cambiar dramáticamente no el hecho del grokking en sí, sino la dinámica de lo que sucede con la representación de la red después, lo que significa que comparar resultados experimentales en MLPs y transformers directamente, sin corrección arquitectónica, es arriesgado.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Quieres dejar de leer sobre IA y empezar a usarla?

AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.

¿Qué te parece?
Cargando comentarios…