arXiv cs.LG→ original

Auditoria de métricas de grokking mostrou: estimativas iniciais de compressão de representação são superestimadas várias vezes

Os pesquisadores verificaram a confiabilidade da medição de grokking — generalização aguda da rede após treinamento prolongado. O rank efetivo no momento da transição superestima a compressão final de embedding em MLP por 3-5 vezes, e em transformador — por 1,3-1,5 vezes. O atraso da compressão em relação à precisão — pelo menos 10.000 passos. LayerNorm muda o quadro: a participação da compressão no momento do grokking cai de 0,87 para 0,25. O código de auditoria está em acesso aberto.

Processado por IA de arXiv cs.LG; editado por Hamidun News
Auditoria de métricas de grokking mostrou: estimativas iniciais de compressão de representação são superestimadas várias vezes
Fonte: arXiv cs.LG. Colagem: Hamidun News.
◐ Ouvir artigo

Pesquisadores em julho de 2026 publicaram uma auditoria de métodos de medição de "grokking" no arXiv — o efeito onde uma rede neural de repente generaliza resultados após parar de melhorar a precisão no conjunto de treinamento — e mostraram que a popular métrica effective rank exagera o grau de compressão de representação em modelos por ordens de magnitude quando medida no momento exato da transição de grokking.

O que é grokking e por que é difícil de medir

Grokking é um fenômeno em que uma rede neural treinada em tarefas como aritmética modular primeiro memoriza o conjunto de treinamento, depois — após dezenas de milhares de passos de treinamento — de repente generaliza o padrão e começa a resolver corretamente exemplos que nunca viu. Pesquisadores frequentemente associam grokking à "compressão" da representação interna da rede (embedding), e usam a métrica effective rank para medir essa compressão.

Os autores da auditoria mostram que medir effective rank no momento exato da transição de grokking — uma prática comum no campo — produz uma imagem distorcida: a compressão de embedding continua por dezenas de milhares de passos depois que a rede já generalizou a tarefa.

Quanto as estimativas estão distorcidas

  • Na arquitetura MLP, effective rank medido na transição de grokking exagera o valor final (convergido) por 3-5 vezes
  • Em um transformer treinado até convergência completa, a exageração é menor — 1,3-1,5 vezes
  • Em MLPs, tal medição precoce também "apaga" informação sobre quais células de representação estão sendo comprimidas
  • O atraso entre a compressão e a transição para respostas corretas é aproximadamente equivalente ao tempo gasto no próprio grokking — pelo menos 10.000 passos de treinamento
  • Adicionar LayerNorm ao transformer reduz a fração de compressão completada no momento de grokking de 0,87 para 0,25

O que a verificação de arquitetura revelou

Um experimento de ablação de variável única — mudando apenas um parâmetro de arquitetura para isolar seu efeito — revelou que LayerNorm controla especificamente o tamanho desse atraso: sem ele, o transformer comprime a representação quase sincronicamente com a transição de grokking (0,87), enquanto com LayerNorm a maioria da compressão ocorre depois (0,25). Um experimento de controle pré-registrado excluiu a invariância de escala como uma explicação alternativa para o efeito.

Os autores também testaram uma "lei de profundidade" mais estreita e específica para MLP vinculando o orçamento de normalização ao valor de compressão convergido — e descobriram que a lei não se transfere para transformers e até inverte o sinal com weight decay livre, o que significa que funciona instável fora do conjunto estreito de condições para o qual foi originalmente derivada.

O que isso significa

Este trabalho não é apenas uma nova métrica, mas uma auditoria metodológica: os autores propõem um protocolo que separa o momento em que a generalização começa do momento em que a compressão se completa, sinaliza casos de censura (quando a métrica atinge um teto de medição), e exclui células de representação "fronteiriças" que nunca generalizam completamente. Seu próprio conjunto de testes adversariais capturou um erro de falsa confiança em seu próprio ramo de código — destacando como é fácil obter resultados enganosamente confiantes mas incorretos de uma medição superficial de grokking. O código de auditoria e ferramentas são lançados publicamente.

Para pesquisadores de interpretabilidade, isso significa reconsiderar a prática: se um artigo sobre arquitetura de rede neural se baseia em effective rank medido em um único momento no tempo — logo depois que o modelo começou a resolver a tarefa corretamente — conclusões sobre compressão de representação provavelmente estão infladas e precisam ser verificadas no modelo convergido. Uma lição separada diz respeito a componentes arquitetônicos como LayerNorm: sua presença ou ausência pode mudar dramaticamente não o fato do grokking em si, mas a dinâmica do que acontece com a representação da rede depois, significando que comparar resultados experimentais em MLPs e transformers diretamente, sem correção arquitetônica, é arriscado.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Quer parar de ler sobre IA e começar a usar?

AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.

O que você acha?
Carregando comentários…