Auditoria de métricas de grokking mostrou: estimativas iniciais de compressão de representação são superestimadas várias vezes
Os pesquisadores verificaram a confiabilidade da medição de grokking — generalização aguda da rede após treinamento prolongado. O rank efetivo no momento da transição superestima a compressão final de embedding em MLP por 3-5 vezes, e em transformador — por 1,3-1,5 vezes. O atraso da compressão em relação à precisão — pelo menos 10.000 passos. LayerNorm muda o quadro: a participação da compressão no momento do grokking cai de 0,87 para 0,25. O código de auditoria está em acesso aberto.
Processado por IA de arXiv cs.LG; editado por Hamidun News
Pesquisadores em julho de 2026 publicaram uma auditoria de métodos de medição de "grokking" no arXiv — o efeito onde uma rede neural de repente generaliza resultados após parar de melhorar a precisão no conjunto de treinamento — e mostraram que a popular métrica effective rank exagera o grau de compressão de representação em modelos por ordens de magnitude quando medida no momento exato da transição de grokking.
O que é grokking e por que é difícil de medir
Grokking é um fenômeno em que uma rede neural treinada em tarefas como aritmética modular primeiro memoriza o conjunto de treinamento, depois — após dezenas de milhares de passos de treinamento — de repente generaliza o padrão e começa a resolver corretamente exemplos que nunca viu. Pesquisadores frequentemente associam grokking à "compressão" da representação interna da rede (embedding), e usam a métrica effective rank para medir essa compressão.
Os autores da auditoria mostram que medir effective rank no momento exato da transição de grokking — uma prática comum no campo — produz uma imagem distorcida: a compressão de embedding continua por dezenas de milhares de passos depois que a rede já generalizou a tarefa.
Quanto as estimativas estão distorcidas
- Na arquitetura MLP, effective rank medido na transição de grokking exagera o valor final (convergido) por 3-5 vezes
- Em um transformer treinado até convergência completa, a exageração é menor — 1,3-1,5 vezes
- Em MLPs, tal medição precoce também "apaga" informação sobre quais células de representação estão sendo comprimidas
- O atraso entre a compressão e a transição para respostas corretas é aproximadamente equivalente ao tempo gasto no próprio grokking — pelo menos 10.000 passos de treinamento
- Adicionar LayerNorm ao transformer reduz a fração de compressão completada no momento de grokking de 0,87 para 0,25
O que a verificação de arquitetura revelou
Um experimento de ablação de variável única — mudando apenas um parâmetro de arquitetura para isolar seu efeito — revelou que LayerNorm controla especificamente o tamanho desse atraso: sem ele, o transformer comprime a representação quase sincronicamente com a transição de grokking (0,87), enquanto com LayerNorm a maioria da compressão ocorre depois (0,25). Um experimento de controle pré-registrado excluiu a invariância de escala como uma explicação alternativa para o efeito.
Os autores também testaram uma "lei de profundidade" mais estreita e específica para MLP vinculando o orçamento de normalização ao valor de compressão convergido — e descobriram que a lei não se transfere para transformers e até inverte o sinal com weight decay livre, o que significa que funciona instável fora do conjunto estreito de condições para o qual foi originalmente derivada.
O que isso significa
Este trabalho não é apenas uma nova métrica, mas uma auditoria metodológica: os autores propõem um protocolo que separa o momento em que a generalização começa do momento em que a compressão se completa, sinaliza casos de censura (quando a métrica atinge um teto de medição), e exclui células de representação "fronteiriças" que nunca generalizam completamente. Seu próprio conjunto de testes adversariais capturou um erro de falsa confiança em seu próprio ramo de código — destacando como é fácil obter resultados enganosamente confiantes mas incorretos de uma medição superficial de grokking. O código de auditoria e ferramentas são lançados publicamente.
Para pesquisadores de interpretabilidade, isso significa reconsiderar a prática: se um artigo sobre arquitetura de rede neural se baseia em effective rank medido em um único momento no tempo — logo depois que o modelo começou a resolver a tarefa corretamente — conclusões sobre compressão de representação provavelmente estão infladas e precisam ser verificadas no modelo convergido. Uma lição separada diz respeito a componentes arquitetônicos como LayerNorm: sua presença ou ausência pode mudar dramaticamente não o fato do grokking em si, mas a dinâmica do que acontece com a representação da rede depois, significando que comparar resultados experimentais em MLPs e transformers diretamente, sem correção arquitetônica, é arriscado.
Quer parar de ler sobre IA e começar a usar?
AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.