arXiv cs.LG→ original

L'audit des métriques de grokking a montré : les estimations initiales de compression de représentation sont surestimées plusieurs fois

Les chercheurs ont vérifié la fiabilité de la mesure du grokking — généralisation brusque du réseau après un entraînement prolongé. Le rang effectif au moment de la transition surestime la compression finale de l'embedding sur MLP par 3-5 fois, et sur transformateur — par 1,3-1,5 fois. Le retard de la compression par rapport à la précision — au moins 10 000 étapes. LayerNorm change le tableau : la part de la compression au moment du grokking passe de 0,87 à 0,25. Le code d'audit est en accès libre.

Traité par IA depuis arXiv cs.LG ; édité par Hamidun News
L'audit des métriques de grokking a montré : les estimations initiales de compression de représentation sont surestimées plusieurs fois
Source : arXiv cs.LG. Collage: Hamidun News.
◐ Écouter l'article

Les chercheurs en juillet 2026 ont publié un audit des méthodes de mesure du « grokking » sur arXiv — l'effet où un réseau de neurones généralise soudainement les résultats après avoir arrêté d'améliorer la précision sur l'ensemble d'entraînement — et ont montré que la métrique popular effective rank exagère le degré de compression de représentation dans les modèles par des ordres de magnitude lorsqu'elle est mesurée au moment exact de la transition de grokking.

Qu'est-ce que le grokking et pourquoi est-il difficile à mesurer

Le grokking est un phénomène dans lequel un réseau de neurones entraîné sur des tâches comme l'arithmétique modulaire mémorise d'abord l'ensemble d'entraînement, puis — après des dizaines de milliers d'étapes d'entraînement — soudain généralise le modèle et commence à résoudre correctement des exemples qu'il n'a jamais vus. Les chercheurs associent souvent le grokking à la « compression » de la représentation interne du réseau (embedding), et utilisent la métrique effective rank pour mesurer cette compression.

Les auteurs de l'audit montrent que mesurer effective rank au moment exact de la transition de grokking — une pratique courante dans le domaine — produit une image déformée : la compression d'embedding continue pendant des dizaines de milliers d'étapes après que le réseau a déjà généralisé la tâche.

À quel point les estimations sont-elles déformées

  • Sur l'architecture MLP, effective rank mesuré à la transition de grokking exagère la valeur finale (convergée) de 3 à 5 fois
  • Sur un transformer entraîné à la convergence complète, la surestimation est plus faible — 1,3-1,5 fois
  • Sur les MLPs, une telle mesure précoce « efface » également l'information sur quelles cellules de représentation sont en fait comprimées
  • Le décalage entre la compression et la transition vers les réponses correctes est approximativement équivalent au temps passé sur le grokking lui-même — au moins 10 000 étapes d'entraînement
  • L'ajout de LayerNorm au transformer réduit la fraction de compression complétée au moment du grokking de 0,87 à 0,25

Ce que la vérification de l'architecture a révélé

Une expérience d'ablation à variable unique — en changeant un seul paramètre d'architecture pour isoler son effet — a révélé que LayerNorm contrôle spécifiquement la taille de ce décalage : sans lui, le transformer comprime la représentation presque de façon synchrone avec la transition de grokking (0,87), tandis qu'avec LayerNorm la plupart de la compression se produit après (0,25). Une expérience de contrôle pré-enregistrée a exclu l'invariance d'échelle comme explication alternative de l'effet.

Les auteurs ont également testé une « loi de profondeur » plus étroite et spécifique au MLP reliant le budget de normalisation à la valeur de compression convergée — et ont découvert que la loi ne se transfère pas aux transformers et inverse même le signe avec un weight decay libre, ce qui signifie qu'elle fonctionne de manière instable en dehors de l'ensemble étroit de conditions pour lequel elle a été initialement dérivée.

Ce que cela signifie

Ce travail n'est pas seulement une nouvelle métrique, mais un audit méthodologique : les auteurs proposent un protocole qui sépare le moment où la généralisation commence du moment où la compression se termine, signale les cas de censure (quand la métrique atteint un plafond de mesure), et exclut les cellules de représentation « limitrophes » qui ne se généralisent jamais complètement. Leur propre ensemble de tests adversariaux a attrapé une erreur de fausse confiance dans leur propre branche de code — soulignant à quel point il est facile d'obtenir des résultats trompeusement confiants mais incorrects à partir d'une mesure superficielle du grokking. Le code d'audit et les instruments sont publiés publiquement.

Pour les chercheurs en interprétabilité, cela signifie reconsidérer la pratique : si un article sur l'architecture des réseaux de neurones s'appuie sur effective rank mesuré à un seul moment dans le temps — juste après que le modèle ait commencé à résoudre la tâche correctement — les conclusions sur la compression de représentation sont probablement gonflées et doivent être revérifiées sur le modèle convergé. Une leçon distincte concerne les composants architecturaux comme LayerNorm : leur présence ou absence peut changer dramatiquement non pas le fait du grokking lui-même, mais la dynamique de ce qui se passe avec la représentation du réseau après, ce qui signifie que comparer les résultats expérimentaux sur les MLPs et les transformers directement, sans correction architecturale, est risqué.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?

AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.

Qu'en pensez-vous ?
Chargement des commentaires…