Аудит метрик grokking показал: ранние оценки сжатия представления завышены в разы
Исследователи проверили надёжность измерения grokking — резкого обобщения сети после долгого обучения. Effective rank в момент перехода завышает итоговое сжатие эмбеддинга на MLP в 3-5 раз, а на трансформере — в 1,3-1,5 раза. Отставание сжатия от точности — не менее 10 000 шагов. LayerNorm меняет картину: доля сжатия к моменту grokking падает с 0,87 до 0,25. Код аудита в открытом доступе.
AI-обработка оригинала arXiv cs.LG; редакция Hamidun News
Исследователи в июле 2026 года опубликовали на arXiv аудит методов измерения «grokking» — эффекта, когда нейросеть резко обобщает результат уже после того, как перестаёт улучшать точность на обучающей выборке, — и показали, что популярная метрика effective rank завышает степень сжатия представления в модели в разы, если измерять её сразу в момент grokking-перехода.
Что такое grokking и почему его трудно измерить
Grokking — феномен, при котором нейросеть, обучаемая на задачах вроде модульной арифметики, сначала запоминает обучающую выборку, а затем — спустя десятки тысяч шагов обучения — резко обобщает закономерность и начинает верно решать примеры, которых не видела. Исследователи часто связывают grokking со «сжатием» внутреннего представления сети (embedding), и для измерения этого сжатия используют метрику effective rank.
Авторы аудита показывают, что измерение effective rank ровно в момент grokking-перехода — распространённая практика в этой области — даёт искажённую картину: сжатие эмбеддинга продолжается ещё десятки тысяч шагов после того, как сеть уже обобщила задачу.
Насколько сильно искажены оценки
- На MLP-архитектуре effective rank, измеренный в момент grokking-перехода, завышает итоговое (сошедшееся) значение в 3-5 раз
- На трансформере, обученном до полной сходимости, завышение меньше — в 1,3-1,5 раза
- На MLP такое раннее измерение дополнительно «стирает» информацию о том, какие именно ячейки представления вообще сжимаются
- Отставание сжатия от перехода к точным ответам составляет порядка времени, затраченного на сам grokking, — не менее 10 000 шагов обучения
- Добавление LayerNorm к трансформеру снижает долю сжатия, завершённого к моменту grokking, с 0,87 до 0,25
Что показала проверка на архитектуре
Однопеременный абляционный эксперимент — когда меняют только один параметр архитектуры, чтобы изолировать его влияние, — выявил, что именно LayerNorm управляет размером этого отставания: без неё трансформер сжимает представление почти синхронно с grokking-переходом (0,87), а с LayerNorm бóльшая часть сжатия происходит уже после (0,25). Заранее зарегистрированный контрольный эксперимент (pre-registered control) исключил инвариантность к масштабу как альтернативное объяснение эффекта.
Авторы также протестировали более узкий, специфичный для MLP «закон глубины», связывающий бюджет нормализации со сошедшимся значением сжатия, — и обнаружили, что закон не переносится на трансформеры и даже меняет знак при свободном weight decay, то есть работает нестабильно за пределами узкого набора условий, для которого был выведен.
Что это значит
Работа — это не просто новая метрика, а методологический аудит: авторы предлагают протокол, который отделяет момент начала обобщения от момента завершения сжатия, помечает случаи censoring (когда метрика упирается в потолок измерения) и исключает «граничные» ячейки представления, которые вообще никогда полностью не обобщаются. Их собственный adversarial-набор тестов поймал ошибку false-confidence в их собственной ветке кода — что подчёркивает, насколько легко получить обманчиво уверенный, но неверный результат при поверхностном измерении grokking. Код и инструментарий аудита выложены в открытый доступ.
Для исследователей интерпретируемости это означает пересмотр практики: если статья об устройстве нейросети опирается на effective rank, измеренный в один-единственный момент времени — сразу после того, как модель начала верно решать задачу, — выводы о степени сжатия представления, скорее всего, завышены и нуждаются в перепроверке на сошедшейся модели. Отдельный урок касается архитектурных компонентов вроде LayerNorm: их наличие или отсутствие способно кардинально менять не сам факт grokking, а динамику того, что происходит с представлением сети после него, а значит сравнивать результаты экспериментов на MLP и трансформерах напрямую, без поправки на архитектуру, тоже рискованно.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.