mLSTM и ортогонализация чтения: прирост recall — это обучаемость, а не память
Новый препринт на arXiv перепроверил, почему ортогонализация матрицы памяти mLSTM резко улучшает ассоциативное извлечение. Вывод: дело не в памяти, а в обучении. Приём ускоряет выход модели из долгого плато примерно в шесть раз, но полностью отключается после скачка — и точность не падает. Значит, recall-бенчмарки частично меряют обучаемость, а не ёмкость памяти.
AI-обработка оригинала arXiv cs.LG; редакция Hamidun News
В июле 2026 года на arXiv появился препринт (arXiv:2607.19390), который перепроверил громкий результат: ортогонализация матрицы памяти рекуррентной сети mLSTM при чтении (пять итераций алгоритма Ньютона–Шульца, обучаемых сквозным образом) резко улучшает зашумлённое ассоциативное извлечение. Эффект воспроизводится, но, как показывают авторы, это не улучшение памяти, а ускорение обучения.
Плато, а не память
Обучение на этой задаче — это долгое плато на уровне случайного угадывания, за которым следует резкий скачок к решению. Ортогонализированное чтение, по данным препринта, работает именно во время плато: оно переобусловливает саму задачу оптимизации, а не расширяет объём хранимой информации. Прямое декодирование состояния памяти показало, что «провалившиеся» модели уже держат около половины ассоциаций в линейно восстановимой форме — плато оказывается сбоем чтения над наполовину записанным хранилищем, а не отсутствием записи.
Три свойства-улики
Авторы приводят три свойства, которые доказывают, что дело в обучаемости, а не в ёмкости памяти.
- Согласованность. Точное чтение по рекурсивному методу наименьших квадратов (слой Mesa) воспроизводит эффект, а straight-through-оценка, запись по дельта-правилу, замороженные случайные ключи и обычная нормализация — нет.
- Однородность. На сетке «скорость обучения × сложность» приём умножает вероятность выхода из плато примерно в шесть раз без заметной зависимости от сложности и расширяет рабочий коридор скорости обучения.
- Съёмность. Применённый к уже провалившимся моделям на инференсе, приём не спасает ни одну; отключённый отжигом сразу после скачка, он оставляет обычные mLSTM с полной точностью.
Почему прирост исчезает без архитектуры
Большая часть опубликованного выигрыша не требует архитектурных изменений вообще. Доля решённых задач при фиксированном бюджете, как отмечают авторы, измеряет вероятность выхода из плато, а та подчиняется закону «тепла и шума»: эластичность по скорости обучения +3.0, по градиентному шуму −1.65. В этой рамке исходный результат на словаре из 96 токенов (vocab-96) оказывается условием низкого шума из-за больших батчей, а не проявлением ёмкости памяти.
«Бенчмарки на запоминание, используемые для выбора архитектуры,
частично измеряют обучаемость», — говорится в аннотации препринта arXiv:2607.19390.
Что это значит
Результат бьёт по двум привычкам индустрии. Во-первых, бенчмарки на recall, по которым выбирают архитектуры моделей, частично меряют не память, а то, насколько легко модель обучается. Во-вторых, система оказывается наглядным «модельным организмом» эмерджентности: резкий порог в поведении возникает из цензурированной метрики над постепенно накапливающейся структурой — а не из внезапного появления новой способности.
Частые вопросы
Что такое ортогонализированное чтение в mLSTM?
Ортогонализированное чтение делает матрицу памяти mLSTM ортогональной в момент чтения — здесь через пять итераций алгоритма Ньютона–Шульца, обучаемых сквозным образом. Препринт показывает, что оно улучшает не хранение данных, а условия оптимизации.
Почему прирост нельзя считать улучшением памяти?
Прирост «съёмный»: приём не помогает уже обученным неудачным моделям на инференсе и полностью отключается отжигом после того, как модель совершила скачок, при этом точность обычной mLSTM не падает. По данным препринта, около половины ассоциаций и без него хранятся в линейно восстановимой форме.
Что такое эмерджентность в этом контексте?
Эмерджентность здесь — это резкий поведенческий порог, который возникает не из скачка способностей, а из цензурированной метрики поверх плавно накапливающейся структуры внутри модели.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.