mLSTM и ортогонализация чтения: прирост recall — это обучаемость, а не память
Новый препринт на arXiv перепроверил, почему ортогонализация матрицы памяти mLSTM резко улучшает ассоциативное извлечение. Вывод: дело не в памяти, а в обучении. Приём ускоряет выход модели из долгого плато примерно в шесть раз, но полностью отключается после скачка — и точность не падает. Значит, recall-бенчмарки частично меряют обучаемость, а не ёмкость памяти.
Traité par IA depuis arXiv cs.LG ; édité par Hamidun News
En juillet 2026, un preprint est paru sur arXiv (arXiv:2607.19390) qui a réexaminé un résultat très commenté : l'orthogonalisation de la matrice de mémoire du réseau récurrent mLSTM lors de la lecture (cinq itérations de l'algorithme de Newton–Schulz, entraînées de bout en bout) améliore fortement la récupération associative bruitée. L'effet se reproduit, mais, comme le montrent les auteurs, il ne s'agit pas d'une amélioration de la mémoire, mais d'une accélération de l'apprentissage.
Un plateau, pas de la mémoire
L'apprentissage sur cette tâche consiste en un long plateau au niveau du hasard, suivi d'un saut brutal vers la solution. D'après le preprint, la lecture orthogonalisée agit précisément pendant le plateau : elle reconditionne le problème d'optimisation lui-même, sans élargir la quantité d'information stockée. Le décodage direct de l'état de la mémoire a montré que les modèles « en échec » retiennent déjà environ la moitié des associations sous une forme linéairement récupérable — le plateau s'avère être une défaillance de lecture au-dessus d'un stockage à moitié écrit, et non une absence d'écriture.
Trois propriétés révélatrices
Les auteurs présentent trois propriétés qui prouvent que l'effet relève de l'entraînabilité, et non de la capacité de mémoire.
- Cohérence. La lecture exacte par la méthode récursive des moindres carrés (la couche Mesa) reproduit l'effet, tandis que l'estimation straight-through, l'écriture par règle delta, les clés aléatoires figées et la normalisation ordinaire ne le font pas.
- Homogénéité. Sur une grille « taux d'apprentissage × complexité », l'astuce multiplie par environ six fois la probabilité de sortir du plateau, sans dépendance notable à la complexité, et élargit le corridor opérationnel du taux d'apprentissage.
- Amovibilité. Appliquée à des modèles déjà en échec au moment de l'inférence, l'astuce n'en sauve aucun ; désactivée par recuit juste après le saut, elle laisse les mLSTM ordinaires avec une précision complète.
Pourquoi le gain disparaît sans l'architecture
La majeure partie du gain publié ne nécessite aucun changement architectural. La proportion de tâches résolues à budget fixe, comme le notent les auteurs, mesure la probabilité de sortir du plateau, laquelle obéit à une loi de « chaleur et de bruit » : élasticité par rapport au taux d'apprentissage de +3.0, par rapport au bruit de gradient de −1.65. Dans ce cadre, le résultat initial sur un vocabulaire de 96 tokens (vocab-96) s'avère être une condition de faible bruit due à de grands lots, et non une manifestation de la capacité de mémoire.
«
Les benchmarks de mémorisation utilisés pour sélectionner les architectures mesurent en partie l'entraînabilité », indique le résumé du preprint arXiv:2607.19390.
Ce que cela signifie
Le résultat frappe deux habitudes de l'industrie. Premièrement, les benchmarks de recall utilisés pour choisir les architectures des modèles mesurent en partie non pas la mémoire, mais la facilité avec laquelle un modèle s'entraîne. Deuxièmement, le système s'avère être un « organisme modèle » vivant de l'émergence : un seuil comportemental abrupt naît d'une métrique censurée superposée à une structure qui s'accumule progressivement — et non de l'apparition soudaine d'une nouvelle capacité.
Questions fréquentes
Qu'est-ce que la lecture orthogonalisée dans mLSTM ?
La lecture orthogonalisée rend la matrice de mémoire du mLSTM orthogonale au moment de la lecture — ici, via cinq itérations de l'algorithme de Newton–Schulz, entraînées de bout en bout. Le preprint montre qu'elle améliore non pas le stockage des données, mais les conditions d'optimisation.
Pourquoi le gain ne peut-il pas être considéré comme une amélioration
de la mémoire ?
Le gain est « amovible » : l'astuce n'aide pas les modèles déjà entraînés qui ont échoué au moment de l'inférence, et elle est entièrement désactivée par recuit après que le modèle a effectué son saut, sans que la précision du mLSTM ordinaire ne baisse. D'après le preprint, environ la moitié des associations sont stockées sous une forme linéairement récupérable même sans elle.
Qu'est-ce que l'émergence dans ce contexte ?
L'émergence ici est un seuil comportemental abrupt qui naît non pas d'un saut de capacité, mais d'une métrique censurée superposée à une structure s'accumulant en douceur à l'intérieur du modèle.
Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?
AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.
L'essentiel de l'IA — une fois par semaine
Sept actus qui ont vraiment compté, choisies à la main. Sans bruit ni communiqués.
C'est fait ! Vérifiez votre boîte mail pour la confirmation.