arXiv cs.AI→ original

MUX: метод непрерывного рассуждения LLM через мультиплексированные токены

MUX — новый метод из препринта arXiv, который позволяет языковым моделям рассуждать в непрерывном латентном пространстве. Один токен без потерь кодирует сразу целый фрагмент цепочки рассуждений вместо одного слова, ускоряя вычисления. По данным авторов, MUX обошёл сильные латентные бейзлайны в 32 настройках оценки на четырёх моделях.

Traité par IA depuis arXiv cs.AI ; édité par Hamidun News
MUX: метод непрерывного рассуждения LLM через мультиплексированные токены
Source : arXiv cs.AI. Collage: Hamidun News.
◐ Écouter l'article

En juillet 2026, des chercheurs ont publié sur arXiv la méthode MUX (multiplexed tokens) — une façon de mener le raisonnement des modèles de langage dans un espace latent continu, où un seul token latent encode sans perte un fragment entier de la chaîne de raisonnement au lieu d'un seul mot. Selon les auteurs, MUX a surpassé de solides baselines de raisonnement latent dans 32 configurations d'évaluation sur quatre modèles de langage à la fois.

Pourquoi le raisonnement classique est lent

Les modèles de raisonnement classiques gaspillent du calcul : chaque étape de la chaîne de raisonnement ne transmet qu'un seul sous-mot, et une partie de chaque étape est consacrée à la verbalisation de la pensée plutôt qu'au calcul lui-même. Les auteurs de MUX appellent cela un « goulot d'étranglement » computationnel : le modèle raisonne en langage naturel, de sorte que le débit d'une seule étape est limité par la taille d'un token subword — et sur des chaînes longues, cela se traduit par du calcul gaspillé.

Que sont les tokens multiplexés

MUX distille une chaîne de raisonnement discrète en tokens latents continus. Chacun de ces tokens est entraîné à représenter une superposition linéaire pondérée (multiplexage) de toute une plage de sous-mots, et cette superposition est réversible : la plage originale de sous-mots peut être entièrement récupérée (démultiplexage). L'idée clé est de rendre la compression réversible par construction, et non approximative : ainsi, le modèle ne « coupe pas les coins ronds » et préserve toute la logique de raisonnement d'origine.

*Méthode — MUX, préprint arXiv 2607.18264, type de publication « new » (juillet 2026)

*Mécanisme — un token latent équivaut à une somme pondérée de plusieurs sous-mots discrets de raisonnement

*Réversibilité — superposition sans perte, la plage de sous-mots est entièrement récupérable

*Pondération — dépendante de la position, par exemple une décroissance géométrique des poids

*Bonus — exploration parallèle de plusieurs branches de solution dans les tâches nécessitant une recherche

Les auteurs démontrent que des poids simples dépendants de la position — par exemple une décroissance géométrique adaptée — assurent un multiplexage sans perte. Cela empêche à son tour l'« effondrement latent » : un comportement dégénéré de raccourci (shortcut) dans lequel le modèle effondre la représentation latente et cesse de vraiment raisonner.

Dans quelle mesure MUX est-il meilleur que les alternatives

MUX a surpassé de solides baselines de raisonnement latent dans 32 configurations expérimentales couvrant quatre modèles de langage différents, selon le résumé des auteurs sur arXiv. Il s'agit d'une supériorité non pas sur un seul modèle, mais sur toute une classe de méthodes de raisonnement latent — sur l'ensemble de la grille de 32 configurations. De plus, des analyses d'ablation et de probing ont montré que les tokens latents appris encodent un raisonnement correct et interprétable, et non du bruit aléatoire.

Un résultat à part est la capacité de recherche parallèle : le raisonnement multiplexé peut explorer simultanément plusieurs branches de solution dans des tâches nécessitant l'exploration de variantes.

«

La superposition sans perte comme objectif d'entraînement local est une condition suffisante pour un raisonnement continu fort et efficace dans l'espace latent », indique le résumé de l'étude MUX sur arXiv.

Ce que cela signifie

Le raisonnement latent est une tentative de supprimer la « taxe linguistique » des modèles de raisonnement : calculer dans un espace continu compact plutôt que dans de longues chaînes textuelles. Si les résultats de MUX se reproduisent sur des modèles plus grands, cela ouvre la voie à un raisonnement moins coûteux et plus rapide, sans perte de précision ni d'interprétabilité — c'est-à-dire à une IA de raisonnement qui dépense moins de calcul pour les mêmes tâches.

Questions fréquentes

Que sont les tokens multiplexés ?

Ce sont des tokens latents continus, dont chacun encode une somme pondérée de plusieurs sous-mots de la chaîne de raisonnement à la fois. Par construction, la superposition est réversible — la plage originale de sous-mots peut être entièrement récupérée, si bien qu'aucune information n'est perdue.

En quoi MUX diffère-t-il d'une chaîne de raisonnement classique ?

Une chain-of-thought classique transmet un sous-mot par étape et raisonne en texte. MUX comprime tout un fragment de raisonnement en un seul token latent et calcule dans un espace continu — cela augmente le débit et, selon les auteurs, dépasse les baselines latentes dans 32 configurations de test sur quatre modèles.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?

AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.

Qu'en pensez-vous ?
Chargement des commentaires…