MUX: метод непрерывного рассуждения LLM через мультиплексированные токены
MUX — новый метод из препринта arXiv, который позволяет языковым моделям рассуждать в непрерывном латентном пространстве. Один токен без потерь кодирует сразу целый фрагмент цепочки рассуждений вместо одного слова, ускоряя вычисления. По данным авторов, MUX обошёл сильные латентные бейзлайны в 32 настройках оценки на четырёх моделях.
Procesado por IA desde arXiv cs.AI; editado por Hamidun News
En julio de 2026, investigadores publicaron en arXiv el método MUX (multiplexed tokens), una forma de llevar a cabo el razonamiento de los modelos de lenguaje en un espacio latente continuo, donde un solo token latente codifica sin pérdidas todo un fragmento de la cadena de razonamiento en lugar de una sola palabra. Según los autores, MUX superó a las bases de referencia (baselines) de razonamiento latente más sólidas en 32 configuraciones de evaluación en cuatro modelos de lenguaje a la vez.
Por qué el razonamiento habitual es lento
Los modelos de razonamiento clásicos desperdician cómputo: cada paso de la cadena de razonamiento transmite solo una subpalabra, y parte de cada paso se dedica a verbalizar el pensamiento en lugar de al cálculo en sí. Los autores de MUX llaman a esto un "cuello de botella" computacional: el modelo razona en lenguaje natural, por lo que la capacidad de un solo paso está limitada por el tamaño de un token subword — y en cadenas largas esto se traduce en cómputo desperdiciado.
Qué son los tokens multiplexados
MUX destila una cadena de razonamiento discreta en tokens latentes continuos. Cada uno de estos tokens se entrena para representar una superposición lineal ponderada (multiplexación) de todo un rango de subpalabras, y esta superposición es reversible: el rango original de subpalabras se puede recuperar por completo (demultiplexación). La idea clave es hacer que la compresión sea reversible por construcción, y no aproximada: de este modo el modelo no "recorta esquinas" y conserva toda la lógica de razonamiento original.
*Método — MUX, preprint de arXiv 2607.18264, tipo de publicación "new" (julio de 2026)
*Mecanismo — un token latente equivale a una suma ponderada de varias subpalabras discretas de razonamiento
*Reversibilidad — superposición sin pérdidas, el rango de subpalabras se recupera por completo
*Ponderación — dependiente de la posición, por ejemplo, decaimiento geométrico de los pesos
*Bonus — exploración paralela de varias ramas de solución en tareas que requieren búsqueda
Los autores demuestran que pesos simples dependientes de la posición — por ejemplo, un decaimiento geométrico adecuado — proporcionan una multiplexación sin pérdidas. Esto, a su vez, evita el "colapso latente": un comportamiento degenerado de atajo (shortcut) en el que el modelo colapsa la representación latente y deja de razonar realmente.
Cuánto mejor es MUX que las alternativas
MUX superó a las bases de referencia de razonamiento latente sólidas en 32 configuraciones experimentales que abarcan cuatro modelos de lenguaje diferentes, según el resumen de los autores en arXiv. Se trata de una superioridad no sobre un solo modelo, sino sobre toda una clase de métodos de razonamiento latente, en toda la matriz de 32 configuraciones. Además, los análisis de ablación y de sondeo (probing) mostraron que los tokens latentes aprendidos codifican un razonamiento correcto e interpretable, y no ruido aleatorio.
Un resultado aparte es la capacidad de búsqueda paralela: el razonamiento multiplexado puede explorar simultáneamente varias ramas de solución en tareas que requieren probar distintas variantes.
"La superposición sin pérdidas como objetivo local de entrenamiento es
una condición suficiente para un razonamiento continuo fuerte y eficiente en el espacio latente", se afirma en el resumen del estudio de MUX en arXiv.
Qué significa esto
El razonamiento latente es un intento de eliminar el "impuesto del lenguaje" de los modelos de razonamiento: calcular en un espacio continuo compacto en lugar de largas cadenas textuales. Si los resultados de MUX se reproducen en modelos más grandes, esto abre un camino hacia un razonamiento más barato y rápido sin perder precisión ni interpretabilidad — es decir, hacia una IA razonadora que gasta menos cómputo en las mismas tareas.
Preguntas frecuentes
¿Qué son los tokens multiplexados?
Son tokens latentes continuos, cada uno de los cuales codifica una suma ponderada de varias subpalabras de la cadena de razonamiento a la vez. Por construcción, la superposición es reversible: el rango original de subpalabras se puede recuperar por completo, por lo que no se pierde información.
¿En qué se diferencia MUX de una cadena de razonamiento habitual?
Una chain-of-thought habitual transmite una subpalabra por paso y razona en texto. MUX comprime todo un fragmento de razonamiento en un solo token latente y calcula en un espacio continuo — esto aumenta la capacidad y, según los autores, supera a las bases de referencia latentes en 32 configuraciones de prueba en cuatro modelos.
¿Quieres dejar de leer sobre IA y empezar a usarla?
AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.