MUX: метод непрерывного рассуждения LLM через мультиплексированные токены
MUX — новый метод из препринта arXiv, который позволяет языковым моделям рассуждать в непрерывном латентном пространстве. Один токен без потерь кодирует сразу целый фрагмент цепочки рассуждений вместо одного слова, ускоряя вычисления. По данным авторов, MUX обошёл сильные латентные бейзлайны в 32 настройках оценки на четырёх моделях.
Processado por IA de arXiv cs.AI; editado por Hamidun News
Em julho de 2026, pesquisadores publicaram na arXiv o método MUX (multiplexed tokens) — uma forma de conduzir o raciocínio de modelos de linguagem em um espaço latente contínuo, no qual um único token latente codifica sem perdas todo um trecho da cadeia de raciocínio, em vez de apenas uma palavra. Segundo os autores, o MUX superou baselines fortes de raciocínio latente em 32 configurações de avaliação em quatro modelos de linguagem ao mesmo tempo.
Por que o raciocínio comum é lento
Os modelos de raciocínio clássicos desperdiçam computação: cada etapa da cadeia de raciocínio transmite apenas uma subpalavra, e parte de cada etapa é gasta verbalizando o pensamento, em vez do cálculo em si. Os autores do MUX chamam isso de um "gargalo" computacional: o modelo raciocina em linguagem natural, então a capacidade de uma única etapa é limitada pelo tamanho de um token subword — e em cadeias longas isso se traduz em computação desperdiçada.
O que são tokens multiplexados
O MUX destila uma cadeia de raciocínio discreta em tokens latentes contínuos. Cada um desses tokens é treinado para representar uma superposição linear ponderada (multiplexação) de todo um intervalo de subpalavras, e essa superposição é reversível: o intervalo original de subpalavras pode ser totalmente recuperado (demultiplexação). A ideia-chave é tornar a compressão reversível por construção, e não aproximada: assim, o modelo não "corta caminho" e preserva toda a lógica de raciocínio original.
*Método — MUX, preprint arXiv 2607.18264, tipo de publicação "new" (julho de 2026)
*Mecanismo — um token latente equivale a uma soma ponderada de várias subpalavras discretas de raciocínio
*Reversibilidade — superposição sem perdas, o intervalo de subpalavras é recuperado por completo
*Ponderação — dependente da posição, por exemplo, decaimento geométrico dos pesos
*Bônus — exploração paralela de várias ramificações de solução em tarefas que exigem busca
Os autores demonstram que pesos simples dependentes da posição — por exemplo, um decaimento geométrico adequado — garantem multiplexação sem perdas. Isso, por sua vez, evita o "colapso latente": um comportamento degenerado de atalho (shortcut) no qual o modelo colapsa a representação latente e deixa de raciocinar de fato.
Quanto o MUX é melhor que os concorrentes
O MUX superou baselines fortes de raciocínio latente em 32 configurações experimentais, abrangendo quatro modelos de linguagem diferentes, segundo o resumo dos autores na arXiv. Trata-se de uma superioridade não sobre um único modelo, mas sobre toda uma classe de métodos de raciocínio latente — em toda a grade de 32 configurações. Além disso, análises de ablação e de sondagem (probing) mostraram que os tokens latentes aprendidos codificam um raciocínio correto e interpretável, e não ruído aleatório.
Um resultado à parte é a capacidade de busca paralela: o raciocínio multiplexado pode explorar simultaneamente várias ramificações de solução em tarefas que exigem testar variantes.
"A superposição sem perdas como objetivo local de treinamento é uma
condição suficiente para um raciocínio contínuo forte e eficiente no espaço latente", afirma o resumo do estudo do MUX na arXiv.
O que isso significa
O raciocínio latente é uma tentativa de remover o "imposto da linguagem" dos modelos de raciocínio: calcular em um espaço contínuo compacto em vez de longas cadeias textuais. Se os resultados do MUX se reproduzirem em modelos maiores, isso aponta para um raciocínio mais barato e rápido sem perda de precisão nem de interpretabilidade — ou seja, para uma IA raciocinadora que gasta menos computação nas mesmas tarefas.
Perguntas frequentes
O que são tokens multiplexados?
São tokens latentes contínuos, cada um dos quais codifica uma soma ponderada de várias subpalavras da cadeia de raciocínio ao mesmo tempo. Por construção, a superposição é reversível — o intervalo original de subpalavras pode ser totalmente recuperado, por isso nenhuma informação é perdida.
Em que o MUX difere de uma cadeia de raciocínio comum?
Uma chain-of-thought comum transmite uma subpalavra por etapa e raciocina em texto. O MUX comprime todo um trecho de raciocínio em um único token latente e calcula em um espaço contínuo — isso aumenta a capacidade e, segundo os autores, supera os baselines latentes em 32 configurações de teste em quatro modelos.
Quer parar de ler sobre IA e começar a usar?
AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.