Parallax: atenção linear local aprimorada com correção de covariância
Parallax é uma nova arquitetura de mecanismo de atenção que substitui o resolvedor Local Linear Attention (LLA) por um projetor treinado, dobrando a intensidade aritmética. Nas escalas de 0,6B e 1,7B de parâmetros, o modelo mostra melhor perplexidade e velocidade de decodificação em comparação com a versão anterior e até modelos baseados em transformadores do mesmo tamanho.
Processado por IA de MarkTechPost; editado por Hamidun News
Os pesquisadores apresentaram Parallax — uma variante parametrizada de Local Linear Attention (LLA), que retém o mecanismo softmax familiar e adiciona um ramo de correção de covariância aprendível. Em 31 de maio de 2026, a publicação MarkTechPost relatou isso: de acordo com a publicação, o novo método substitui o solucionador por consulta usado em LLA com um projetor aprendível, que duplica a intensidade aritmética dos cálculos e melhora a perplexidade dos modelos em escalas de 0.6 e 1.7 bilhões de parâmetros.
Qual é a limitação da atenção linear
O mecanismo de atenção clássico (auto-atenção) em transformadores é uma das principais fontes de custos computacionais no treinamento e inferência de modelos de linguagem: sua complexidade cresce quadraticamente com o comprimento da sequência de entrada. A atenção linear foi proposta como uma maneira de superar essa limitação, aproximando os cálculos da complexidade linear, mas geralmente com o custo de alguma perda de qualidade em comparação com a atenção softmax completa. Local Linear Attention (LLA) é uma das abordagens nesta direção, que para cada consulta resolve uma tarefa de aproximação local, mas isso cria seus próprios gargalos de eficiência computacional.
Fatos-chave sobre Parallax:
- O método é construído na base de atenção linear local (LLA).
- O solucionador por consulta é substituído por um projetor aprendível.
- O mecanismo de atenção softmax é retido, um ramo de correção de covariância é adicionado.
- A intensidade aritmética dos cálculos duplica em comparação com a abordagem de linha de base.
- A melhoria de perplexidade é registrada em modelos com 0.6 e 1.7 bilhões de parâmetros.
O que o projetor aprendível muda
A diferença arquitetônica-chave de Parallax é a substituição do solucionador, que na variante LLA original era recalculado separadamente para cada consulta, com um único projetor aprendível. Essa substituição reduz a carga computacional específica de cada consulta individual e transfere parte da "inteligência" do mecanismo de atenção para parâmetros que são aprendidos antecipadamente junto com o resto do modelo. O ramo de correção de covariância adicionado, a julgar pelo nome do método, é projetado para compensar imprecisões na aproximação linear, aproximando a qualidade do mecanismo da atenção softmax completa enquanto mantém a vantagem de velocidade característica dos métodos de atenção linear.
O que os experimentos mostraram
Os autores observam dois resultados práticos. Primeiro, a duplicação da intensidade aritmética — uma métrica que mostra como o hardware de computação é utilizado eficientemente para cada byte de dados transmitido: quanto maior a intensidade aritmética, menos os cálculos são limitados pela largura de banda da memória em vez do desempenho dos próprios núcleos de computação. Segundo, o método mostrou melhoria de perplexidade — a métrica de qualidade padrão para modelos de linguagem refletindo o quão bem o modelo prevê o próximo token — em modelos de escala relativamente pequena: 0.
6 e 1.7 bilhões de parâmetros. Para a comunidade de pesquisa que trabalha em arquiteturas de transformadores eficientes, tais resultados são interessantes principalmente como prova de que os mecanismos de atenção linear podem ser aproximados à qualidade da atenção completa sem sacrificar os ganhos em eficiência computacional.
Por que esta direção de pesquisa é importante
A busca por alternativas à atenção quadrática clássica é uma das áreas mais ativas de pesquisa atual em modelos de linguagem: nos últimos anos, além da atenção linear, outras abordagens arquitetônicas para reduzir custos computacionais para processar sequências longas foram propostas — arquiteturas recorrentes e de espaço de estado, várias variantes de atenção esparsa e esquemas híbridos combinando múltiplos mecanismos em um único modelo. A motivação comum para todas estas direções é a mesma: o comprimento do contexto que os modelos precisam processar — de consultas curtas a livros inteiros, repositórios de código e diálogos de várias horas — está crescendo mais rápido do que a computação fica mais barata, o que significa que a eficiência de cada mecanismo de atenção determina diretamente quanto tempo de contexto pode ser permitido processar com um orçamento de infraestrutura dado. Contra esse pano de fundo, o teste de Parallax está até agora limitado a modelos comparativamente pequenos — 0.
6 e 1.7 bilhões de parâmetros — e se as vantagens reivindicadas serão preservadas ao escalar para o tamanho de LLMs industriais modernos permanece uma questão para pesquisas futuras.
O valor prático de tais melhorias arquitetônicas raramente se manifesta instantaneamente: o caminho de uma publicação de pesquisa para aplicar o método em modelos de escala industrial geralmente leva meses ou anos e requer verificação independente em arquiteturas maiores e conjuntos de dados diversos. No entanto, a mera ideia de reter o mecanismo softmax, em vez de abandoná-lo completamente pela complexidade linear, distingue Parallax de alternativas de atenção mais radicais — é mais uma refinamento evolutivo de uma abordagem existente do que uma tentativa de inventar uma arquitetura fundamentalmente nova do zero.
Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?
Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.