MarkTechPost→ original

Parallax: atenção linear local aprimorada com correção de covariância

Parallax é uma nova arquitetura de mecanismo de atenção que substitui o resolvedor Local Linear Attention (LLA) por um projetor treinado, dobrando a intensidade aritmética. Nas escalas de 0,6B e 1,7B de parâmetros, o modelo mostra melhor perplexidade e velocidade de decodificação em comparação com a versão anterior e até modelos baseados em transformadores do mesmo tamanho.

Processado por IA de MarkTechPost; editado por Hamidun News
Parallax: atenção linear local aprimorada com correção de covariância
Fonte: MarkTechPost. Colagem: Hamidun News.
◐ Ouvir artigo

Os pesquisadores apresentaram Parallax — uma variante parametrizada de Local Linear Attention (LLA), que retém o mecanismo softmax familiar e adiciona um ramo de correção de covariância aprendível. Em 31 de maio de 2026, a publicação MarkTechPost relatou isso: de acordo com a publicação, o novo método substitui o solucionador por consulta usado em LLA com um projetor aprendível, que duplica a intensidade aritmética dos cálculos e melhora a perplexidade dos modelos em escalas de 0.6 e 1.7 bilhões de parâmetros.

Qual é a limitação da atenção linear

O mecanismo de atenção clássico (auto-atenção) em transformadores é uma das principais fontes de custos computacionais no treinamento e inferência de modelos de linguagem: sua complexidade cresce quadraticamente com o comprimento da sequência de entrada. A atenção linear foi proposta como uma maneira de superar essa limitação, aproximando os cálculos da complexidade linear, mas geralmente com o custo de alguma perda de qualidade em comparação com a atenção softmax completa. Local Linear Attention (LLA) é uma das abordagens nesta direção, que para cada consulta resolve uma tarefa de aproximação local, mas isso cria seus próprios gargalos de eficiência computacional.

Fatos-chave sobre Parallax:

  • O método é construído na base de atenção linear local (LLA).
  • O solucionador por consulta é substituído por um projetor aprendível.
  • O mecanismo de atenção softmax é retido, um ramo de correção de covariância é adicionado.
  • A intensidade aritmética dos cálculos duplica em comparação com a abordagem de linha de base.
  • A melhoria de perplexidade é registrada em modelos com 0.6 e 1.7 bilhões de parâmetros.

O que o projetor aprendível muda

A diferença arquitetônica-chave de Parallax é a substituição do solucionador, que na variante LLA original era recalculado separadamente para cada consulta, com um único projetor aprendível. Essa substituição reduz a carga computacional específica de cada consulta individual e transfere parte da "inteligência" do mecanismo de atenção para parâmetros que são aprendidos antecipadamente junto com o resto do modelo. O ramo de correção de covariância adicionado, a julgar pelo nome do método, é projetado para compensar imprecisões na aproximação linear, aproximando a qualidade do mecanismo da atenção softmax completa enquanto mantém a vantagem de velocidade característica dos métodos de atenção linear.

O que os experimentos mostraram

Os autores observam dois resultados práticos. Primeiro, a duplicação da intensidade aritmética — uma métrica que mostra como o hardware de computação é utilizado eficientemente para cada byte de dados transmitido: quanto maior a intensidade aritmética, menos os cálculos são limitados pela largura de banda da memória em vez do desempenho dos próprios núcleos de computação. Segundo, o método mostrou melhoria de perplexidade — a métrica de qualidade padrão para modelos de linguagem refletindo o quão bem o modelo prevê o próximo token — em modelos de escala relativamente pequena: 0.

6 e 1.7 bilhões de parâmetros. Para a comunidade de pesquisa que trabalha em arquiteturas de transformadores eficientes, tais resultados são interessantes principalmente como prova de que os mecanismos de atenção linear podem ser aproximados à qualidade da atenção completa sem sacrificar os ganhos em eficiência computacional.

Por que esta direção de pesquisa é importante

A busca por alternativas à atenção quadrática clássica é uma das áreas mais ativas de pesquisa atual em modelos de linguagem: nos últimos anos, além da atenção linear, outras abordagens arquitetônicas para reduzir custos computacionais para processar sequências longas foram propostas — arquiteturas recorrentes e de espaço de estado, várias variantes de atenção esparsa e esquemas híbridos combinando múltiplos mecanismos em um único modelo. A motivação comum para todas estas direções é a mesma: o comprimento do contexto que os modelos precisam processar — de consultas curtas a livros inteiros, repositórios de código e diálogos de várias horas — está crescendo mais rápido do que a computação fica mais barata, o que significa que a eficiência de cada mecanismo de atenção determina diretamente quanto tempo de contexto pode ser permitido processar com um orçamento de infraestrutura dado. Contra esse pano de fundo, o teste de Parallax está até agora limitado a modelos comparativamente pequenos — 0.

6 e 1.7 bilhões de parâmetros — e se as vantagens reivindicadas serão preservadas ao escalar para o tamanho de LLMs industriais modernos permanece uma questão para pesquisas futuras.

O valor prático de tais melhorias arquitetônicas raramente se manifesta instantaneamente: o caminho de uma publicação de pesquisa para aplicar o método em modelos de escala industrial geralmente leva meses ou anos e requer verificação independente em arquiteturas maiores e conjuntos de dados diversos. No entanto, a mera ideia de reter o mecanismo softmax, em vez de abandoná-lo completamente pela complexidade linear, distingue Parallax de alternativas de atenção mais radicais — é mais uma refinamento evolutivo de uma abordagem existente do que uma tentativa de inventar uma arquitetura fundamentalmente nova do zero.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…