arXiv cs.AI→ original

LISA: sparse attention ускоряет длинные рассуждения LLM на 50% без переобучения

Исследователи показали LISA — модуль замены механизма внимания для языковых моделей. Он объединяет линейное внимание и «молниеносный индексатор», который отбирает только важные токены и снижает сложность вычислений с O(n²) до O(nM). На моделях DeepSeek-distilled-Qwen метод дал 50% ускорения вывода при контексте 16K токенов и +5,6% к качеству рассуждений — без обучения с нуля.

Processado por IA de arXiv cs.AI; editado por Hamidun News
LISA: sparse attention ускоряет длинные рассуждения LLM на 50% без переобучения
Fonte: arXiv cs.AI. Colagem: Hamidun News.
◐ Ouvir artigo

Pesquisadores apresentaram o LISA (Linear-Indexed Sparse Attention) — um módulo substituto do mecanismo de atenção que, em julho de 2026, apresentou uma aceleração de 50% na inferência com um contexto de 16 mil tokens e um aumento de 5,6% na qualidade do raciocínio, sem exigir o treinamento do modelo do zero. O trabalho foi publicado no arXiv (2607.19358).

Como o LISA funciona

O LISA é incorporado a um modelo existente como uma substituição plug-and-play do self-attention padrão e combina dois ramos paralelos. O primeiro é o Linear Attention, com complexidade O(n), responsável pela "memória de longo prazo" e pelas dependências distantes. O segundo é o mecanismo Lightning Indexer, que seleciona os top-M tokens mais importantes de todo o contexto e os passa para o Sparse Self-Attention. Os ramos são combinados por meio de um mecanismo de gating.

  • Nome: LISA (Linear-Indexed Sparse Attention), preprint arXiv 2607.19358
  • A complexidade da inferência cai de O(n²) para O(nM), onde M é muito menor que n
  • Dois componentes: Linear Attention (memória O(n)) + Lightning Indexer + Sparse Self-Attention
  • Não exige pré-treinamento do zero — o módulo é incorporado a um modelo já pronto
  • Os testes foram feitos em modelos DeepSeek-distilled-Qwen

Por que isso importa para a inferência

O self-attention padrão tem complexidade quadrática O(n²), o que faz o custo da inferência crescer bruscamente em sequências longas. Isso se tornou um gargalo para modelos com cadeias longas de raciocínio (long chain-of-thought), como o DeepSeek-R1: o paradigma de test-time scaling os obriga a gerar um contexto de raciocínio cada vez mais longo, e junto com ele crescem os custos. Segundo os autores, é justamente isso que limita a implantação de modelos long-CoT em produção.

O LISA ataca o problema de forma arquitetural, e não por meio de hardware mais potente. Ao substituir parte da atenção completa por atenção esparsa e linear, o método transfere a geração de n tokens do regime O(n²) para o regime O(nM) — sendo que M (o número de tokens selecionados) é sensivelmente menor que o comprimento do contexto n.

O que os testes mostraram

Nos modelos da família DeepSeek-distilled-Qwen, o LISA proporcionou uma aceleração de 50% na inferência com um contexto de 16K tokens e, ao mesmo tempo, elevou o resultado médio nos benchmarks de raciocínio em 5,6% — incluindo AIME e MATH-500. Ou seja, o método não apenas acelera, como também não perde qualidade.

O treinamento é feito em duas etapas. Na primeira, a atenção linear para dependências distantes é integrada ao modelo, complementada por um mecanismo de janela deslizante (sliding-window); ela é otimizada por destilação de conhecimento para se aproximar da distribuição do self-attention completo de um modelo professor "congelado". Na segunda etapa, a janela deslizante estática é substituída pelo Indexer, treinado por meio de uma nova função de perda — uma divergência KL por cabeça (per-head), que alinha sua seleção de tokens aos padrões de atenção do professor.

"O LISA proporciona uma aceleração de 50% na inferência com um

contexto de 16K tokens, ao mesmo tempo em que melhora o resultado médio em 5,6% nos benchmarks de raciocínio, incluindo AIME e MATH-500", afirma o resumo do estudo no arXiv.

O que isso significa

O raciocínio longo é caro justamente por causa da atenção quadrática, e o LISA mostra um caminho para baratear esse custo sem retreinar o modelo do zero — basta incorporar o módulo a uma rede já pronta. Para equipes que implantam modelos de raciocínio em produção, essa é uma forma direta de reduzir os custos de inferência sem sacrificar a precisão.

Perguntas frequentes

O que é o LISA?

O LISA (Linear-Indexed Sparse Attention) é um módulo substituto do mecanismo de atenção para modelos de linguagem. Ele combina atenção linear e atenção esparsa com seleção de tokens importantes, reduzindo a complexidade da inferência de O(n²) para O(nM).

É preciso retreinar o modelo para usar o LISA?

Não, não é necessário treinamento do zero. O LISA é uma substituição plug-and-play do self-attention; ele é incorporado a um modelo já pronto e ajustado em duas etapas por meio de destilação de conhecimento a partir de um modelo professor.

Quanto o LISA acelera a inferência?

Segundo o resumo, nos modelos DeepSeek-distilled-Qwen o método proporciona uma aceleração de 50% na inferência com um contexto de 16K tokens, além de elevar a qualidade média do raciocínio em 5,6% nos benchmarks AIME e MATH-500.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Quer parar de ler sobre IA e começar a usar?

AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.

O que você acha?
Carregando comentários…