LISA: sparse attention ускоряет длинные рассуждения LLM на 50% без переобучения
Исследователи показали LISA — модуль замены механизма внимания для языковых моделей. Он объединяет линейное внимание и «молниеносный индексатор», который отбирает только важные токены и снижает сложность вычислений с O(n²) до O(nM). На моделях DeepSeek-distilled-Qwen метод дал 50% ускорения вывода при контексте 16K токенов и +5,6% к качеству рассуждений — без обучения с нуля.
Processado por IA de arXiv cs.AI; editado por Hamidun News
Pesquisadores apresentaram o LISA (Linear-Indexed Sparse Attention) — um módulo substituto do mecanismo de atenção que, em julho de 2026, apresentou uma aceleração de 50% na inferência com um contexto de 16 mil tokens e um aumento de 5,6% na qualidade do raciocínio, sem exigir o treinamento do modelo do zero. O trabalho foi publicado no arXiv (2607.19358).
Como o LISA funciona
O LISA é incorporado a um modelo existente como uma substituição plug-and-play do self-attention padrão e combina dois ramos paralelos. O primeiro é o Linear Attention, com complexidade O(n), responsável pela "memória de longo prazo" e pelas dependências distantes. O segundo é o mecanismo Lightning Indexer, que seleciona os top-M tokens mais importantes de todo o contexto e os passa para o Sparse Self-Attention. Os ramos são combinados por meio de um mecanismo de gating.
- Nome: LISA (Linear-Indexed Sparse Attention), preprint arXiv 2607.19358
- A complexidade da inferência cai de O(n²) para O(nM), onde M é muito menor que n
- Dois componentes: Linear Attention (memória O(n)) + Lightning Indexer + Sparse Self-Attention
- Não exige pré-treinamento do zero — o módulo é incorporado a um modelo já pronto
- Os testes foram feitos em modelos DeepSeek-distilled-Qwen
Por que isso importa para a inferência
O self-attention padrão tem complexidade quadrática O(n²), o que faz o custo da inferência crescer bruscamente em sequências longas. Isso se tornou um gargalo para modelos com cadeias longas de raciocínio (long chain-of-thought), como o DeepSeek-R1: o paradigma de test-time scaling os obriga a gerar um contexto de raciocínio cada vez mais longo, e junto com ele crescem os custos. Segundo os autores, é justamente isso que limita a implantação de modelos long-CoT em produção.
O LISA ataca o problema de forma arquitetural, e não por meio de hardware mais potente. Ao substituir parte da atenção completa por atenção esparsa e linear, o método transfere a geração de n tokens do regime O(n²) para o regime O(nM) — sendo que M (o número de tokens selecionados) é sensivelmente menor que o comprimento do contexto n.
O que os testes mostraram
Nos modelos da família DeepSeek-distilled-Qwen, o LISA proporcionou uma aceleração de 50% na inferência com um contexto de 16K tokens e, ao mesmo tempo, elevou o resultado médio nos benchmarks de raciocínio em 5,6% — incluindo AIME e MATH-500. Ou seja, o método não apenas acelera, como também não perde qualidade.
O treinamento é feito em duas etapas. Na primeira, a atenção linear para dependências distantes é integrada ao modelo, complementada por um mecanismo de janela deslizante (sliding-window); ela é otimizada por destilação de conhecimento para se aproximar da distribuição do self-attention completo de um modelo professor "congelado". Na segunda etapa, a janela deslizante estática é substituída pelo Indexer, treinado por meio de uma nova função de perda — uma divergência KL por cabeça (per-head), que alinha sua seleção de tokens aos padrões de atenção do professor.
"O LISA proporciona uma aceleração de 50% na inferência com um
contexto de 16K tokens, ao mesmo tempo em que melhora o resultado médio em 5,6% nos benchmarks de raciocínio, incluindo AIME e MATH-500", afirma o resumo do estudo no arXiv.
O que isso significa
O raciocínio longo é caro justamente por causa da atenção quadrática, e o LISA mostra um caminho para baratear esse custo sem retreinar o modelo do zero — basta incorporar o módulo a uma rede já pronta. Para equipes que implantam modelos de raciocínio em produção, essa é uma forma direta de reduzir os custos de inferência sem sacrificar a precisão.
Perguntas frequentes
O que é o LISA?
O LISA (Linear-Indexed Sparse Attention) é um módulo substituto do mecanismo de atenção para modelos de linguagem. Ele combina atenção linear e atenção esparsa com seleção de tokens importantes, reduzindo a complexidade da inferência de O(n²) para O(nM).
É preciso retreinar o modelo para usar o LISA?
Não, não é necessário treinamento do zero. O LISA é uma substituição plug-and-play do self-attention; ele é incorporado a um modelo já pronto e ajustado em duas etapas por meio de destilação de conhecimento a partir de um modelo professor.
Quanto o LISA acelera a inferência?
Segundo o resumo, nos modelos DeepSeek-distilled-Qwen o método proporciona uma aceleração de 50% na inferência com um contexto de 16K tokens, além de elevar a qualidade média do raciocínio em 5,6% nos benchmarks AIME e MATH-500.
Quer parar de ler sobre IA e começar a usar?
AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.