arXiv cs.AI→ оригинал

LISA: sparse attention ускоряет длинные рассуждения LLM на 50% без переобучения

Исследователи показали LISA — модуль замены механизма внимания для языковых моделей. Он объединяет линейное внимание и «молниеносный индексатор», который отбирает только важные токены и снижает сложность вычислений с O(n²) до O(nM). На моделях DeepSeek-distilled-Qwen метод дал 50% ускорения вывода при контексте 16K токенов и +5,6% к качеству рассуждений — без обучения с нуля.

AI-обработка оригинала arXiv cs.AI; редакция Hamidun News
LISA: sparse attention ускоряет длинные рассуждения LLM на 50% без переобучения
Источник: arXiv cs.AI. Коллаж: Hamidun News.
◐ Слушать статью

Исследователи представили LISA (Linear-Indexed Sparse Attention) — модуль замены механизма внимания, который в июле 2026 года показал ускорение вывода на 50% при контексте в 16 тысяч токенов и рост качества рассуждений на 5,6%, не требуя обучения модели с нуля. Работа опубликована на arXiv (2607.19358).

Как работает LISA

LISA встраивается в существующую модель как plug-and-play замена стандартного self-attention и объединяет две параллельные ветви. Первая — Linear Attention со сложностью O(n), которая отвечает за «долгую память» и дальние зависимости. Вторая — механизм Lightning Indexer, который отбирает top-M самых важных токенов из всего контекста и передаёт их в Sparse Self-Attention. Ветви сводятся через gating-механизм.

  • Название: LISA (Linear-Indexed Sparse Attention), препринт arXiv 2607.19358
  • Сложность вывода снижается с O(n²) до O(nM), где M намного меньше n
  • Два компонента: Linear Attention (O(n) память) + Lightning Indexer + Sparse Self-Attention
  • Не требует предобучения с нуля — модуль встраивается в готовую модель
  • Тесты — на моделях DeepSeek-distilled-Qwen

Почему это важно для inference

Стандартный self-attention имеет квадратичную сложность O(n²), из-за чего стоимость вывода резко растёт на длинных последовательностях. Это стало узким местом для моделей с длинными цепочками рассуждений (long chain-of-thought) вроде DeepSeek-R1 (Дипсик-R1): парадигма test-time scaling заставляет их генерировать всё более длинный контекст рассуждений, а вместе с ним растут и издержки. По оценке авторов, именно это ограничивает вывод long-CoT-моделей в продакшене.

LISA атакует проблему архитектурно, а не за счёт более мощного железа. Заменяя часть полного внимания разреженным и линейным, метод переводит генерацию n токенов из режима O(n²) в режим O(nM) — при том что M (число отобранных токенов) заметно меньше длины контекста n.

Что показали тесты

На моделях семейства DeepSeek-distilled-Qwen LISA дала 50% ускорения вывода при контексте 16K токенов и одновременно подняла средний результат на reasoning-бенчмарках на 5,6% — включая AIME и MATH-500. То есть метод не просто ускоряет, но и не проседает по качеству.

Обучение построено в две стадии. На первой в модель интегрируется линейное внимание для дальних зависимостей, дополненное механизмом скользящего окна (sliding-window); оно оптимизируется дистилляцией знаний, чтобы приблизить распределение полного self-attention «замороженной» модели-учителя. На второй стадии статичное скользящее окно заменяет Indexer, обучаемый через новую функцию потерь — per-head KL-дивергенцию, которая выравнивает его выбор токенов с паттернами внимания учителя.

«LISA обеспечивает 50% ускорения вывода при контексте 16K токенов,

одновременно улучшая средний результат на 5,6% на бенчмарках рассуждений, включая AIME и MATH-500», — говорится в аннотации исследования на arXiv.

Что это значит

Длинные рассуждения дорого обходятся именно из-за квадратичного внимания, и LISA показывает путь удешевить их без переобучения модели с нуля — достаточно встроить модуль в готовую сеть. Для команд, которые деплоят reasoning-модели в продакшене, это прямой способ срезать издержки на inference, не жертвуя точностью.

Частые вопросы

Что такое LISA?

LISA (Linear-Indexed Sparse Attention) — модуль замены механизма внимания для языковых моделей. Он объединяет линейное внимание и разреженное внимание с отбором важных токенов, снижая сложность вывода с O(n²) до O(nM).

Нужно ли переобучать модель для LISA?

Нет, обучение с нуля не требуется. LISA — plug-and-play замена self-attention; она встраивается в готовую модель и настраивается в две стадии через дистилляцию знаний от модели-учителя.

Насколько LISA ускоряет вывод?

По данным аннотации, на моделях DeepSeek-distilled-Qwen метод даёт 50% ускорения вывода при контексте 16K токенов и при этом повышает среднее качество рассуждений на 5,6% на бенчмарках AIME и MATH-500.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…