arXiv cs.CL→ оригинал

DeLS-Spec ускорил LLM inference без переобучения моделей

Новый метод DeLS-Spec ускоряет работу больших языковых моделей при генерации текста. Его особенность: лёгкий адаптер, который обучается отдельно от самой модели, без переучивания. Тесты на моделях Qwen3 показали улучшение скорости выполнения задач по математике, коду и диалогам.

AI-обработка оригинала arXiv cs.CL; редакция Hamidun News
DeLS-Spec ускорил LLM inference без переобучения моделей
Источник: arXiv cs.CL. Коллаж: Hamidun News.
◐ Слушать статью

Исследователи предложили метод DeLS-Spec — новый подход к ускорению процесса генерации текста языковыми моделями. Метод впервые позволяет добиться значительного ускорения без необходимости переучивать сами модели, что существенно снижает барьеры к применению таких оптимизаций.

Как работает speculative decoding

Speculative decoding — это техника, которая ускоряет LLM inference, генерируя сразу несколько токенов параллельно вместо одного за раз. Небольшая модель-дрэфтер предсказывает токены-кандидаты, а основная модель проверяет их корректность за один проход. Если предсказание совпало — токены принимаются, если нет — процесс повторяется.

Более продвинутые методы, такие как DFlash, генерируют целый блок токенов за один проход, ещё больше ускоряя процесс. Но это создаёт проблему: токены внутри блока обычно предсказываются независимо, без учёта причинной зависимости друг от друга.

Проблема существующих методов

Другие недавние методы, такие как Domino и DSpark, пытались добавить причинность в block-parallel drafting — учесть зависимости между токенами в блоке. Но для этого требовалось тренировать дрэфтер полностью с нуля, что дорого и требует огромных вычислительных ресурсов. Организации без петабайтов данных и масштабных GPU-кластеров не могут позволить такой переучинг.

Что нового в DeLS-Spec

DeLS-Spec решает эту проблему через разделение ролей между двумя экспертами. Метод использует существующую модель DFlash как «эксперт на длинном контексте» и добавляет лёгкую локальную головку как «эксперт на коротком контексте».

Ключевое преимущество: локальную головку можно обучать полностью независимо, без совместного обучения с основной моделью или DFlash-бэкбоном. Это резко снижает вычислительные затраты. Локальная головка — это маленькая сеть, которая смотрит только на недавние контексты и учится предсказывать токены с учётом причинной зависимости.

  • Метод применён к моделям Qwen3
  • Обучение требует минимальных затрат — тренируется только лёгкий адаптер
  • На инференсе комбинируются logits из двух экспертов
  • Локальная головка независима от конкретной версии DFlash-чекпоинта
  • Улучшение как скорости, так и длины принятых токенов на бенчмарках

Результаты тестирования

На бенчмарках Qwen3 DeLS-Spec показал улучшение как скорости выполнения (speedup), так и средней длины принятых токенов (average acceptance length) по сравнению с DFlash. Это верно для трёх категорий задач: математика, программирование и диалоговые системы.

Почему это важно: более длинные последовательности принятых токенов означают, что дрэфтер предсказывает точнее и система может генерировать больше текста за одну итерацию, что напрямую влияет на пропускную способность.

Почему это важно для индустрии

Ускорение LLM inference — это не только вопрос скорости, но и экономики. Дешевле тренировать небольшой адаптер, чем переучивать весь дрэфтер или основную модель. Это делает методы оптимизации доступнее для организаций, которые не имеют ресурсов на масштабное переобучение.

По мере того как LLM становятся всё более сложными и энергоёмкими, такие инкрементальные улучшения в inference efficiency накапливаются и превращаются в значимые выигрыши в скорости и стоимости. DeLS-Spec демонстрирует важный тренд: лучшие результаты часто достигаются не через переучивание больших моделей, а через элегантное комбинирование существующих компонентов.

Что это значит

Этот подход открывает пути для более доступной оптимизации LLM в организациях всех размеров, позволяя даже небольшим командам добиваться ускорения без огромных вычислительных бюджетов.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…