MarkTechPost→ оригинал

Tencent открыл AngelSpec: фреймворк для ускорения инференса LLM через speculative decoding

Tencent открыл AngelSpec — torch-native фреймворк для обучения draft-моделей, ускоряющих инференс больших языковых моделей через speculative decoding. Вместо одной универсальной модели он обучает две: MTP для диалогов и block-parallel для кода и математики. На тесте средний уровень принятия черновых токенов вырос с 52,8% до 66,4%, а качество ответов не меняется — метод lossless.

AI-обработка оригинала MarkTechPost; редакция Hamidun News
Tencent открыл AngelSpec: фреймворк для ускорения инференса LLM через speculative decoding
Источник: MarkTechPost. Коллаж: Hamidun News.
◐ Слушать статью

Компания Tencent 30 июля 2026 года открыла исходный код AngelSpec — torch-native фреймворка для обучения черновых (draft) моделей speculative decoding, который на моделях Hy3 поднял средний уровень принятия предложенных токенов с 52,8% до 66,4% без потери качества генерации.

Что такое speculative decoding

Speculative decoding — это способ ускорить генерацию большой языковой модели без потери качества ответа. Лёгкая черновая модель предлагает сразу несколько будущих токенов, а основная (target) модель проверяет их все за один проход через rejection sampling. Метод lossless: итоговый текст совпадает с тем, что выдала бы основная модель сама. Ускорение зависит от двух вещей — сколько черновых токенов принято и как долго длится полный цикл «черновик — проверка».

  • Дата релиза — 30 июля 2026 года, лицензия open source
  • Фреймворк torch-native, работает на моделях семейства Hy3
  • Покрывает два подхода: autoregressive MTP и block-parallel семейство DFlash (DFly, D-cut)
  • Средний уровень принятия токенов: 52,8% → 66,4% при T=0
  • Средняя длина принятого черновика: 2,58 → 2,99 токена

Почему одна универсальная модель проигрывает

Одна универсальная черновая модель проигрывает потому, что реальный трафик неоднороден, а две метрики скорости тянут в разные стороны. В открытом диалоге с высокой энтропией допустимы десятки продолжений, поэтому принятие быстро падает с глубиной предложения — длинный блок генерировать невыгодно. Код и математика ведут себя иначе: синтаксис, повторяющиеся идентификаторы и пошаговые выкладки сильнее ограничивают будущие токены и создают длинные предсказуемые участки. Поэтому AngelSpec поставляет две draft-модели вместо одного компромисса: MTP обучают на разнообразных диалоговых данных, а block-diffusion усиливают примерами кода и математики.

«AngelSpec рассматривает неоднородность нагрузки как проектное ограничение первого класса», — говорится в разборе

MarkTechPost.

Как устроен MTP-путь

MTP-путь решает рассогласование обучения и инференса через схему с общими параметрами и несколькими глубинами. Исходная модель Hy3 обучалась с одним MTP-слоем без рекуррентной раскрутки, поэтому на второй и третьей позиции черновика токены принимались заметно хуже. AngelSpec сохраняет D логических глубин, но переиспользует один физический MTP-блок, разворачивая его на D шагов при обучении. По принципу Training-Time Test из EAGLE-3 глубина k+1 получает не эталонный токен, а argmax-предсказание с глубины k. Дополнительно основной backbone и языковая голова заморожены, а обучение идёт на прогонах самой target-модели.

Эффект концентрируется там, где нужно. По данным Tencent, на бенчмарке GSM8K принятие третьей позиции выросло с 0,290 до 0,706, на HumanEval — с 0,387 до 0,757, при этом первая позиция почти не изменилась (0,799 → 0,814).

Что это значит

AngelSpec показывает, что ускорение инференса выгоднее строить не под усреднённый бенчмарк, а под реальную неоднородность нагрузки — разными черновыми моделями под диалог и под код. Для команд, которые обслуживают LLM в проде, это открытый инструмент, чтобы выжать больше скорости из того же железа без просадки качества.

Частые вопросы

Что такое speculative decoding простыми словами?

Это метод ускорения LLM, где маленькая модель угадывает несколько следующих токенов вперёд, а большая проверяет их за один проход. Если угадано верно — генерация идёт быстрее; качество текста при этом не меняется.

Чем AngelSpec отличается от одной draft-модели?

AngelSpec обучает две специализированные модели: MTP под диалоги с высокой энтропией и block-parallel под код и математику с длинными предсказуемыми участками. По замерам Tencent это подняло средний уровень принятия токенов с 52,8% до 66,4%.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…