Tencent открыл AngelSpec: фреймворк для ускорения инференса LLM через speculative decoding
Tencent открыл AngelSpec — torch-native фреймворк для обучения draft-моделей, ускоряющих инференс больших языковых моделей через speculative decoding. Вместо одной универсальной модели он обучает две: MTP для диалогов и block-parallel для кода и математики. На тесте средний уровень принятия черновых токенов вырос с 52,8% до 66,4%, а качество ответов не меняется — метод lossless.
Traité par IA depuis MarkTechPost ; édité par Hamidun News
Tencent a ouvert le code source d'AngelSpec le 30 juillet 2026 — un framework torch-native pour l'entraînement de modèles brouillon (draft) de speculative decoding qui, sur les modèles Hy3, a fait passer le taux moyen d'acceptation des tokens proposés de 52,8% à 66,4% sans perte de qualité de génération.
Qu'est-ce que le speculative decoding
Le speculative decoding est une méthode pour accélérer la génération d'un grand modèle de langage sans perte de qualité de réponse. Un modèle brouillon léger propose plusieurs tokens futurs à la fois, et le modèle principal (target) les vérifie tous en une seule passe via rejection sampling. La méthode est lossless : le texte final correspond à ce que le modèle principal aurait produit seul. L'accélération dépend de deux facteurs — combien de tokens brouillon sont acceptés et combien de temps dure le cycle complet « brouillon — vérification ».
- Date de sortie — 30 juillet 2026, licence open source
- Framework torch-native, fonctionne sur les modèles de la famille Hy3
- Couvre deux approches : le MTP autorégressif et la famille block-parallel DFlash (DFly, D-cut)
- Taux moyen d'acceptation des tokens : 52,8% → 66,4% à T=0
- Longueur moyenne du brouillon accepté : 2,58 → 2,99 tokens
Pourquoi un modèle universel unique perd
Un modèle brouillon universel unique perd parce que le trafic réel est hétérogène, et deux métriques de vitesse tirent dans des directions opposées. Dans un dialogue ouvert à forte entropie, des dizaines de continuations sont valables, donc l'acceptation chute rapidement avec la profondeur de la proposition — générer un long bloc n'est pas rentable. Le code et les mathématiques se comportent différemment : la syntaxe, les identifiants répétés et les développements pas à pas contraignent bien davantage les tokens futurs et créent de longs segments prévisibles.
C'est pourquoi AngelSpec fournit deux modèles brouillon plutôt qu'un seul compromis : le MTP est entraîné sur des données de dialogue diversifiées, tandis que le block-diffusion est renforcé avec des exemples de code et de mathématiques.
«
AngelSpec traite l'hétérogénéité de la charge de travail comme une contrainte de conception de premier ordre », indique l'analyse de MarkTechPost.
Comment fonctionne la voie MTP
La voie MTP résout le désalignement entre entraînement et inférence grâce à un schéma à paramètres partagés et à profondeurs multiples. Le modèle original Hy3 a été entraîné avec une seule couche MTP sans déroulement récurrent, si bien qu'aux deuxième et troisième positions du brouillon, les tokens étaient acceptés nettement moins bien. AngelSpec conserve D profondeurs logiques, mais réutilise un seul bloc MTP physique, en le déroulant sur D étapes pendant l'entraînement. Selon le principe Training-Time Test issu d'EAGLE-3, la profondeur k+1 ne reçoit pas le token de référence, mais la prédiction argmax de la profondeur k. De plus, le backbone principal et la tête de langage sont gelés, et l'entraînement s'appuie sur les déroulements du modèle target lui-même.
L'effet se concentre exactement là où c'est nécessaire. Selon les données de Tencent, sur le benchmark GSM8K, l'acceptation en troisième position est passée de 0,290 à 0,706, et sur HumanEval — de 0,387 à 0,757, tandis que la première position a très peu changé (0,799 → 0,814).
Ce que cela signifie
AngelSpec montre qu'il est plus avantageux de construire l'accélération de l'inférence non pas autour d'un benchmark moyenné, mais autour de l'hétérogénéité réelle de la charge — avec des modèles brouillon différents pour le dialogue et pour le code. Pour les équipes qui exploitent des LLM en production, c'est un outil ouvert permettant de tirer plus de vitesse du même matériel sans perte de qualité.
Questions fréquentes
Qu'est-ce que le speculative decoding en termes simples ?
C'est une méthode pour accélérer les LLM où un petit modèle devine plusieurs tokens suivants à l'avance, et un grand modèle les vérifie en une seule passe. Si la supposition est correcte, la génération va plus vite ; la qualité du texte ne change pas.
En quoi
AngelSpec diffère-t-il d'un modèle brouillon unique ?
AngelSpec entraîne deux modèles spécialisés : le MTP pour les dialogues à forte entropie et le block-parallel pour le code et les mathématiques avec de longs segments prévisibles. Selon les mesures de Tencent, cela a fait passer le taux moyen d'acceptation des tokens de 52,8% à 66,4%.
Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?
AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.
L'essentiel de l'IA — une fois par semaine
Sept actus qui ont vraiment compté, choisies à la main. Sans bruit ni communiqués.
C'est fait ! Vérifiez votre boîte mail pour la confirmation.