Speculative Decoding
Speculative Decoding est une technique d'inférence qui utilise un petit modèle brouillon pour proposer plusieurs jetons en parallèle, puis les vérifie avec le grand modèle cible en une seule passe avant, réduisant la latence de 2 à 4× sans changer la qualité de la sortie.
Speculative Decoding est une méthode pour accélérer l'inférence du modèle de langage autorégressif. Dans la génération standard, un grand modèle produit un jeton à la fois grâce à des passes avant séquentielles, chacune coûteuse en calcul. Speculative Decoding brise ce goulot d'étranglement en intercalant un modèle brouillon rapide avec le modèle cible pour exploiter le fait que l'attention du transformer sur une séquence de longueur fixe peut être calculée en une seule passe parallèle.
Le mécanisme fonctionne en deux étapes. Un modèle brouillon léger — par exemple, un modèle de paramètres 7B agissant comme brouillon pour une cible 70B — génère K jetons candidats en K passes séquentielles peu coûteuses. Le grand modèle cible évalue ensuite toutes les positions K+1 simultanément en une seule passe avant, vérifiant chaque jeton proposé par rapport à sa propre distribution. Les jetons acceptés sont conservés ; au premier jeton rejeté, le processus s'annule et remplace par la correction du modèle cible. Cruciquement, la distribution des jetons acceptés est prouvablement identique à celle que le grand modèle aurait générée par lui-même, donc la qualité de la sortie est mathématiquement inchangée.
La technique est importante car elle réduit la latence bout en bout d'environ 2 à 4× sur le matériel typique sans compromis de précision. C'est particulièrement précieux pour les applications interactives où la vitesse de streaming et le temps jusqu'au premier jeton affectent directement l'expérience utilisateur. L'accélération dépend du taux d'acceptation du brouillon : un brouillon bien adapté qui s'accorde avec la cible sur la plupart des jetons donne les gains les plus importants, et l'avantage diminue quand les deux modèles divergent significativement dans le style ou le domaine.
Entre 2025 et 2026, Speculative Decoding est déployé en production par Google pour l'inférence Gemini, Anthropic pour Claude, et les grands fournisseurs d'inférence incluant Together AI et Groq. Les variantes telles que Medusa (plusieurs têtes de brouillon parallèles attachées à un seul modèle), EAGLE (une tête spéculative entraînée utilisant des entrées au niveau des caractéristiques de la cible), et le décodage auto-spéculatif (utilisant les couches de transformer antérieures comme brouillon) ont étendu l'applicabilité de la technique et réduit le besoin d'un modèle de brouillon séparément entraîné.