DeLS-Spec a accéléré l'inférence LLM sans réentraîner les modèles
La nouvelle méthode DeLS-Spec accélère la génération de texte des modèles de langage volumineux. Sa caractéristique clé : un adaptateur léger entraîné indépendamment du modèle, sans réentraînement du modèle. Les tests sur les modèles Qwen3 ont montré des améliorations de vitesse pour les tâches mathématiques, de code et de dialogue.
Traité par IA depuis arXiv cs.CL ; édité par Hamidun News
Les chercheurs ont proposé DeLS-Spec—une nouvelle méthode pour accélérer la génération de texte dans les modèles de langage. L'approche permet pour la première fois de réaliser une accélération significative sans avoir besoin de réentraîner les modèles eux-mêmes, ce qui réduit considérablement les obstacles à l'adoption de telles optimisations.
Comment Fonctionne la Décodage Spéculatif
La décodage spéculatif est une technique qui accélère l'inférence LLM en générant plusieurs tokens en parallèle au lieu d'un à la fois. Un petit modèle brouillon prédit les tokens candidats, et le modèle principal vérifie leur exactitude en une seule passe. Si la prédiction correspondait—les tokens sont acceptés ; sinon, le processus se répète.
Des méthodes plus avancées, comme DFlash, génèrent un bloc complet de tokens en une seule passe, accélérant encore davantage le processus. Mais cela crée un problème : les tokens dans un bloc sont généralement prédits indépendamment, sans tenir compte des dépendances causales entre eux.
Le Problème avec les Méthodes Existantes
D'autres méthodes récentes, comme Domino et DSpark, ont tenté d'ajouter de la causalité au brouillage de blocs parallèles—de tenir compte des dépendances entre tokens dans un bloc. Mais cela nécessitait d'entraîner le brouillon à partir de zéro, ce qui est coûteux et nécessite d'énormes ressources informatiques. Les organisations sans pétaoctets de données et d'énormes clusters GPU ne peuvent pas se permettre un tel réentraînement.
Ce Qui Est Nouveau dans DeLS-Spec
DeLS-Spec résout ce problème par la division des rôles entre deux experts. La méthode utilise le modèle DFlash existant comme un « expert en long contexte » et ajoute une tête locale légère comme un « expert en court contexte ».
L'avantage clé : la tête locale peut être entraînée complètement indépendamment, sans entraînement conjoint avec le modèle principal ou le squelette de DFlash. Cela réduit considérablement les coûts de calcul. La tête locale est un petit réseau qui regarde uniquement les contextes récents et apprend à prédire les tokens en tenant compte des dépendances causales.
- Méthode appliquée aux modèles Qwen3
- L'entraînement nécessite des coûts minimaux—seul un adaptateur léger est entraîné
- À l'inférence, les logits de deux experts sont combinés
- La tête locale est indépendante de toute version spécifique du point de contrôle DFlash
- Amélioration à la fois de la vitesse d'exécution et de la longueur des tokens acceptés sur les benchmarks
Résultats des Tests
Sur les benchmarks Qwen3, DeLS-Spec a montré une amélioration à la fois de la vitesse d'exécution (speedup) et de la longueur moyenne de tokens acceptés (average acceptance length) par rapport à DFlash. Cela s'applique à trois catégories de tâches : mathématiques, programmation et systèmes de dialogue.
Pourquoi c'est important : des séquences plus longues de tokens acceptés signifient que le brouillon prédit plus précisément et que le système peut générer plus de texte en une seule itération, ce qui affecte directement le débit.
Pourquoi C'est Important pour l'Industrie
Accélérer l'inférence LLM n'est pas seulement une question de vitesse, mais d'économie. Il est moins cher d'entraîner un petit adaptateur que de réentraîner un brouillon complet ou un modèle de base. Cela rend les méthodes d'optimisation plus accessibles aux organisations qui n'ont pas de ressources pour un réentraînement à grande échelle.
À mesure que les LLM deviennent de plus en plus complexes et consommatrices d'énergie, ces améliorations supplémentaires de l'efficacité de l'inférence s'accumulent et se transforment en gains significatifs en vitesse et en coût. DeLS-Spec démontre une tendance importante : les meilleurs résultats sont souvent obtenus non pas par le réentraînement de grands modèles, mais par la combinaison élégante de composants existants.
Ce Que Cela Signifie
Cette approche ouvre des voies pour une optimisation LLM plus accessible dans les organisations de toutes tailles, permettant même aux petites équipes d'obtenir une accélération sans énormes budgets informatiques.
Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?
Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).
L'essentiel de l'IA — une fois par semaine
Sept actus qui ont vraiment compté, choisies à la main. Sans bruit ni communiqués.
C'est fait ! Vérifiez votre boîte mail pour la confirmation.