Interfaze a lancé un modèle ASR open source par diffusion pour la reconnaissance de six langues
Le 2 juillet 2026, Interfaze a ouvert le code source de diffusion-gemma-asr-small, un modèle de reconnaissance de la parole qui fonctionne par diffusion plutôt que par autorégression. L'adaptateur, d'environ 42 millions de paramètres, ajoute une entrée audio à la DiffusionGemma figée de Google et couvre six langues. Le coût de calcul de la transcription dépend du nombre d'étapes de débruitage, et non de la durée de l'enregistrement.
Traité par IA depuis MarkTechPost ; édité par Hamidun News
Interfaze a publié diffusion-gemma-asr-small en accès libre le 2 juillet 2026 — un modèle de reconnaissance automatique de la parole multilingue qui transcrit l'audio via la diffusion plutôt que l'autorégression. Un adaptateur pesant environ 42 millions de paramètres se connecte à des poids figés de DiffusionGemma de Google et couvre six langues sans division en branches spécifiques à la langue.
Comment fonctionne la reconnaissance de la parole par diffusion?
La plupart des systèmes ASR publics sont autoréggressifs: le modèle génère la transcription de manière séquentielle, jeton par jeton, et le temps d'exécution augmente proportionnellement à la longueur de l'enregistrement. Whisper d'OpenAI, MMS et Seamless de Meta, Distil-Whisper — ils fonctionnent tous exactement ainsi.
diffusion-gemma-asr-small est organisé différemment. À sa base se trouve DiffusionGemma — le modèle linguistique de Google entraîné avec la méthode de diffusion: au lieu de générer séquentiellement, il récupère le texte à partir d'un état bruyant en parallèle à travers plusieurs étapes de débruitage.
Interfaze a ajouté un adaptateur audio à cette base: il enseigne au modèle à corréler le signal audio avec le texte souhaité, tandis que les poids de DiffusionGemma restent figés et ne sont pas mis à jour pendant l'entraînement de l'adaptateur.
La conséquence pratique: le coût de calcul de la transcription est déterminé par le nombre spécifié d'étapes de débruitage, et non par la longueur de l'audio. Le développeur lui-même choisit l'équilibre entre la vitesse et la qualité — plus d'étapes signifie une précision plus élevée, mais plus de temps.
Qu'y a-t-il à l'intérieur du modèle?
- Date de sortie en accès libre — 2 juillet 2026
- Taille de l'adaptateur audio — environ 42 millions de paramètres
- Modèle de base — DiffusionGemma de Google (poids figés, non mis à jour)
- Langues supportées — six (la liste spécifique n'a pas été divulguée dans l'annonce)
- Le coût d'inférence dépend du nombre d'étapes de débruitage, pas de la longueur de l'enregistrement
Un adaptateur pour six langues — le pari architectural clé. La plupart des modèles multilingues utilisent soit des têtes spécifiques à la langue, soit un point de contrôle séparé pour chaque langue. Ici, DiffusionGemma contient déjà des représentations de texte multilingues, et l'adaptateur n'a besoin que d'apprendre au modèle à accepter l'audio — sans dupliquer les poids pour chaque langue.
À titre de comparaison: la version complète de Whisper large-v3 d'OpenAI contient 1,5 milliard de paramètres — l'adaptateur d'Interfaze est environ 35 fois plus compact en termes de poids réentraînables.
Qu'est-ce que cela signifie pour les développeurs de l'ASR?
L'approche par diffusion dans la reconnaissance vocale est rare dans l'espace public. La plupart des systèmes ASR ouverts sont construits sur l'autorégression ou le décodage CTC. diffusion-gemma-asr-small est le premier exemple public de réutilisation d'un modèle de langage diffusionnel comme backend ASR via un adaptateur minimal.
Pour la communauté de recherche, c'est une preuve de concept et un point de départ: les poids ouverts permettent d'explorer l'architecture et d'essayer de l'adapter à des tâches connexes — ASR multilingue, code-switching, reconnaissance vocale consciente de l'accent.
Pour l'application pratique, des données sont nécessaires, que l'annonce ne divulgue pas: les langues spécifiques, la précision sur les repères standards (WER sur LibriSpeech, Common Voice, Fleurs), la vitesse d'inférence réelle par rapport à Whisper. Sans ces chiffres, il est difficile d'évaluer la compétitivité du modèle dans les scénarios de production.
Ce que cela signifie
Interfaze a ouvert une direction pratiquement inexploitée — ASR par diffusion avec réentraînement uniquement d'un adaptateur léger au-dessus d'un modèle linguistique existant. Si l'approche confirme une qualité compétitive sur les repères, elle offrira une alternative intéressante aux systèmes autoréggressifs: latence prévisible, ajustement de la qualité flexible via le nombre d'étapes et budget de poids compact.
*Meta est reconnue comme une organisation extrémiste et est interdite en Russie.
Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?
Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).
L'essentiel de l'IA — une fois par semaine
Sept actus qui ont vraiment compté, choisies à la main. Sans bruit ni communiqués.
C'est fait ! Vérifiez votre boîte mail pour la confirmation.