Apple ML Research→ original

Apple confirme : les modèles de diffusion vocale se dimensionnent comme les modèles autorégressifs

Apple ML Research a publié une étude sur les lois de mise à l'échelle des modèles de langage parlé utilisant la diffusion continue (CD SLM). Les modèles CD se dimensionnent aussi prévisiblement que les modèles autorégressifs : la perte diminue avec l'augmentation de la puissance de calcul. Une nouvelle métrique pJSD a été introduite pour mesurer correctement la qualité linguistique de la parole sans texte intermédiaire.

Traité par IA depuis Apple ML Research ; édité par Hamidun News
Apple confirme : les modèles de diffusion vocale se dimensionnent comme les modèles autorégressifs
Source : Apple ML Research. Collage: Hamidun News.
◐ Écouter l'article

Apple ML Research a prouvé que les réseaux de neurones pour la parole se mettent à l'échelle aussi prévisiblement que les modèles de texte grâce à une nouvelle métrique pJSD, bien que les systèmes de parole restent à la traîne des systèmes de texte en qualité.

Pourquoi les modèles de parole traînent derrière les modèles de texte

Les modèles de langage travaillant directement avec le son sans représentation textuelle intermédiaire — les soi-disant SLM vocaux uniquement — sont actuellement significativement en retard sur les systèmes de texte et multimodaux. Cela semble paradoxal : les interfaces vocales sont demandées, les données audio sont abondantes, mais les progrès sont lents.

L'approche dominante — SLM autorégressive discrets (AR SLM) — convertit d'abord les signaux audio continus en tokens discrets, de la même manière que les modèles de texte fonctionnent avec les mots. Le problème est que la parole est fondamentalement différente du langage écrit : la discrétisation perd inévitablement les détails acoustiques portant le sens sémantique. Pour compenser ces pertes, les modèles AR nécessitent d'énormes ressources informatiques et d'énormes ensembles de données d'entraînement — les rendant coûteux et difficiles à mettre à l'échelle.

Comment la diffusion continue contourne les limitations

La diffusion continue (CD) offre une approche radicalement différente : travailler directement avec des représentations continues de signaux audio, contournant complètement la discrétisation. Cela élimine la perte d'information à l'entrée et rend potentiellement l'entraînement plus efficace.

Cependant, une question clé demeurait : les modèles CD obéissent-ils aux lois de mise à l'échelle ? Ces mêmes lois sont devenues le fondement des modèles de langage de grande taille modernes — prédisant comment la qualité s'améliore à mesure que les paramètres augmentent et que le volume de données s'étend. Sans mise à l'échelle prévisible, investir des ressources importantes dans une architecture est risqué : il n'y a aucune garantie que les investissements seront rentables.

Apple a étudié les deux types de métriques. Conclusions clés :

  • Les CD SLM démontrent des lois de mise à l'échelle claires pour la perte de validation
  • La métrique pJSD (qualité linguistique) diminue de manière prévisible à mesure que le calcul augmente
  • Un ratio optimal entre le nombre de tokens et le nombre de paramètres a été identifié — un analogue vocal de la loi de Chinchilla pour les LLMs de texte
  • Le comportement de mise à l'échelle des modèles CD correspond étroitement à celui des modèles AR

Pourquoi nous avons besoin de la nouvelle métrique pJSD

Les métriques standard — principalement la perte — mesurent la précision avec laquelle le modèle reproduit la distribution d'entraînement, mais reflètent mal si la parole est substantielle d'un point de vue linguistique. Apple a introduit la divergence de Jensen-Shannon phonémique (pJSD).

La métrique calcule la divergence entre la distribution des phonèmes dans la parole générée par le modèle et la parole humaine réelle. Plus la valeur est proche de zéro, plus la parole est « similaire à celle d'un humain » au sens linguistique. De manière critique, pJSD est applicable aux deux architectures — AR et CD — permettant une comparaison équitable d'approches fondamentalement différentes sur une seule échelle.

«

Pour évaluer quantitativement la qualité linguistique des modèles de langage parlé, nous introduisons la métrique pJSD — divergence de Jensen-Shannon au niveau phonémique », affirme l'article d'Apple ML Research.

Ce que cela signifie

La recherche d'Apple lève une incertitude clé dans l'IA vocale : la diffusion continue se met à l'échelle de manière prévisible et est comparable à l'approche autorégressive. Cela donne aux chercheurs et aux entreprises une justification pour un investissement à long terme dans l'architecture CD. Les systèmes d'IA vocale de prochaine génération pourront fonctionner sans texte intermédiaire — rendant potentiellement l'interaction vocale plus naturelle et computationnellement efficace.

Qu'est-ce qu'un réseau de neurones pour la parole ?

C'est un modèle de langage fonctionnant directement avec le son sans représentation textuelle intermédiaire — un modèle de langage parlé uniquement (speech-only SLM).

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?

AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.

Qu'en pensez-vous ?
Chargement des commentaires…