Apple ML Research→ original

Apple confirma: los modelos de difusión de voz escalan como los autorregresivos

Apple ML Research publicó un estudio sobre leyes de escala para modelos de lenguaje de voz con difusión continua (CD SLM). Los modelos CD escalan tan predeciblemente como los autorregresivos: la pérdida disminuye con mayor computación. Se introdujo una nueva métrica pJSD para medir adecuadamente la calidad lingüística del habla sin texto intermedio.

Procesado por IA desde Apple ML Research; editado por Hamidun News
Apple confirma: los modelos de difusión de voz escalan como los autorregresivos
Fuente: Apple ML Research. Collage: Hamidun News.
◐ Escuchar artículo

Apple ML Research ha demostrado que las redes neuronales para voz escalan de manera tan predecible como los modelos de texto gracias a una nueva métrica pJSD, aunque los sistemas de voz aún se quedan atrás de los sistemas de texto en calidad.

Por qué los modelos de voz se quedan atrás de los modelos de texto

Los modelos de lenguaje que trabajan directamente con sonido sin representación intermedia de texto, los llamados SLM solo de voz, actualmente se quedan significativamente atrás de los sistemas de texto y multimodales. Esto parece paradójico: las interfaces de voz están en demanda, los datos de audio son abundantes, pero el progreso es lento.

El enfoque dominante — SLM autorregresivos discretos (AR SLM) — primero convierte señales de audio continuas en tokens discretos, similar a cómo los modelos de texto trabajan con palabras. El problema es que el habla es fundamentalmente diferente del lenguaje escrito: la discretización inevitablemente pierde detalles acústicos que llevan significado semántico. Para compensar estas pérdidas, los modelos AR requieren enormes recursos computacionales y enormes conjuntos de datos de entrenamiento, lo que los hace costosos y difíciles de escalar.

Cómo la difusión continua elude las limitaciones

La difusión continua (CD) ofrece un enfoque radicalmente diferente: trabajar directamente con representaciones continuas de señales de audio, evitando completamente la discretización. Esto elimina la pérdida de información en la entrada e idealmente hace el entrenamiento más eficiente.

Sin embargo, quedaba una pregunta clave: ¿obedecen los modelos CD a las leyes de escalado? Estas mismas leyes se han convertido en la base de los modernos modelos de lenguaje grande, prediciendo cómo la calidad crece cuando aumentan los parámetros y el volumen de datos se expande. Sin escalado predecible, invertir recursos importantes en una arquitectura es arriesgado: no hay garantía de que las inversiones den resultado.

Apple investigó ambos tipos de métricas. Hallazgos clave:

  • Los CD SLM demuestran leyes de escalado claras para pérdida de validación
  • La métrica pJSD (calidad lingüística) disminuye predeciblemente a medida que aumenta el cálculo
  • Se identificó una relación óptima entre el número de tokens y el número de parámetros — un análogo de voz de la ley de Chinchilla para LLM de texto
  • El comportamiento de escalado de modelos CD corresponde estrechamente con el de modelos AR

Por qué necesitamos la nueva métrica pJSD

Las métricas estándar — principalmente pérdida — miden cuán precisamente el modelo reproduce la distribución de entrenamiento, pero reflejan mal si el habla es sustancial desde una perspectiva lingüística. Apple introdujo la divergencia de Jensen-Shannon de fonemas (pJSD).

La métrica calcula la divergencia entre la distribución de fonemas en el habla generada por el modelo y el habla humana real. Cuanto más cercano sea el valor a cero, más "similar al humano" es el habla en un sentido lingüístico. Críticamente, pJSD es aplicable a ambas arquitecturas — AR y CD — permitiendo comparación justa de enfoques fundamentalmente diferentes en una escala única.

"Para evaluar cuantitativamente la calidad lingüística de los modelos de lenguaje de voz, introducimos la métrica pJSD — divergencia de

Jensen-Shannon a nivel de fonema", afirma el documento de Apple ML Research.

Qué significa esto

La investigación de Apple elimina una incertidumbre clave en IA de voz: la difusión continua escala predeciblemente y es comparable con el enfoque autorregresivo. Esto da a investigadores y empresas justificación para inversión a largo plazo en arquitectura CD. Los sistemas de IA de voz de próxima generación podrán trabajar sin texto intermedio, potencialmente haciendo la interacción por voz más natural y eficiente computacionalmente.

¿Qué es una red neuronal para voz?

Este es un modelo de lenguaje que funciona directamente con sonido sin representación de texto intermedia — un modelo de lenguaje solo de voz (speech-only SLM).

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Quieres dejar de leer sobre IA y empezar a usarla?

AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.

¿Qué te parece?
Cargando comentarios…