MarkTechPost→ original

Interfaze lanzó un modelo ASR de código abierto por difusión para el reconocimiento de seis idiomas

El 2 de julio de 2026, Interfaze abrió el código fuente de diffusion-gemma-asr-small, un modelo de reconocimiento del habla que funciona mediante difusión y no por autorregresión. El adaptador, de ~42 millones de parámetros, añade audio a la DiffusionGemma congelada de Google y cubre seis idiomas. El costo computacional de la transcripción depende del número de pasos de eliminación de ruido, no de la duración de la grabación.

Procesado por IA desde MarkTechPost; editado por Hamidun News
Interfaze lanzó un modelo ASR de código abierto por difusión para el reconocimiento de seis idiomas
Fuente: MarkTechPost. Collage: Hamidun News.
◐ Escuchar artículo

Interfaze publicó diffusion-gemma-asr-small en acceso abierto el 2 de julio de 2026 — un modelo de reconocimiento automático de voz multilingüe que transcribe audio mediante difusión en lugar de autorregresión. Un adaptador que pesa aproximadamente 42 millones de parámetros se conecta a pesos congelados de DiffusionGemma de Google y cubre seis idiomas sin dividirse en ramas específicas del idioma.

¿Cómo funciona el reconocimiento de voz por difusión?

La mayoría de los sistemas ASR públicos son autorregresivos: el modelo genera la transcripción secuencialmente, token por token, y el tiempo de ejecución crece proporcionalmente a la duración de la grabación. Whisper de OpenAI, MMS y Seamless de Meta, Distil-Whisper — todos funcionan exactamente de esta manera.

diffusion-gemma-asr-small está organizado de manera diferente. En su núcleo está DiffusionGemma — el modelo de lenguaje de Google entrenado con el método de difusión: en lugar de generación secuencial, recupera texto desde un estado ruidoso en paralelo a través de varios pasos de eliminación de ruido.

Interfaze agregó un adaptador de audio a esta base: enseña al modelo a correlacionar la señal de audio con el texto deseado, mientras que los pesos de DiffusionGemma permanecen congelados y no se actualizan durante el entrenamiento del adaptador.

La consecuencia práctica: el costo computacional de la transcripción se determina por el número especificado de pasos de eliminación de ruido, no por la duración del audio. El desarrollador mismo elige el equilibrio entre velocidad y calidad — más pasos significa mayor precisión, pero más tiempo.

¿Qué hay dentro del modelo?

  • Fecha de lanzamiento en acceso abierto — 2 de julio de 2026
  • Tamaño del adaptador de audio — aproximadamente 42 millones de parámetros
  • Modelo base — DiffusionGemma de Google (pesos congelados, no se actualizan)
  • Idiomas soportados — seis (lista específica no divulgada en el anuncio)
  • El costo de inferencia depende del número de pasos de eliminación de ruido, no de la duración de la grabación

Un adaptador para seis idiomas — la apuesta arquitectónica clave. La mayoría de los modelos multilingües utilizan cabezas específicas del idioma o un punto de control separado para cada idioma. Aquí, DiffusionGemma ya contiene representaciones de texto multilingües, y el adaptador solo necesita enseñarle a aceptar audio — sin duplicar pesos para cada idioma.

Para comparación: la versión completa de Whisper large-v3 de OpenAI contiene 1.500 millones de parámetros — el adaptador de Interfaze es aproximadamente 35 veces más compacto en términos de pesos reentrenables.

¿Qué significa esto para los desarrolladores de ASR?

El enfoque de difusión en el reconocimiento de voz es raro en el espacio público. La mayoría de los sistemas ASR abiertos se construyen sobre autorregresión o decodificación CTC. diffusion-gemma-asr-small es el primer ejemplo público de reutilizar un modelo de lenguaje difusional como backend ASR a través de un adaptador mínimo.

Para la comunidad de investigación, esta es una prueba de concepto y un punto de partida: los pesos abiertos permiten explorar la arquitectura e intentar adaptarla a tareas relacionadas — ASR multilingüe, cambio de código, reconocimiento de voz consciente del acento.

Para la aplicación práctica, se necesitan datos, que el anuncio no divulga: idiomas específicos, precisión en puntos de referencia estándar (WER en LibriSpeech, Common Voice, Fleurs), velocidad de inferencia real en comparación con Whisper. Sin estos números, es difícil evaluar la competitividad del modelo en escenarios de producción.

Lo que esto significa

Interfaze abrió una dirección prácticamente inexplorada — ASR de difusión con reentrenamiento solo de un adaptador ligero sobre un modelo de lenguaje existente. Si el enfoque confirma calidad competitiva en puntos de referencia, ofrecerá una alternativa interesante a los sistemas autorregresivos: latencia predecible, ajuste flexible de calidad a través del número de pasos y un presupuesto de peso compacto.

*Meta es reconocida como una organización extremista y está prohibida en Rusia.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?

Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).

¿Qué te parece?
Cargando comentarios…