MarkTechPost→ original

Interfaze lançou um modelo ASR de código aberto por difusão para reconhecimento de seis idiomas

Em 2 de julho de 2026, a Interfaze abriu o código-fonte de diffusion-gemma-asr-small, um modelo de reconhecimento de fala que opera por difusão, e não por autorregressão. O adaptador de ~42 milhões de parâmetros adiciona áudio à DiffusionGemma congelada do Google e cobre seis idiomas. O custo computacional da transcrição depende do número de etapas de remoção de ruído, não da duração da gravação.

Processado por IA de MarkTechPost; editado por Hamidun News
Interfaze lançou um modelo ASR de código aberto por difusão para reconhecimento de seis idiomas
Fonte: MarkTechPost. Colagem: Hamidun News.
◐ Ouvir artigo

Interfaze publicou diffusion-gemma-asr-small em acesso aberto em 2 de julho de 2026 — um modelo de reconhecimento automático de fala multilíngue que transcreve áudio através de difusão em vez de autorregression. Um adaptador pesando cerca de 42 milhões de parâmetros se conecta a pesos congelados de DiffusionGemma do Google e cobre seis idiomas sem divisão em ramos específicos de idioma.

Como o reconhecimento de fala por difusão funciona?

A maioria dos sistemas ASR públicos são autorreggressivos: o modelo gera transcrição sequencialmente, token por token, e o tempo de execução cresce proporcionalmente ao comprimento da gravação. Whisper do OpenAI, MMS e Seamless do Meta, Distil-Whisper — todos funcionam exatamente dessa forma.

diffusion-gemma-asr-small é organizado de forma diferente. Em seu núcleo está DiffusionGemma — modelo de linguagem do Google treinado com o método de difusão: em vez de geração sequencial, ele recupera texto de um estado ruidoso em paralelo através de várias etapas de remoção de ruído.

Interfaze adicionou um adaptador de áudio a essa base: ensina ao modelo correlacionar o sinal de áudio com o texto desejado, enquanto os pesos de DiffusionGemma permanecem congelados e não são atualizados durante o treinamento do adaptador.

A consequência prática: o custo computacional da transcrição é determinado pelo número especificado de etapas de remoção de ruído, não pelo comprimento do áudio. O desenvolvedor mesmo escolhe o equilíbrio entre velocidade e qualidade — mais etapas significa maior precisão, mas mais tempo.

O que há dentro do modelo?

  • Data de lançamento em acesso aberto — 2 de julho de 2026
  • Tamanho do adaptador de áudio — aproximadamente 42 milhões de parâmetros
  • Modelo base — DiffusionGemma do Google (pesos congelados, não atualizados)
  • Idiomas suportados — seis (lista específica não divulgada no anúncio)
  • O custo de inferência depende do número de etapas de remoção de ruído, não do comprimento da gravação

Um adaptador para seis idiomas — a aposta arquitetônica chave. A maioria dos modelos multilíngues usa cabeçalhos específicos de idioma ou um ponto de verificação separado para cada idioma. Aqui, DiffusionGemma já contém representações de texto multilíngues, e o adaptador só precisa ensinar ao modelo aceitar áudio — sem duplicar pesos para cada idioma.

Para comparação: a versão completa de Whisper large-v3 do OpenAI contém 1,5 bilhão de parâmetros — o adaptador de Interfaze é aproximadamente 35 vezes mais compacto em termos de pesos retreinináveis.

O que isso significa para os desenvolvedores de ASR?

A abordagem de difusão em reconhecimento de fala é rara no espaço público. A maioria dos sistemas ASR abertos é construída em autorregression ou decodificação CTC. diffusion-gemma-asr-small é o primeiro exemplo público de reutilização de um modelo de linguagem difusional como backend ASR através de um adaptador mínimo.

Para a comunidade de pesquisa, isso é prova de conceito e um ponto de partida: pesos abertos permitem explorar a arquitetura e tentar adaptá-la a tarefas relacionadas — ASR multilíngue, alternância de código, reconhecimento de fala ciente de sotaque.

Para aplicação prática, dados são necessários, que o anúncio não divulga: idiomas específicos, precisão em benchmarks padrão (WER em LibriSpeech, Common Voice, Fleurs), velocidade real de inferência comparada com Whisper. Sem esses números, é difícil avaliar a competitividade do modelo em cenários de produção.

O que isso significa

Interfaze abriu uma direção praticamente inexplorada — ASR de difusão com retreinamento apenas de um adaptador leve no topo de um modelo de linguagem existente. Se a abordagem confirmar qualidade competitiva em benchmarks, oferecerá uma alternativa interessante aos sistemas autorreggressivos: latência previsível, ajuste de qualidade flexível através do número de etapas e orçamento de peso compacto.

*Meta é reconhecida como organização extremista e proibida na Rússia.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…