Interfaze lançou um modelo ASR de código aberto por difusão para reconhecimento de seis idiomas
Em 2 de julho de 2026, a Interfaze abriu o código-fonte de diffusion-gemma-asr-small, um modelo de reconhecimento de fala que opera por difusão, e não por autorregressão. O adaptador de ~42 milhões de parâmetros adiciona áudio à DiffusionGemma congelada do Google e cobre seis idiomas. O custo computacional da transcrição depende do número de etapas de remoção de ruído, não da duração da gravação.
Processado por IA de MarkTechPost; editado por Hamidun News
Interfaze publicou diffusion-gemma-asr-small em acesso aberto em 2 de julho de 2026 — um modelo de reconhecimento automático de fala multilíngue que transcreve áudio através de difusão em vez de autorregression. Um adaptador pesando cerca de 42 milhões de parâmetros se conecta a pesos congelados de DiffusionGemma do Google e cobre seis idiomas sem divisão em ramos específicos de idioma.
Como o reconhecimento de fala por difusão funciona?
A maioria dos sistemas ASR públicos são autorreggressivos: o modelo gera transcrição sequencialmente, token por token, e o tempo de execução cresce proporcionalmente ao comprimento da gravação. Whisper do OpenAI, MMS e Seamless do Meta, Distil-Whisper — todos funcionam exatamente dessa forma.
diffusion-gemma-asr-small é organizado de forma diferente. Em seu núcleo está DiffusionGemma — modelo de linguagem do Google treinado com o método de difusão: em vez de geração sequencial, ele recupera texto de um estado ruidoso em paralelo através de várias etapas de remoção de ruído.
Interfaze adicionou um adaptador de áudio a essa base: ensina ao modelo correlacionar o sinal de áudio com o texto desejado, enquanto os pesos de DiffusionGemma permanecem congelados e não são atualizados durante o treinamento do adaptador.
A consequência prática: o custo computacional da transcrição é determinado pelo número especificado de etapas de remoção de ruído, não pelo comprimento do áudio. O desenvolvedor mesmo escolhe o equilíbrio entre velocidade e qualidade — mais etapas significa maior precisão, mas mais tempo.
O que há dentro do modelo?
- Data de lançamento em acesso aberto — 2 de julho de 2026
- Tamanho do adaptador de áudio — aproximadamente 42 milhões de parâmetros
- Modelo base — DiffusionGemma do Google (pesos congelados, não atualizados)
- Idiomas suportados — seis (lista específica não divulgada no anúncio)
- O custo de inferência depende do número de etapas de remoção de ruído, não do comprimento da gravação
Um adaptador para seis idiomas — a aposta arquitetônica chave. A maioria dos modelos multilíngues usa cabeçalhos específicos de idioma ou um ponto de verificação separado para cada idioma. Aqui, DiffusionGemma já contém representações de texto multilíngues, e o adaptador só precisa ensinar ao modelo aceitar áudio — sem duplicar pesos para cada idioma.
Para comparação: a versão completa de Whisper large-v3 do OpenAI contém 1,5 bilhão de parâmetros — o adaptador de Interfaze é aproximadamente 35 vezes mais compacto em termos de pesos retreinináveis.
O que isso significa para os desenvolvedores de ASR?
A abordagem de difusão em reconhecimento de fala é rara no espaço público. A maioria dos sistemas ASR abertos é construída em autorregression ou decodificação CTC. diffusion-gemma-asr-small é o primeiro exemplo público de reutilização de um modelo de linguagem difusional como backend ASR através de um adaptador mínimo.
Para a comunidade de pesquisa, isso é prova de conceito e um ponto de partida: pesos abertos permitem explorar a arquitetura e tentar adaptá-la a tarefas relacionadas — ASR multilíngue, alternância de código, reconhecimento de fala ciente de sotaque.
Para aplicação prática, dados são necessários, que o anúncio não divulga: idiomas específicos, precisão em benchmarks padrão (WER em LibriSpeech, Common Voice, Fleurs), velocidade real de inferência comparada com Whisper. Sem esses números, é difícil avaliar a competitividade do modelo em cenários de produção.
O que isso significa
Interfaze abriu uma direção praticamente inexplorada — ASR de difusão com retreinamento apenas de um adaptador leve no topo de um modelo de linguagem existente. Se a abordagem confirmar qualidade competitiva em benchmarks, oferecerá uma alternativa interessante aos sistemas autorreggressivos: latência previsível, ajuste de qualidade flexível através do número de etapas e orçamento de peso compacto.
*Meta é reconhecida como organização extremista e proibida na Rússia.
Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?
Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.