arXiv cs.CL→ original

SAMPA: Sistema Baseado em Whisper para Detecção de Limites de Prosódia da Fala Portuguesa

Pesquisadores desenvolveram SAMPA — uma adaptação do Whisper large-v3 para a fala portuguesa. O sistema identifica automaticamente limites prosódicos entre unidades de fala, treinado em gravações do conjunto de dados NURC-SP, e demonstrou resultados fortes: F1 = 0,731 no teste principal e F1 = 0,796 no conjunto de dados MuPe-Diversidades.

Processado por IA de arXiv cs.CL; editado por Hamidun News
SAMPA: Sistema Baseado em Whisper para Detecção de Limites de Prosódia da Fala Portuguesa
Fonte: arXiv cs.CL. Colagem: Hamidun News.
◐ Ouvir artigo

Os pesquisadores desenvolveram SAMPA — um sistema baseado no modelo Whisper para detecção automática de limites prosódicos (pontos de separação entre unidades de fala) na fala portuguesa brasileira. No teste padrão, o sistema mostrou precisão F1=0.731, e nos testes entre conjuntos de dados no MuPe-Diversidades alcançou F1=0.796.

Como o SAMPA funciona

O sistema é construído sobre o Whisper large-v3 — um modelo multilíngue de conversão de fala em texto da OpenAI. Os autores ajustaram-no em gravações em português do conjunto de dados NURC-SP (um arquivo de fala oral portuguesa brasileira) e treinaram o modelo para inserir marcadores especiais nos locais de limites prosódicos. O sistema foi treinado com gravações de diferentes falantes, diferentes estilos de fala e diferentes condições de gravação, o que ajudou a lidar também com novos exemplos.

Aspectos principais da abordagem:

  • Modelo base: Whisper large-v3 da OpenAI
  • Ajuste fino: conjunto de dados NURC-SP com gravações anotadas manualmente
  • Precisão no teste principal: F1=0.731
  • Precisão no conjunto de dados independente MuPe-Diversidades: F1=0.796
  • O modelo usa sinais morfossintáticos, semânticos e prosódicos

Por que isso importa para o português

Para o inglês, o processamento de prosódia é bem desenvolvido devido à abundância de dados anotados e anos de pesquisa. O português, entretanto, tem historicamente confiado principalmente em regras e métodos tradicionais de aprendizado de máquina — isto é menos preciso e flexível do que as abordagens de redes neurais.

O SAMPA demonstra que um modelo pré-treinado grande pode ser efetivamente adaptado a outro idioma usando um conjunto relativamente pequeno de gravações anotadas. Isso abre a porta para soluções semelhantes para outros idiomas além do inglês — russo, espanhol, mandarim e outros podem obter sistemas comparáveis através da adaptação do Whisper.

O que isso significa

A detecção correta de limites prosódicos é importante para o processamento prático de fala portuguesa: a síntese de fala natural soa mais convincente quando pausas e entonações são colocadas corretamente; a anotação automática de textos torna-se possível sem edição manual; a análise de documentos orais e arquivos de fala é acelerada.

A pesquisa demonstra que o princípio do aprendizado por transferência funciona efetivamente — em vez de treinar um modelo do zero, os autores adaptaram um Whisper existente, que é significativamente mais rápido e requer menos dados. Isso pode se tornar um modelo para desenvolver processamento de fala em outros idiomas e regiões.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…