arXiv cs.CL→ original

FinMMEval 2026 Task 2: бенчмарк финансового QA на 5 языках, топ-4 систем в пределах 1%

Завершился бенчмарк FinMMEval 2026 Task 2 — соревнование по краткому финансовому вопрос-ответу на данных сразу на пяти языках. Итоговый набор — 256 вопросов, поровну между простым и экспертным уровнями. В рейтинге 12 систем, а лучшие четыре разделяет менее одного процентного пункта по метрике ROUGE-1 F1. Участники применяли RAG, кросс-язычную работу с источниками и сжатие ответов.

Processado por IA de arXiv cs.CL; editado por Hamidun News
FinMMEval 2026 Task 2: бенчмарк финансового QA на 5 языках, топ-4 систем в пределах 1%
Fonte: arXiv cs.CL. Colagem: Hamidun News.
◐ Ouvir artigo

O FinMMEval2026 Task2 — uma competição de perguntas e respostas financeiras curtas sobre dados multilíngues — chegou ao fim: em julho de 2026 os organizadores publicaram o ranking final com 12 sistemas, no qual os quatro melhores ficam separados por menos de um ponto percentual na métrica ROUGE-1 F1, em um conjunto de 256 perguntas.

O que o benchmark avalia

O FinMMEval2026 Task2 avalia com que precisão os sistemas de IA respondem a perguntas financeiras com base em documentos em cinco idiomas ao mesmo tempo. Cada item do teste associa uma pergunta em inglês a relatórios financeiros e notícias em inglês, chinês, japonês, espanhol e grego, e o sistema deve devolver uma única resposta curta no formato JSONL.

  • O conjunto final tem 256 perguntas, divididas igualmente entre os níveis easy e expert
  • Cada nível tem 4 modelos de pergunta, aplicados a 32 grupos de relatórios corporativos
  • Idiomas dos dados de origem: inglês, chinês, japonês, espanhol, grego
  • Métrica de classificação: ROUGE-1 F1 com média macro por item
  • O ranking final inclui 12 sistemas

Como os sistemas foram avaliados

Os organizadores mantiveram as respostas de referência ocultas durante o período de submissão e classificaram os participantes pela ROUGE-1 F1 com média macro no nível de item, em comparação com suas próprias respostas de referência. A diferença no topo se mostrou mínima: os 4 melhores sistemas ficam separados por menos de um ponto percentual na ROUGE-1 F1 — o que significa que os líderes praticamente empatam, e a escolha da arquitetura nessa margem se decide por frações de ponto percentual.

"Os sistemas mais fortes estão agrupados de forma bem próxima: os 4 melhores ficam separados por menos de um ponto percentual na ROUGE-1 F1", afirma o relatório dos organizadores do

FinMMEval2026, publicado no arXiv.

O que os participantes utilizaram

As equipes participantes construíram suas soluções em torno do trabalho com fontes multilíngues, e não em torno de um único modelo. Segundo os artigos de sistema publicados junto com os resultados, os participantes documentaram geração aumentada por recuperação (RAG), processamento de evidências entre idiomas, prompting estruturado, compressão de respostas e estratégias de validação. Foi justamente o conjunto de 32 grupos de relatórios corporativos e quatro modelos de pergunta por nível que obrigou os sistemas a extrair um fato de um documento em chinês ou grego e condensar a resposta em uma formulação curta e precisa em inglês.

Por que isso importa para a IA financeira

O FinMMEval2026 Task2 mostra onde está hoje o limite dos modelos de linguagem em finanças: não na geração de texto, mas na extração precisa de um fato a partir de relatórios em um idioma desconhecido. O ranking tão apertado — os 4 melhores dentro de 1% — é um sinal de que o QA financeiro multilíngue está deixando de ser tarefa de um único modelo forte e se transformando em engenharia de pipeline: busca, correspondência entre idiomas, compressão. Para bancos e fundos que trabalham com relatórios em vários idiomas, esse é o parâmetro de qualidade mais próximo disponível.

O que isso significa

O benchmark registra a maturidade das perguntas e respostas financeiras multilíngues: os líderes já estão quase indistinguíveis pela métrica, e o progresso futuro será medido em frações de ponto percentual e na qualidade do trabalho com as fontes, e não em saltos de um único modelo.

Perguntas frequentes

O que é o FinMMEval2026 Task2?

É um benchmark competitivo de perguntas e respostas financeiras curtas: o sistema recebe uma pergunta em inglês e uma seleção de relatórios financeiros e notícias em cinco idiomas, e devolve uma única resposta condensada. O conjunto final tem 256 perguntas.

Em quais idiomas os dados estão disponíveis?

As perguntas são formuladas em inglês, enquanto os documentos financeiros e as notícias que os acompanham estão em inglês, chinês, japonês, espanhol e grego. A tarefa do sistema é extrair um fato de fontes multilíngues e dar uma resposta precisa.

Como os sistemas foram avaliados e classificados?

As respostas de referência ficaram ocultas durante o período de submissão, e o ranking final com 12 sistemas foi construído com base na ROUGE-1 F1 com média macro no nível de item. Os 4 melhores participantes ficam separados por menos de um ponto percentual nessa métrica.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Quer parar de ler sobre IA e começar a usar?

AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.

O que você acha?
Carregando comentários…