FinMMEval 2026 Task 2: бенчмарк финансового QA на 5 языках, топ-4 систем в пределах 1%
Завершился бенчмарк FinMMEval 2026 Task 2 — соревнование по краткому финансовому вопрос-ответу на данных сразу на пяти языках. Итоговый набор — 256 вопросов, поровну между простым и экспертным уровнями. В рейтинге 12 систем, а лучшие четыре разделяет менее одного процентного пункта по метрике ROUGE-1 F1. Участники применяли RAG, кросс-язычную работу с источниками и сжатие ответов.
Traité par IA depuis arXiv cs.CL ; édité par Hamidun News
FinMMEval2026 Task2 — une compétition de questions-réponses financières courtes sur des données multilingues — a rendu son verdict : en juillet 2026, les organisateurs ont publié le classement final de 12 systèmes, où les quatre meilleurs sont séparés par moins d'un point de pourcentage sur la métrique ROUGE-1 F1, sur un ensemble de 256 questions.
Ce que le benchmark évalue
FinMMEval2026 Task2 évalue avec quelle précision les systèmes d'IA répondent à des questions financières en s'appuyant sur des documents rédigés simultanément en cinq langues. Chaque item du test associe une question en anglais à des rapports financiers et des actualités en anglais, chinois, japonais, espagnol et grec, et le système doit renvoyer une seule réponse courte au format JSONL.
- L'ensemble final compte 256 questions, réparties à parts égales entre les niveaux easy et expert
- Chaque niveau comporte 4 modèles de questions, déployés sur 32 groupes de rapports d'entreprise
- Langues des données sources : anglais, chinois, japonais, espagnol, grec
- Métrique de classement : ROUGE-1 F1 macro-moyennée par item
- Le classement final compte 12 systèmes
Comment les systèmes ont été évalués
Les organisateurs ont gardé les réponses de référence cachées pendant la période de soumission et ont classé les participants selon la ROUGE-1 F1 macro-moyennée au niveau de l'item, comparée à leurs propres réponses de référence. L'écart en tête s'est révélé minime : les 4 meilleurs systèmes sont séparés par moins d'un point de pourcentage en ROUGE-1 F1 — ce qui signifie que les leaders sont en réalité au coude à coude, et que le choix de l'architecture à cette marge se joue à quelques fractions de pourcentage.
«
Les systèmes les plus forts sont étroitement regroupés : les 4 premiers sont séparés par moins d'un point de pourcentage en ROUGE-1 F1 », indique le rapport des organisateurs de FinMMEval2026, publié sur arXiv.
Ce qu'ont utilisé les participants
Les équipes participantes ont construit leurs solutions autour du traitement de sources multilingues plutôt qu'autour d'un seul modèle. D'après les articles techniques publiés avec les résultats, les participants ont documenté la génération augmentée par récupération (RAG), le traitement de preuves interlingues, le prompting structuré, la compression des réponses et des stratégies de validation. C'est précisément l'ensemble de 32 groupes de rapports d'entreprise et de quatre modèles de questions par niveau qui obligeait les systèmes à extraire un fait d'un document en chinois ou en grec et à le formuler de façon courte et précise en anglais.
Pourquoi c'est important pour l'IA financière
FinMMEval2026 Task2 montre où se situe aujourd'hui la limite des modèles de langage en finance : non pas dans la génération de texte, mais dans l'extraction précise d'un fait à partir de rapports rédigés dans une langue inconnue. Ce classement serré — les 4 premiers à moins de 1 % d'écart — est un signal que le QA financier multilingue cesse d'être la tâche d'un seul modèle puissant et devient une affaire d'ingénierie de pipeline : recherche, mise en correspondance interlingue, compression. Pour les banques et les fonds qui travaillent avec des rapports en plusieurs langues, c'est le repère de qualité le plus proche disponible.
Ce que cela signifie
Le benchmark témoigne de la maturité des questions-réponses financières multilingues : les leaders sont déjà presque indiscernables au regard de la métrique, et les progrès futurs se mesureront en fractions de pourcentage et en qualité de traitement des sources, plutôt qu'en bonds d'un seul modèle.
Questions fréquentes
Qu'est-ce que FinMMEval2026 Task2 ?
C'est un benchmark compétitif de questions-réponses financières courtes : le système reçoit une question en anglais accompagnée d'une sélection de rapports financiers et d'actualités en cinq langues, et renvoie une seule réponse condensée. L'ensemble final compte 256 questions.
Dans quelles langues les données sont-elles disponibles ?
Les questions sont formulées en anglais, tandis que les documents financiers et les actualités qui les accompagnent sont en anglais, chinois, japonais, espagnol et grec. La tâche du système consiste à extraire un fait de sources multilingues et à donner une réponse précise.
Comment les systèmes ont-ils été évalués et classés ?
Les réponses de référence ont été gardées cachées pendant la période de soumission, et le classement final de 12 systèmes a été établi sur la base de la ROUGE-1 F1 macro-moyennée au niveau de l'item. Les 4 premiers participants sont séparés par moins d'un point de pourcentage sur cette métrique.
Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?
AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.
L'essentiel de l'IA — une fois par semaine
Sept actus qui ont vraiment compté, choisies à la main. Sans bruit ni communiqués.
C'est fait ! Vérifiez votre boîte mail pour la confirmation.