FinMMEval 2026 Task 2: бенчмарк финансового QA на 5 языках, топ-4 систем в пределах 1%
Завершился бенчмарк FinMMEval 2026 Task 2 — соревнование по краткому финансовому вопрос-ответу на данных сразу на пяти языках. Итоговый набор — 256 вопросов, поровну между простым и экспертным уровнями. В рейтинге 12 систем, а лучшие четыре разделяет менее одного процентного пункта по метрике ROUGE-1 F1. Участники применяли RAG, кросс-язычную работу с источниками и сжатие ответов.
Procesado por IA desde arXiv cs.CL; editado por Hamidun News
FinMMEval2026 Task2 — una competición de preguntas y respuestas financieras breves sobre datos multilingües — ha concluido: en julio de 2026 los organizadores publicaron la clasificación final de 12 sistemas, en la que los cuatro mejores quedan separados por menos de un punto porcentual en la métrica ROUGE-1 F1 sobre un conjunto de 256 preguntas.
Qué evalúa el benchmark
FinMMEval2026 Task2 evalúa con qué precisión los sistemas de IA responden preguntas financieras basándose en documentos en cinco idiomas a la vez. Cada elemento de la prueba vincula una pregunta en inglés con informes financieros y noticias en inglés, chino, japonés, español y griego, y el sistema debe devolver una única respuesta breve en formato JSONL.
- El conjunto final es de 256 preguntas, repartidas a partes iguales entre los niveles easy y expert
- Cada nivel tiene 4 plantillas de preguntas, desplegadas sobre 32 grupos de informes corporativos
- Idiomas de los datos de origen: inglés, chino, japonés, español, griego
- Métrica de clasificación: ROUGE-1 F1 macro-promediada por elemento
- La clasificación final incluye 12 sistemas
Cómo se evaluaron los sistemas
Los organizadores mantuvieron ocultas las respuestas de referencia durante el periodo de presentación de propuestas y clasificaron a los participantes según la ROUGE-1 F1 macro-promediada a nivel de elemento frente a sus propias respuestas de referencia. La dispersión en la cima resultó ser mínima: los 4 mejores sistemas quedan separados por menos de un punto porcentual en ROUGE-1 F1, lo que significa que los líderes van prácticamente a la par, y la elección de la arquitectura en este margen se decide por fracciones de un punto porcentual.
«Los sistemas más fuertes están estrechamente agrupados: los cuatro mejores quedan separados por menos de un punto porcentual en ROUGE-1 F1», señala el informe de los organizadores de
FinMMEval2026, publicado en arXiv.
Qué utilizaron los participantes
Los equipos participantes construyeron sus soluciones en torno al manejo de fuentes en varios idiomas, y no en torno a un único modelo. Según los artículos de sistema publicados junto con los resultados, los participantes documentaron generación aumentada por recuperación (RAG), procesamiento de evidencia entre idiomas, prompting estructurado, compresión de respuestas y estrategias de validación. Precisamente el conjunto de 32 grupos de informes corporativos y cuatro plantillas de preguntas por nivel obligaba a los sistemas a extraer un hecho de un documento en chino o griego y condensar la respuesta en una formulación breve y precisa en inglés.
Por qué esto importa para la IA financiera
FinMMEval2026 Task2 muestra dónde se sitúa hoy el límite de los modelos de lenguaje en finanzas: no en la generación de texto, sino en la extracción precisa de un hecho a partir de informes en un idioma desconocido. La clasificación tan ajustada —los 4 mejores dentro del 1%— es una señal de que el QA financiero multilingüe deja de ser tarea de un único modelo potente y se convierte en ingeniería de pipeline: recuperación, correspondencia entre idiomas, compresión. Para los bancos y fondos que trabajan con informes en varios idiomas, este es el referente de calidad más cercano.
Qué significa esto
El benchmark refleja la madurez de las preguntas y respuestas financieras multilingües: los líderes ya son casi indistinguibles según la métrica, y el progreso futuro se medirá en fracciones de un punto porcentual y en la calidad del manejo de las fuentes, y no en saltos de un único modelo.
Preguntas frecuentes
¿Qué es FinMMEval2026 Task2?
Es un benchmark competitivo de preguntas y respuestas financieras breves: el sistema recibe una pregunta en inglés junto con una selección de informes financieros y noticias en cinco idiomas, y devuelve una única respuesta condensada. El conjunto final contiene 256 preguntas.
¿En qué idiomas están los datos?
Las preguntas están formuladas en inglés, mientras que los documentos financieros y las noticias que las acompañan están en inglés, chino, japonés, español y griego. La tarea del sistema es extraer un hecho de fuentes en varios idiomas y dar una respuesta precisa.
¿Cómo se evaluaron y clasificaron los sistemas?
Las respuestas de referencia se mantuvieron ocultas durante el periodo de presentación de propuestas, y la clasificación final de 12 sistemas se construyó según la ROUGE-1 F1 macro-promediada a nivel de elemento. Los 4 primeros participantes quedan separados por menos de un punto porcentual en esta métrica.
¿Quieres dejar de leer sobre IA y empezar a usarla?
AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.