arXiv cs.CL→ original

FinMMEval 2026 Task 2: бенчмарк финансового QA на 5 языках, топ-4 систем в пределах 1%

Завершился бенчмарк FinMMEval 2026 Task 2 — соревнование по краткому финансовому вопрос-ответу на данных сразу на пяти языках. Итоговый набор — 256 вопросов, поровну между простым и экспертным уровнями. В рейтинге 12 систем, а лучшие четыре разделяет менее одного процентного пункта по метрике ROUGE-1 F1. Участники применяли RAG, кросс-язычную работу с источниками и сжатие ответов.

Procesado por IA desde arXiv cs.CL; editado por Hamidun News
FinMMEval 2026 Task 2: бенчмарк финансового QA на 5 языках, топ-4 систем в пределах 1%
Fuente: arXiv cs.CL. Collage: Hamidun News.
◐ Escuchar artículo

FinMMEval2026 Task2 — una competición de preguntas y respuestas financieras breves sobre datos multilingües — ha concluido: en julio de 2026 los organizadores publicaron la clasificación final de 12 sistemas, en la que los cuatro mejores quedan separados por menos de un punto porcentual en la métrica ROUGE-1 F1 sobre un conjunto de 256 preguntas.

Qué evalúa el benchmark

FinMMEval2026 Task2 evalúa con qué precisión los sistemas de IA responden preguntas financieras basándose en documentos en cinco idiomas a la vez. Cada elemento de la prueba vincula una pregunta en inglés con informes financieros y noticias en inglés, chino, japonés, español y griego, y el sistema debe devolver una única respuesta breve en formato JSONL.

  • El conjunto final es de 256 preguntas, repartidas a partes iguales entre los niveles easy y expert
  • Cada nivel tiene 4 plantillas de preguntas, desplegadas sobre 32 grupos de informes corporativos
  • Idiomas de los datos de origen: inglés, chino, japonés, español, griego
  • Métrica de clasificación: ROUGE-1 F1 macro-promediada por elemento
  • La clasificación final incluye 12 sistemas

Cómo se evaluaron los sistemas

Los organizadores mantuvieron ocultas las respuestas de referencia durante el periodo de presentación de propuestas y clasificaron a los participantes según la ROUGE-1 F1 macro-promediada a nivel de elemento frente a sus propias respuestas de referencia. La dispersión en la cima resultó ser mínima: los 4 mejores sistemas quedan separados por menos de un punto porcentual en ROUGE-1 F1, lo que significa que los líderes van prácticamente a la par, y la elección de la arquitectura en este margen se decide por fracciones de un punto porcentual.

«Los sistemas más fuertes están estrechamente agrupados: los cuatro mejores quedan separados por menos de un punto porcentual en ROUGE-1 F1», señala el informe de los organizadores de

FinMMEval2026, publicado en arXiv.

Qué utilizaron los participantes

Los equipos participantes construyeron sus soluciones en torno al manejo de fuentes en varios idiomas, y no en torno a un único modelo. Según los artículos de sistema publicados junto con los resultados, los participantes documentaron generación aumentada por recuperación (RAG), procesamiento de evidencia entre idiomas, prompting estructurado, compresión de respuestas y estrategias de validación. Precisamente el conjunto de 32 grupos de informes corporativos y cuatro plantillas de preguntas por nivel obligaba a los sistemas a extraer un hecho de un documento en chino o griego y condensar la respuesta en una formulación breve y precisa en inglés.

Por qué esto importa para la IA financiera

FinMMEval2026 Task2 muestra dónde se sitúa hoy el límite de los modelos de lenguaje en finanzas: no en la generación de texto, sino en la extracción precisa de un hecho a partir de informes en un idioma desconocido. La clasificación tan ajustada —los 4 mejores dentro del 1%— es una señal de que el QA financiero multilingüe deja de ser tarea de un único modelo potente y se convierte en ingeniería de pipeline: recuperación, correspondencia entre idiomas, compresión. Para los bancos y fondos que trabajan con informes en varios idiomas, este es el referente de calidad más cercano.

Qué significa esto

El benchmark refleja la madurez de las preguntas y respuestas financieras multilingües: los líderes ya son casi indistinguibles según la métrica, y el progreso futuro se medirá en fracciones de un punto porcentual y en la calidad del manejo de las fuentes, y no en saltos de un único modelo.

Preguntas frecuentes

¿Qué es FinMMEval2026 Task2?

Es un benchmark competitivo de preguntas y respuestas financieras breves: el sistema recibe una pregunta en inglés junto con una selección de informes financieros y noticias en cinco idiomas, y devuelve una única respuesta condensada. El conjunto final contiene 256 preguntas.

¿En qué idiomas están los datos?

Las preguntas están formuladas en inglés, mientras que los documentos financieros y las noticias que las acompañan están en inglés, chino, japonés, español y griego. La tarea del sistema es extraer un hecho de fuentes en varios idiomas y dar una respuesta precisa.

¿Cómo se evaluaron y clasificaron los sistemas?

Las respuestas de referencia se mantuvieron ocultas durante el periodo de presentación de propuestas, y la clasificación final de 12 sistemas se construyó según la ROUGE-1 F1 macro-promediada a nivel de elemento. Los 4 primeros participantes quedan separados por menos de un punto porcentual en esta métrica.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Quieres dejar de leer sobre IA y empezar a usarla?

AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.

¿Qué te parece?
Cargando comentarios…