FinMMEval 2026 Task 2: бенчмарк финансового QA на 5 языках, топ-4 систем в пределах 1%
Завершился бенчмарк FinMMEval 2026 Task 2 — соревнование по краткому финансовому вопрос-ответу на данных сразу на пяти языках. Итоговый набор — 256 вопросов, поровну между простым и экспертным уровнями. В рейтинге 12 систем, а лучшие четыре разделяет менее одного процентного пункта по метрике ROUGE-1 F1. Участники применяли RAG, кросс-язычную работу с источниками и сжатие ответов.
معالج بواسطة الذكاء الاصطناعي من arXiv cs.CL؛ بتحرير Hamidun News
FinMMEval2026 Task2 — وهي منافسة في الإجابة عن الأسئلة المالية القصيرة على بيانات متعددة اللغات — انتهت إلى نتائجها: ففي يوليو 2026 نشر المنظمون التصنيف النهائي لـ12 نظامًا، حيث يفصل بين أفضل أربعة أنظمة أقل من نقطة مئوية واحدة على مقياس ROUGE-1 F1 على مجموعة من 256 سؤالًا.
ما الذي يختبره المعيار المرجعي
يقيّم FinMMEval2026 Task2 مدى دقة إجابات أنظمة الذكاء الاصطناعي على الأسئلة المالية اعتمادًا على وثائق بخمس لغات في آن واحد. يربط كل بند من الاختبار سؤالًا بالإنجليزية بتقارير مالية وأخبار بالإنجليزية والصينية واليابانية والإسبانية واليونانية، ويجب على النظام أن يعيد إجابة واحدة موجزة بصيغة JSONL.
- المجموعة النهائية 256 سؤالًا، موزعة بالتساوي بين مستويي easy وexpert
- كل مستوى يضم 4 قوالب أسئلة، موزعة على 32 مجموعة من التقارير المؤسسية
- لغات البيانات المصدرية: الإنجليزية والصينية واليابانية والإسبانية واليونانية
- مقياس الترتيب: ROUGE-1 F1 بمتوسط macro لكل بند
- يضم التصنيف النهائي 12 نظامًا
كيف جرى تقييم الأنظمة
أخفى المنظمون الإجابات المرجعية خلال فترة استقبال المشاركات، ورتّبوا المشاركين وفق مقياس ROUGE-1 F1 بمتوسط macro على مستوى البند مقارنة بإجاباتهم المرجعية الخاصة. وتبيّن أن الفارق في القمة كان طفيفًا للغاية: يفصل بين أفضل 4 أنظمة أقل من نقطة مئوية واحدة على مقياس ROUGE-1 F1 — أي أن الأنظمة الرائدة متعادلة عمليًا، وأن اختيار البنية عند هذا الهامش يُحسم بأجزاء من نقطة مئوية.
«الأنظمة الأقوى متقاربة بشدة: يفصل بين أفضل 4 أنظمة أقل من نقطة مئوية واحدة على مقياس ROUGE-1 F1»، بحسب تقرير منظمي
FinMMEval2026 المنشور على arXiv.
ما الذي استخدمه المشاركون
بنت الفرق المشاركة حلولها حول التعامل مع مصادر متعددة اللغات، لا حول نموذج واحد. وبحسب أوراق الأنظمة المنشورة مع النتائج، وثّق المشاركون استخدام التوليد المعزز بالاسترجاع (RAG)، ومعالجة الأدلة عبر اللغات، والبرمجة الهيكلية للمطالبات (structured prompting)، وضغط الإجابات، واستراتيجيات التحقق. وكانت مجموعة الـ32 مجموعة من التقارير المؤسسية وقوالب الأسئلة الأربعة في كل مستوى هي بالتحديد ما أجبر الأنظمة على استخلاص حقيقة من وثيقة بالصينية أو اليونانية وصياغة الإجابة في عبارة قصيرة ودقيقة بالإنجليزية.
لماذا يهم هذا الذكاء الاصطناعي المالي
يُظهر FinMMEval2026 Task2 أين يقف اليوم حد نماذج اللغة في القطاع المالي: ليس في توليد النص، بل في استخلاص حقيقة بدقة من تقارير مكتوبة بلغة غير مألوفة. والتصنيف المتقارب — أفضل 4 أنظمة ضمن هامش 1% — إشارة إلى أن الإجابة عن الأسئلة المالية متعددة اللغات لم تعد مهمة نموذج واحد قوي، بل أصبحت هندسة خط معالجة (pipeline): استرجاع، ومطابقة عبر اللغات، وضغط. وبالنسبة للبنوك والصناديق التي تتعامل مع تقارير بعدة لغات، يمثل هذا أقرب مرجع لقياس الجودة.
ما الذي يعنيه هذا
يوثّق المعيار المرجعي نضج الإجابة عن الأسئلة المالية متعددة اللغات: فالأنظمة الرائدة أصبحت بالفعل شبه متطابقة وفق المقياس، وسيُقاس التقدم المقبل بأجزاء من نقطة مئوية وبجودة التعامل مع المصادر، لا بقفزات نموذج واحد.
الأسئلة الشائعة
ما هو FinMMEval2026 Task2؟
هو معيار مرجعي تنافسي للإجابة عن الأسئلة المالية القصيرة: يتلقى النظام سؤالًا بالإنجليزية إلى جانب مجموعة مختارة من التقارير المالية والأخبار بخمس لغات، ويعيد إجابة واحدة مختصرة. تضم المجموعة النهائية 256 سؤالًا.
بأي لغات تتوفر البيانات؟
الأسئلة مصاغة بالإنجليزية، أما الوثائق المالية والأخبار المرافقة لها فهي بالإنجليزية والصينية واليابانية والإسبانية واليونانية. مهمة النظام هي استخلاص حقيقة من مصادر متعددة اللغات وتقديم إجابة دقيقة.
كيف جرى تقييم الأنظمة وترتيبها؟
أُخفيت الإجابات المرجعية خلال فترة تقديم المشاركات، وبُني التصنيف النهائي لـ12 نظامًا وفق مقياس ROUGE-1 F1 بمتوسط macro على مستوى البند. يفصل بين أفضل 4 مشاركين أقل من نقطة مئوية واحدة وفق هذا المقياس.
هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟
AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.