Apple ML Research→ المصدر

Apple ML Research изучила alignment в мультимодальных LLM и их склонность к галлюцинациям

Apple ML Research опубликовала исследование о preference alignment в мультимодальных LLM. В отличие от текстовых моделей, MLLM галлюцинируют двояко: называют неверные факты или описывают изображения неточно. Цель alignment — привязать ответы модели к реальному содержанию картинки. Авторы называют это направление критически важным, но до сих пор малоизученным.

معالج بواسطة الذكاء الاصطناعي من Apple ML Research؛ بتحرير Hamidun News
Apple ML Research изучила alignment в мультимодальных LLM и их склонность к галлюцинациям
المصدر: Apple ML Research. كولاج: Hamidun News.
◐ استمع للمقال

نشرت Apple ML Research دراسةً شاملةً حول محاذاة التفضيلات (preference alignment) في نماذج اللغة متعددة الوسائط (MLLM) — وهي أنظمة قادرة على معالجة النصوص والصور في آنٍ واحد. يؤكد المؤلفون أن المحاذاة، التي باتت معياراً راسخاً لنماذج LLM النصية، لا تزال أقل دراسةً بكثير في السياق متعدد الوسائط.

لماذا تكون هلوسات MLLM أكثر تعقيداً من المعتاد

تختلف نماذج اللغة متعددة الوسائط في طريقة هلوستها عن نماذج LLM النصية. وفقاً لدراسة Apple ML Research، تتجلى الهلوسات في أنظمة فهم الصور على شكلين: الأخطاء الواقعية — حين تُقرّ النموذج بوقائع غير صحيحة عن العالم — والتناقض في المحتوى — حين يبدو الجواب مقنعاً لكنه يتعارض مع ما هو موجود فعلاً في الصورة.

النوع الثاني خطير بشكل خاص: إذا وصفت النموذج سيارةً زرقاء في صورة بأنها حمراء، أو صنّفت مشهداً صيفياً على أنه شتوي — فهذا ليس خطأً في المعرفة، بل خطأ في "الرؤية". وهذا بالتحديد ما يستهدفه alignment لأنظمة متعددة الوسائط.

«الهدف الأساسي من alignment لنماذج MLLM هو تشجيع هذه النماذج على تأسيس استجاباتها على معلومات الصورة»، كما جاء في منشور

Apple ML Research.

كيف يعمل Preference Alignment

يُعدّ preference alignment تقنيةً للضبط الدقيق، تُعرض فيها على النموذج أزواج من الإجابات ويُصنَّف أيها "أفضل" وفق معايير محددة. في نماذج LLM النصية، أصبح هذا النهج — بما في ذلك RLHF (Reinforcement Learning from Human Feedback) ومشتقاته — معياراً فعلياً منذ ظهور InstructGPT و ChatGPT. أما بالنسبة للأنظمة متعددة الوسائط، فلم تُجرَ دراسات منهجية مماثلة تقريباً حتى الآن.

الأطروحات الرئيسية للعمل:

  • يُعدّ preference alignment بالغ الأهمية لجودة LLM، غير أن تأثيره في MLLM لا يكاد يُدرس
  • في MLLM، يعالج alignment تحدياً إضافياً: ربط استجابة النموذج بالمحتوى المرئي الفعلي
  • تنقسم الهلوسات في MLLM إلى نوعين: واقعية ومرئية (تناقض مع الصورة)
  • تُجري Apple ML Research تحليلاً مقارناً منهجياً لتقنيات alignment المُطبَّقة على مهام فهم الصور

وفقاً للدراسة، يُعدّ هذا العمل من أوائل المحاولات الشاملة لسدّ الفجوة بين مدى فهم alignment لنماذج النصوص وبين ما هو معروف عن تأثيره على الأنظمة متعددة الوسائط.

لماذا هذا مهم للصناعة

تُستخدم النماذج متعددة الوسائط اليوم في التشخيص الطبي وإدارة المحتوى والمساعدين الشخصيين — من Google Lens إلى Apple Intelligence. في كل هذه السيناريوهات، تُكلّف هلوسة "رؤية ما ليس موجوداً" أضعاف تكلفة الخطأ النصي: فالتفسير الخاطئ لصورة أشعة سينية أو التعرف الخاطئ على جسم في الطريق له عواقب مباشرة.

تأتي دراسة Apple ML Research في لحظة تنتقل فيها الأنظمة متعددة الوسائط من النماذج الأولية المختبرية إلى النشر الواسع النطاق. وأصبح فهم كيفية تشكيل alignment لدقة "رؤية" النموذج سؤالاً جوهرياً لكامل الصناعة.

ماذا يعني هذا

يرصد عمل Apple ML Research فجوةً منهجية: تعكف الصناعة على تطوير ونشر نماذج متعددة الوسائط بنشاط، لكن آلية مواءمتها مع المحتوى الفعلي للصور ظلت قليلة الدراسة. إذا شكّلت نتائج الدراسة أساساً لأساليب تدريب جديدة، فسيؤثر ذلك مباشرةً على جودة المنتجات التي تعمل بالمحتوى المرئي — بما في ذلك Apple Intelligence والأنظمة المماثلة.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟

أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).

ما رأيك؟
جارٍ تحميل التعليقات…