arXiv cs.AI→ المصدر

كشف ImagingBench عن نقاط ضعف Gemini و GPT و Qwen في مهام معالجة الصور الفيزيائية

قام الباحثون بإنشاء ImagingBench—مقياساً يتضمن 20 مهمة تصوير حسابي ومعالجة صور لاختبار قدرات نماذج الذكاء الاصطناعي الحديثة. أظهرت الاختبارات أن Gemini و GPT-5 و Qwen، رغم قدراتهما الدلالية القوية، تتخلف بشكل كبير عن الطرق المتخصصة في مهام الاستشعار الحسابي (تصوير الهولوغرافي والتصوير بدون عدسة وtime-of-flight).

معالج بواسطة الذكاء الاصطناعي من arXiv cs.AI؛ بتحرير Hamidun News
كشف ImagingBench عن نقاط ضعف Gemini و GPT و Qwen في مهام معالجة الصور الفيزيائية
المصدر: arXiv cs.AI. كولاج: Hamidun News.
◐ استمع للمقال

قدم الباحثون ImagingBench — معيارًا منهجيًا لتقييم قدرات نماذج الرؤية-اللغة (VLMs) والذكاء الاصطناعي الوكيل في حل مهام التصوير الفوتوغرافي الحاسوبي ومعالجة الصور. يتضمن المعيار 20 مهمة تغطي خمس فئات: بصريات الشعاع والبصريات الموجية ومعالجة إشارات الصور وإعادة البناء العكسية والكشف الحاسوبي والمعايرة.

ما كشفه المعيار

أظهر اختبار الأنظمة متعددة الأنماط المملوكة والمفتوحة الرائدة، بما في ذلك Gemini 3.1 و GPT-5 و Qwen، أن النماذج الوكيلة تؤدي بشكل متسق أسوأ من الطرق المتخصصة. الفروقات ملحوظة بشكل خاص في مهام الكشف الحاسوبي، مثل التصوير بدون عدسة وإعادة البناء القائمة على الأحداث والتصوير بطيران الوقت والهولوغرافيا.

  • 20 مهمة تصوير فوتوغرافي حاسوبي في المعيار
  • تم اختبار Gemini و GPT-5 و Qwen وأنظمة VLM أخرى
  • التوجيه الوكيل (Planner) وفر فقط تحسينات متواضعة
  • نتائج معقولة بصريًا لكن غير دقيقة فيزيائيًا

الفجوة بين الدلالات والفيزياء

غالباً ما تُنتج النماذج نتائج مقبولة بصريًا تبدو صحيحة للعين البشرية، لكن عند فحصها مقابل المقاييس المرجعية تُظهر جودة منخفضة. يكشف هذا عن فجوة ضخمة بين قدرة النماذج على العمل مع المهام البصرية الدلالية (ما تراه) والتصور المستند فيزيائيًا (كيف تعمل الأنظمة الفيزيائية).

خارطة الطريق التطويرية

يوفر ImagingBench منصة اختبار موحدة لقياس تقدم الذكاء الاصطناعي الوكيل في التصوير الفوتوغرافي الحاسوبي. يسمح هذا للباحثين بتتبع تحسينات القدرة على فهم وحل المهام الفيزيائية من قبل نماذج LLM الحديثة بدلاً من المهام الدلالية البحتة بشكل منهجي.

ماذا يعني هذا

يُظهر الاكتشاف أن نماذج LLM الحالية تعمل بشكل جيد مع المهام البصرية الدلالية لكنها تبقى غير مكيفة بشكل كافٍ مع المشاكل المستندة فيزيائيًا. يفتح هذا اتجاهات جديدة لتحسين النموذج ويشير إلى الحاجة إلى نهج متخصصة في التصوير الفوتوغرافي الحاسوبي، حتى في عصر وكلاء الذكاء الاصطناعي متعددة الأغراض.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟

AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.

ما رأيك؟
جارٍ تحميل التعليقات…