ImagingBench a révélé les faiblesses de Gemini, GPT et Qwen dans les tâches de traitement d'images physiques
Les chercheurs ont créé ImagingBench—un benchmark de 20 tâches de photographie informatique et de traitement d'images pour tester les capacités des modèles d'IA modernes. Les tests ont montré que Gemini, GPT-5 et Qwen, malgré leurs fortes capacités sémantiques, restent significativement en retrait par rapport aux méthodes spécialisées dans les tâches de détection informatique (holographie, imagerie sans lentille et time-of-flight).
Traité par IA depuis arXiv cs.AI ; édité par Hamidun News
Les chercheurs ont présenté ImagingBench — un indice de référence systématique pour évaluer les capacités des modèles vision-langage (VLM) et de l'IA agente dans la résolution de tâches de photographie informatique et de traitement d'images. L'indice de référence comprend 20 tâches couvrant cinq catégories : optique géométrique et optique ondulatoire, traitement du signal d'image, reconstruction inverse, détection informatique et étalonnage.
Ce que l'indice de référence a révélé
Les tests de systèmes multimodaux propriétaires et ouverts de premier plan, notamment Gemini 3.1, GPT-5 et Qwen, ont montré que les modèles agents fonctionnent systématiquement moins bien que les méthodes spécialisées. Les différences sont particulièrement frappantes dans les tâches de détection informatique, telles que l'imagerie sans lentille, la reconstruction basée sur les événements, l'imagerie en vol du temps et l'holographie.
- 20 tâches de photographie informatique dans l'indice de référence
- Testé Gemini, GPT-5, Qwen et d'autres VLM
- Les conseils agentiques (Planner) n'ont fourni que des améliorations modestes
- Résultats visuellement plausibles mais physiquement inexacts
L'écart entre la sémantique et la physique
Les modèles génèrent souvent des résultats visuellement acceptables qui semblent corrects à l'œil humain, mais lorsqu'ils sont vérifiés par rapport à des métriques basées sur les références, ils affichent une mauvaise qualité. Cela révèle un énorme écart entre la capacité des modèles à travailler avec des tâches visuelles sémantiques (ce qu'ils voient) et la visualisation physiquement fondée (comment fonctionnent les systèmes physiques).
Feuille de route de développement
ImagingBench fournit un banc d'essai unifié pour mesurer les progrès de l'IA agente en photographie informatique. Cela permet aux chercheurs de suivre systématiquement les améliorations de la capacité des modèles LLM modernes à comprendre et à résoudre des tâches physiques par rapport à des tâches purement sémantiques.
Ce que cela signifie
La découverte montre que les modèles LLM actuels fonctionnent bien avec les tâches visuelles sémantiques mais restent insuffisamment adaptés aux problèmes physiquement fondés. Cela ouvre de nouvelles directions pour l'amélioration du modèle et souligne la nécessité d'approches spécialisées en photographie informatique, même à l'ère des agents d'IA à usage général.
Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?
AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.
L'essentiel de l'IA — une fois par semaine
Sept actus qui ont vraiment compté, choisies à la main. Sans bruit ni communiqués.
C'est fait ! Vérifiez votre boîte mail pour la confirmation.