arXiv cs.AI→ original

ImagingBench a révélé les faiblesses de Gemini, GPT et Qwen dans les tâches de traitement d'images physiques

Les chercheurs ont créé ImagingBench—un benchmark de 20 tâches de photographie informatique et de traitement d'images pour tester les capacités des modèles d'IA modernes. Les tests ont montré que Gemini, GPT-5 et Qwen, malgré leurs fortes capacités sémantiques, restent significativement en retrait par rapport aux méthodes spécialisées dans les tâches de détection informatique (holographie, imagerie sans lentille et time-of-flight).

Traité par IA depuis arXiv cs.AI ; édité par Hamidun News
ImagingBench a révélé les faiblesses de Gemini, GPT et Qwen dans les tâches de traitement d'images physiques
Source : arXiv cs.AI. Collage: Hamidun News.
◐ Écouter l'article

Les chercheurs ont présenté ImagingBench — un indice de référence systématique pour évaluer les capacités des modèles vision-langage (VLM) et de l'IA agente dans la résolution de tâches de photographie informatique et de traitement d'images. L'indice de référence comprend 20 tâches couvrant cinq catégories : optique géométrique et optique ondulatoire, traitement du signal d'image, reconstruction inverse, détection informatique et étalonnage.

Ce que l'indice de référence a révélé

Les tests de systèmes multimodaux propriétaires et ouverts de premier plan, notamment Gemini 3.1, GPT-5 et Qwen, ont montré que les modèles agents fonctionnent systématiquement moins bien que les méthodes spécialisées. Les différences sont particulièrement frappantes dans les tâches de détection informatique, telles que l'imagerie sans lentille, la reconstruction basée sur les événements, l'imagerie en vol du temps et l'holographie.

  • 20 tâches de photographie informatique dans l'indice de référence
  • Testé Gemini, GPT-5, Qwen et d'autres VLM
  • Les conseils agentiques (Planner) n'ont fourni que des améliorations modestes
  • Résultats visuellement plausibles mais physiquement inexacts

L'écart entre la sémantique et la physique

Les modèles génèrent souvent des résultats visuellement acceptables qui semblent corrects à l'œil humain, mais lorsqu'ils sont vérifiés par rapport à des métriques basées sur les références, ils affichent une mauvaise qualité. Cela révèle un énorme écart entre la capacité des modèles à travailler avec des tâches visuelles sémantiques (ce qu'ils voient) et la visualisation physiquement fondée (comment fonctionnent les systèmes physiques).

Feuille de route de développement

ImagingBench fournit un banc d'essai unifié pour mesurer les progrès de l'IA agente en photographie informatique. Cela permet aux chercheurs de suivre systématiquement les améliorations de la capacité des modèles LLM modernes à comprendre et à résoudre des tâches physiques par rapport à des tâches purement sémantiques.

Ce que cela signifie

La découverte montre que les modèles LLM actuels fonctionnent bien avec les tâches visuelles sémantiques mais restent insuffisamment adaptés aux problèmes physiquement fondés. Cela ouvre de nouvelles directions pour l'amélioration du modèle et souligne la nécessité d'approches spécialisées en photographie informatique, même à l'ère des agents d'IA à usage général.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?

AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.

Qu'en pensez-vous ?
Chargement des commentaires…