arXiv cs.AI→ original

ImagingBench reveló debilidades de Gemini, GPT y Qwen en tareas físicas de procesamiento de imágenes

Los investigadores crearon ImagingBench—un benchmark de 20 tareas de fotografía computacional y procesamiento de imágenes para probar las capacidades de los modelos de IA modernos. Las pruebas mostraron que Gemini, GPT-5 y Qwen, a pesar de sus fuertes capacidades semánticas, se quedan significativamente atrás de los métodos especializados en tareas de sensores computacionales (holografía, imágenes sin lente y time-of-flight).

Procesado por IA desde arXiv cs.AI; editado por Hamidun News
ImagingBench reveló debilidades de Gemini, GPT y Qwen en tareas físicas de procesamiento de imágenes
Fuente: arXiv cs.AI. Collage: Hamidun News.
◐ Escuchar artículo

Los investigadores presentaron ImagingBench, un punto de referencia sistemático para evaluar las capacidades de los modelos de visión-lenguaje (VLM) e IA agentiva en la resolución de tareas de fotografía computacional y procesamiento de imágenes. El punto de referencia incluye 20 tareas que cubren cinco categorías: óptica de rayos y óptica ondulatoria, procesamiento de señales de imagen, reconstrucción inversa, detección computacional y calibración.

Qué reveló el punto de referencia

Las pruebas de sistemas multimodales propietarios y abiertos líderes, incluidos Gemini 3.1, GPT-5 y Qwen, mostraron que los modelos agentivos funcionan consistentemente peor que los métodos especializados. Las diferencias son particularmente notables en tareas de detección computacional, como imágenes sin lentes, reconstrucción basada en eventos, imágenes de tiempo de vuelo y holografía.

  • 20 tareas de fotografía computacional en el punto de referencia
  • Probados Gemini, GPT-5, Qwen y otros VLM
  • La orientación agentiva (Planner) proporcionó solo mejoras modestas
  • Resultados visualmente plausibles pero físicamente imprecisos

La brecha entre semántica y física

Los modelos a menudo generan resultados visualmente aceptables que parecen correctos al ojo humano, pero cuando se verifican contra métricas basadas en referencias muestran baja calidad. Esto revela una brecha masiva entre la capacidad de los modelos para trabajar con tareas visuales semánticas (lo que ven) y la visualización físicamente fundamentada (cómo funcionan los sistemas físicos).

Hoja de ruta de desarrollo

ImagingBench proporciona un banco de pruebas unificado para medir el progreso de la IA agentiva en fotografía computacional. Esto permite a los investigadores rastrear sistemáticamente las mejoras en la capacidad de los modelos LLM modernos para comprender y resolver tareas físicas en lugar de puramente semánticas.

Qué significa esto

El descubrimiento muestra que los modelos LLM actuales funcionan bien con tareas visuales semánticas pero permanecen insuficientemente adaptados a problemas fundamentados físicamente. Esto abre nuevas direcciones para la mejora del modelo e indica la necesidad de enfoques especializados en fotografía computacional, incluso en la era de agentes de IA de propósito general.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Quieres dejar de leer sobre IA y empezar a usarla?

AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.

¿Qué te parece?
Cargando comentarios…