ImagingBench reveló debilidades de Gemini, GPT y Qwen en tareas físicas de procesamiento de imágenes
Los investigadores crearon ImagingBench—un benchmark de 20 tareas de fotografía computacional y procesamiento de imágenes para probar las capacidades de los modelos de IA modernos. Las pruebas mostraron que Gemini, GPT-5 y Qwen, a pesar de sus fuertes capacidades semánticas, se quedan significativamente atrás de los métodos especializados en tareas de sensores computacionales (holografía, imágenes sin lente y time-of-flight).
Procesado por IA desde arXiv cs.AI; editado por Hamidun News
Los investigadores presentaron ImagingBench, un punto de referencia sistemático para evaluar las capacidades de los modelos de visión-lenguaje (VLM) e IA agentiva en la resolución de tareas de fotografía computacional y procesamiento de imágenes. El punto de referencia incluye 20 tareas que cubren cinco categorías: óptica de rayos y óptica ondulatoria, procesamiento de señales de imagen, reconstrucción inversa, detección computacional y calibración.
Qué reveló el punto de referencia
Las pruebas de sistemas multimodales propietarios y abiertos líderes, incluidos Gemini 3.1, GPT-5 y Qwen, mostraron que los modelos agentivos funcionan consistentemente peor que los métodos especializados. Las diferencias son particularmente notables en tareas de detección computacional, como imágenes sin lentes, reconstrucción basada en eventos, imágenes de tiempo de vuelo y holografía.
- 20 tareas de fotografía computacional en el punto de referencia
- Probados Gemini, GPT-5, Qwen y otros VLM
- La orientación agentiva (Planner) proporcionó solo mejoras modestas
- Resultados visualmente plausibles pero físicamente imprecisos
La brecha entre semántica y física
Los modelos a menudo generan resultados visualmente aceptables que parecen correctos al ojo humano, pero cuando se verifican contra métricas basadas en referencias muestran baja calidad. Esto revela una brecha masiva entre la capacidad de los modelos para trabajar con tareas visuales semánticas (lo que ven) y la visualización físicamente fundamentada (cómo funcionan los sistemas físicos).
Hoja de ruta de desarrollo
ImagingBench proporciona un banco de pruebas unificado para medir el progreso de la IA agentiva en fotografía computacional. Esto permite a los investigadores rastrear sistemáticamente las mejoras en la capacidad de los modelos LLM modernos para comprender y resolver tareas físicas en lugar de puramente semánticas.
Qué significa esto
El descubrimiento muestra que los modelos LLM actuales funcionan bien con tareas visuales semánticas pero permanecen insuficientemente adaptados a problemas fundamentados físicamente. Esto abre nuevas direcciones para la mejora del modelo e indica la necesidad de enfoques especializados en fotografía computacional, incluso en la era de agentes de IA de propósito general.
¿Quieres dejar de leer sobre IA y empezar a usarla?
AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.