ImagingBench выявил слабости Gemini, GPT и Qwen в физических задачах обработки изображений
Исследователи создали ImagingBench — бенчмарк из 20 задач вычислительной фотографии и обработки изображений для проверки возможностей современных AI-моделей. Тестирование показало, что Gemini, GPT-5 и Qwen, несмотря на сильные семантические способности, значительно отстают от специализированных методов на задачах computational sensing (голографии, лензлесс-визуализации и time-of-flight).
AI-обработка оригинала arXiv cs.AI; редакция Hamidun News
Исследователи представили ImagingBench — систематический бенчмарк для оценки возможностей видение-языковых моделей (VLM) и агентного AI при решении задач вычислительной фотографии и обработки изображений. Бенчмарк включает 20 задач, охватывающих пять категорий: оптика луча и волновая оптика, обработка сигналов изображений, обратная реконструкция, computational sensing и калибровка.
Что показал бенчмарк
Тестирование ведущих проприетарных и открытых мультимодальных систем, включая Gemini 3.1, GPT-5 и Qwen, показало, что агентные модели последовательно уступают специализированным методам. Особенно заметны различия в computational sensing задачах, таких как лензлесс-визуализация, event-based реконструкция, time-of-flight визуализация и голография.
- 20 вычислительно-фотографических задач в бенчмарке
- Тестировались Gemini, GPT-5, Qwen и другие VLM
- Agentive guidance (Planner) дал лишь скромные улучшения
- Визуально правдоподобные, но физически неточные результаты
Разница между семантикой и физикой
Модели часто генерируют визуально приемлемые результаты, которые выглядят правильно человеческому глазу, но при проверке на reference-based метриках показывают низкое качество. Это выявляет огромный разрыв между способностью моделей работать с семантическими визуальными задачами (что они видят) и физически обоснованной визуализацией (как работают физические системы).
Планы развития
ImagingBench предоставляет унифицированный стенд для измерения прогресса агентного AI в вычислительной фотографии. Это позволяет исследователям систематически отслеживать улучшение способности современных LLM-моделей понимать и решать физические задачи в отличие от чисто семантических.
Что это значит
Открытие показывает, что текущие LLM-модели хорошо работают с семантическими визуальными задачами, но остаются недостаточно адаптированы к физически обоснованным проблемам. Это открывает новые направления для улучшения моделей и указывает на необходимость специализированных подходов в вычислительной фотографии, даже в эру общих AI-агентов.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.