arXiv cs.AI→ оригинал

ImagingBench выявил слабости Gemini, GPT и Qwen в физических задачах обработки изображений

Исследователи создали ImagingBench — бенчмарк из 20 задач вычислительной фотографии и обработки изображений для проверки возможностей современных AI-моделей. Тестирование показало, что Gemini, GPT-5 и Qwen, несмотря на сильные семантические способности, значительно отстают от специализированных методов на задачах computational sensing (голографии, лензлесс-визуализации и time-of-flight).

AI-обработка оригинала arXiv cs.AI; редакция Hamidun News
ImagingBench выявил слабости Gemini, GPT и Qwen в физических задачах обработки изображений
Источник: arXiv cs.AI. Коллаж: Hamidun News.
◐ Слушать статью

Исследователи представили ImagingBench — систематический бенчмарк для оценки возможностей видение-языковых моделей (VLM) и агентного AI при решении задач вычислительной фотографии и обработки изображений. Бенчмарк включает 20 задач, охватывающих пять категорий: оптика луча и волновая оптика, обработка сигналов изображений, обратная реконструкция, computational sensing и калибровка.

Что показал бенчмарк

Тестирование ведущих проприетарных и открытых мультимодальных систем, включая Gemini 3.1, GPT-5 и Qwen, показало, что агентные модели последовательно уступают специализированным методам. Особенно заметны различия в computational sensing задачах, таких как лензлесс-визуализация, event-based реконструкция, time-of-flight визуализация и голография.

  • 20 вычислительно-фотографических задач в бенчмарке
  • Тестировались Gemini, GPT-5, Qwen и другие VLM
  • Agentive guidance (Planner) дал лишь скромные улучшения
  • Визуально правдоподобные, но физически неточные результаты

Разница между семантикой и физикой

Модели часто генерируют визуально приемлемые результаты, которые выглядят правильно человеческому глазу, но при проверке на reference-based метриках показывают низкое качество. Это выявляет огромный разрыв между способностью моделей работать с семантическими визуальными задачами (что они видят) и физически обоснованной визуализацией (как работают физические системы).

Планы развития

ImagingBench предоставляет унифицированный стенд для измерения прогресса агентного AI в вычислительной фотографии. Это позволяет исследователям систематически отслеживать улучшение способности современных LLM-моделей понимать и решать физические задачи в отличие от чисто семантических.

Что это значит

Открытие показывает, что текущие LLM-модели хорошо работают с семантическими визуальными задачами, но остаются недостаточно адаптированы к физически обоснованным проблемам. Это открывает новые направления для улучшения моделей и указывает на необходимость специализированных подходов в вычислительной фотографии, даже в эру общих AI-агентов.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…