Учёные нашли у vision-language моделей аналог ангедонии человека при депрессии
Исследователи проверили, распространяется ли человекоподобность vision-language моделей на оценку вознаграждения, используя клинические тесты для ангедонии — симптома депрессии, связанного с прилежащим ядром мозга (NAc). Они нашли в моделях юниты, отвечающие за предвкушение награды, и показали: их пертурбация сдвигает модель к вариантам с меньшими усилиями и меньшей наградой, при этом базовые способности сохраняются.
AI-обработка оригинала arXiv cs.LG; редакция Hamidun News
Исследователи опубликовали на arXiv работу, в которой проверили, распространяется ли способность vision-language моделей улавливать человеческое поведение на оценку вознаграждения — с помощью клинических тестов, изначально разработанных для диагностики ангедонии и мотивационных нарушений при большом депрессивном расстройстве.
Как искали «центр вознаграждения» у модели
У человека ангедонию часто связывают с дисрегуляцией прилежащего ядра (nucleus accumbens, NAc) и более широкой дофаминовой системы вознаграждения мозга. Нейровизуализация локализует эти нарушения, но напрямую доказать причинно-следственную связь между активностью NAc и конкретными поведенческими симптомами до сих пор сложно даже на людях. Авторы перенесли эту логику на vision-language модели: с помощью методов из нейронауки они функционально выявили в моделях юниты, которые предвосхищают вознаграждение — аналог NAc, — а затем проверили их причинную роль через целевые пертурбации, то есть искусственные вмешательства в работу именно этих юнитов.
Что показали эксперименты
Пертурбация NAc-подобных юнитов вызывает у модели поведенческий эффект, зеркально похожий на ангедонию у людей: в задачах, где нужно выбирать между вариантами с разным соотношением усилий и награды (effort-based decision-making), модель начинает систематически предпочитать варианты с меньшими усилиями и меньшей наградой. При этом, что важно, базовая работоспособность модели не теряется: если убрать сам элемент выбора, основанного на награде, модель показывает обычные, базовые результаты — то есть дефицит специфичен именно для оценки и предвкушения вознаграждения, а не является общей потерей способностей. Результат также соотносится с клиническими шкалами ангедонии, включая DARS и MAP-SR.
Что это значит
Работа показывает, что в vision-language моделях можно обнаружить и целенаправленно менять контуры, функционально похожие на систему вознаграждения человеческого мозга. Для интерпретируемости ИИ это открывает путь к точечной диагностике «поведенческих» сбоев моделей, а для нейронауки — даёт ещё один инструмент проверки гипотез о механизмах ангедонии, которые сложно тестировать напрямую на людях.
Частые вопросы
Что такое ангедония?
Неспособность испытывать удовольствие и сниженная мотивация — один из ключевых симптомов большого депрессивного расстройства. У человека это состояние связывают с дисфункцией прилежащего ядра (nucleus accumbens) и дофаминовой системы вознаграждения мозга.
Теряет ли модель работоспособность после пертурбации?
Нет. Если убрать из задачи элемент выбора, основанного на вознаграждении, модель показывает обычные базовые результаты — сбой проявляется именно в решениях, которые требуют сопоставления усилий и награды.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.