D2VBench: бенчмарк из 10 000 дилемм проверяет ценностное выравнивание LLM
Команда исследователей выложила на arXiv бенчмарк D2VBench — 10 000 сценариев повседневных дилемм, где сталкиваются несколько ценностей сразу. В основе — 158 вручную размеченных ценностных концепций, а оценка сочетает закрытые и открытые вопросы. Через бенчмарк уже прогнали 8 популярных языковых моделей; датасет открыт на GitHub.
AI-обработка оригинала arXiv cs.CL; редакция Hamidun News
Исследователи в июле 2026 года представили на arXiv бенчмарк D2VBench — инструмент для оценки ценностного выравнивания (value alignment) больших языковых моделей на 10 000 повседневных дилемм, опирающийся на 158 размеченных вручную ценностных концепций.
Что проверяет D2VBench
D2VBench оценивает, какие ценности стоят за ответами модели, когда в бытовой ситуации сталкиваются сразу несколько принципов — например, честность против заботы или личная выгода против общего блага. По мнению авторов, прежние наборы тестов плохо покрывали именно такие многофакторные конфликты и опирались на слишком упрощённые форматы оценки.
Каждый из 10 000 сценариев собирался поэтапно — в связке между языковыми моделями и людьми-разметчиками. В основе лежат 158 fine-grained ценностных концепций, размеченных вручную, что позволяет привязывать реакцию модели к конкретной ценностной категории, а не к общей «этичности».
- Объём: 10 000 сценариев реальных повседневных дилемм
- Основа разметки: 158 вручную аннотированных ценностных концепций
- Сборка: многоэтапная коллаборация LLM и людей
- Оценка: гибрид из закрытых (multiple-choice) и открытых (open-ended) вопросов
- Охват: протестированы 8 распространённых LLM
- Данные: датасет выложен на GitHub (tjunlp-lab/D2VBench)
Как устроена оценка
Оценка в D2VBench построена как гибрид: закрытые вопросы с вариантами ответа сочетаются с открытыми вопросами, где модель формулирует ответ свободно. Такой формат, по замыслу авторов, ловит не только «правильный» выбор, но и то, как модель обосновывает решение и расставляет приоритеты между конфликтующими ценностями.
Авторы прогнали через бенчмарк 8 распространённых языковых моделей. По их данным, D2VBench демонстрирует высокую надёжность и устойчивость и отражает выравнивание моделей по разным категориям и измерениям ценностей — то есть даёт более детальную картину, чем бинарная оценка «этично или нет».
«Существующие бенчмарки недостаточно охватывают ценностные дилеммы
повседневных сценариев с множественными конфликтами ценностей и используют упрощённые форматы оценки», — говорится в статье авторов D2VBench на arXiv.
Почему это важно
Ценностное выравнивание становится критичным по мере того, как LLM попадают в реальные бытовые сценарии — от советов по здоровью до семейных и рабочих конфликтов. D2VBench, как отмечается в описании на arXiv, задуман как более реалистичный и детализированный инструмент для исследований в этой области: он показывает не средний балл «безопасности», а поведение модели по конкретным ценностным осям.
Публикация датасета в открытом доступе на GitHub означает, что другие команды смогут воспроизвести результаты и прогнать через 10 000 дилемм собственные модели, а не только те 8, что протестировали авторы. Разбивка по 158 концепциям и двум форматам вопросов позволяет сравнивать модели не по одному числу, а по профилю ценностного поведения.
Что это значит
D2VBench переводит разговор о «безопасности» ИИ из плоскости общих деклараций в измеримую сетку из 158 ценностных концепций. Для разработчиков это способ увидеть, где именно модель проседает при конфликте ценностей, а не просто получить единый агрегированный балл.
Частые вопросы
Что такое D2VBench?
D2VBench — это бенчмарк для оценки ценностного выравнивания больших языковых моделей, состоящий из 10 000 сценариев повседневных дилемм и опирающийся на 158 вручную размеченных ценностных концепций.
Сколько сценариев в D2VBench?
Бенчмарк содержит 10 000 сценариев реальных повседневных дилемм, каждый из которых собирался в несколько этапов при участии языковых моделей и людей-разметчиков.
Где скачать датасет D2VBench?
Датасет выложен в открытый доступ на GitHub в репозитории tjunlp-lab/D2VBench — его можно использовать для тестирования собственных моделей.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.