arXiv cs.CL→ original

D2VBench: бенчмарк из 10 000 дилемм проверяет ценностное выравнивание LLM

Команда исследователей выложила на arXiv бенчмарк D2VBench — 10 000 сценариев повседневных дилемм, где сталкиваются несколько ценностей сразу. В основе — 158 вручную размеченных ценностных концепций, а оценка сочетает закрытые и открытые вопросы. Через бенчмарк уже прогнали 8 популярных языковых моделей; датасет открыт на GitHub.

Procesado por IA desde arXiv cs.CL; editado por Hamidun News
D2VBench: бенчмарк из 10 000 дилемм проверяет ценностное выравнивание LLM
Fuente: arXiv cs.CL. Collage: Hamidun News.
◐ Escuchar artículo

En julio de 2026, investigadores presentaron en arXiv el benchmark D2VBench, una herramienta para evaluar la alineación de valores (value alignment) de los grandes modelos de lenguaje en 10000 dilemas cotidianos, basada en 158 conceptos de valor etiquetados manualmente.

Qué evalúa D2VBench

D2VBench evalúa qué valores están detrás de las respuestas de un modelo cuando en una situación cotidiana chocan varios principios a la vez —por ejemplo, honestidad frente a cuidado, o beneficio personal frente al bien común. Según los autores, los conjuntos de pruebas anteriores cubrían mal precisamente este tipo de conflictos multifactoriales y se basaban en formatos de evaluación demasiado simplificados.

Cada uno de los 10000 escenarios se construyó por etapas, mediante la colaboración entre modelos de lenguaje y anotadores humanos. La base son 158 conceptos de valor de grano fino (fine-grained), etiquetados manualmente, lo que permite vincular la reacción del modelo a una categoría de valor concreta y no a una "eticidad" general.

  • Volumen: 10000 escenarios de dilemas cotidianos reales
  • Base de etiquetado: 158 conceptos de valor anotados manualmente
  • Construcción: colaboración multietapa entre LLM y personas
  • Evaluación: híbrido de preguntas cerradas (opción múltiple) y abiertas (open-ended)
  • Cobertura: se probaron 8 LLM habituales
  • Datos: el dataset está publicado en GitHub (tjunlp-lab/D2VBench)

Cómo funciona la evaluación

La evaluación en D2VBench está construida como un híbrido: las preguntas cerradas con opciones de respuesta se combinan con preguntas abiertas, donde el modelo formula la respuesta libremente. Este formato, según la intención de los autores, capta no solo la elección "correcta", sino también cómo el modelo justifica su decisión y prioriza entre valores en conflicto.

Los autores hicieron pasar por el benchmark 8 modelos de lenguaje habituales. Según sus datos, D2VBench demuestra alta fiabilidad y estabilidad, y refleja la alineación de los modelos en distintas categorías y dimensiones de valores; es decir, ofrece una imagen más detallada que una evaluación binaria de "ético o no ético".

"Los benchmarks existentes no cubren suficientemente los dilemas de

valor de escenarios cotidianos con múltiples conflictos de valores y utilizan formatos de evaluación simplificados", se afirma en el artículo de los autores de D2VBench en arXiv.

Por qué es importante

La alineación de valores se vuelve crítica a medida que los LLM entran en escenarios cotidianos reales, desde consejos de salud hasta conflictos familiares y laborales. D2VBench, según se indica en la descripción en arXiv, está concebido como una herramienta más realista y detallada para la investigación en este campo: muestra no una puntuación media de "seguridad", sino el comportamiento del modelo en ejes de valor concretos.

La publicación del dataset en acceso abierto en GitHub significa que otros equipos podrán reproducir los resultados y hacer pasar por los 10000 dilemas sus propios modelos, y no solo los 8 que probaron los autores. El desglose en 158 conceptos y dos formatos de preguntas permite comparar los modelos no por una sola cifra, sino por un perfil de comportamiento de valores.

Qué significa esto

D2VBench traslada la conversación sobre la "seguridad" de la IA del plano de las declaraciones generales a una cuadrícula medible de 158 conceptos de valor. Para los desarrolladores, es una forma de ver exactamente dónde falla el modelo ante un conflicto de valores, en lugar de simplemente obtener una única puntuación agregada.

Preguntas frecuentes

¿Qué es D2VBench?

D2VBench es un benchmark para evaluar la alineación de valores de los grandes modelos de lenguaje, compuesto por 10000 escenarios de dilemas cotidianos y basado en 158 conceptos de valor etiquetados manualmente.

¿Cuántos escenarios tiene D2VBench?

El benchmark contiene 10000 escenarios de dilemas cotidianos reales, cada uno de los cuales se construyó en varias etapas con la participación de modelos de lenguaje y anotadores humanos.

¿Dónde descargar el dataset de D2VBench?

El dataset está publicado en acceso abierto en GitHub, en el repositorio tjunlp-lab/D2VBench, y puede usarse para probar modelos propios.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?

Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).

¿Qué te parece?
Cargando comentarios…