D2VBench: бенчмарк из 10 000 дилемм проверяет ценностное выравнивание LLM
Команда исследователей выложила на arXiv бенчмарк D2VBench — 10 000 сценариев повседневных дилемм, где сталкиваются несколько ценностей сразу. В основе — 158 вручную размеченных ценностных концепций, а оценка сочетает закрытые и открытые вопросы. Через бенчмарк уже прогнали 8 популярных языковых моделей; датасет открыт на GitHub.
Processado por IA de arXiv cs.CL; editado por Hamidun News
Em julho de 2026, pesquisadores apresentaram no arXiv o benchmark D2VBench — uma ferramenta para avaliar o alinhamento de valores (value alignment) de grandes modelos de linguagem em 10000 dilemas cotidianos, baseada em 158 conceitos de valor rotulados manualmente.
O que o D2VBench avalia
O D2VBench avalia quais valores estão por trás das respostas de um modelo quando, em uma situação cotidiana, vários princípios entram em choque ao mesmo tempo — por exemplo, honestidade versus cuidado, ou ganho pessoal versus bem comum. Segundo os autores, os conjuntos de testes anteriores cobriam mal exatamente esses conflitos multifatoriais e se baseavam em formatos de avaliação excessivamente simplificados.
Cada um dos 10000 cenários foi montado em etapas — em uma colaboração entre modelos de linguagem e anotadores humanos. A base são 158 conceitos de valor de granularidade fina (fine-grained), rotulados manualmente, o que permite vincular a reação do modelo a uma categoria de valor específica, e não a uma "eticidade" geral.
- Volume: 10000 cenários de dilemas cotidianos reais
- Base de rotulagem: 158 conceitos de valor anotados manualmente
- Montagem: colaboração multietapas entre LLMs e pessoas
- Avaliação: híbrido de perguntas fechadas (múltipla escolha) e abertas (open-ended)
- Cobertura: 8 LLMs comuns foram testados
- Dados: o dataset está publicado no GitHub (tjunlp-lab/D2VBench)
Como funciona a avaliação
A avaliação no D2VBench é construída como um híbrido: perguntas fechadas com opções de resposta são combinadas com perguntas abertas, em que o modelo formula a resposta livremente. Esse formato, segundo a intenção dos autores, capta não apenas a escolha "correta", mas também como o modelo justifica a decisão e prioriza entre valores conflitantes.
Os autores passaram pelo benchmark 8 modelos de linguagem comuns. Segundo os dados deles, o D2VBench demonstra alta confiabilidade e estabilidade, e reflete o alinhamento dos modelos em diferentes categorias e dimensões de valores — ou seja, oferece um retrato mais detalhado do que uma avaliação binária de "ético ou não".
"Os benchmarks existentes não cobrem suficientemente os dilemas de
valor de cenários cotidianos com múltiplos conflitos de valores e usam formatos de avaliação simplificados", afirma o artigo dos autores do D2VBench no arXiv.
Por que isso importa
O alinhamento de valores torna-se crítico à medida que os LLMs entram em cenários cotidianos reais — de conselhos de saúde a conflitos familiares e de trabalho. O D2VBench, conforme indicado na descrição no arXiv, foi concebido como uma ferramenta de pesquisa mais realista e detalhada nessa área: ele mostra não uma pontuação média de "segurança", mas o comportamento do modelo em eixos de valor específicos.
A publicação do dataset em acesso aberto no GitHub significa que outras equipes poderão reproduzir os resultados e passar seus próprios modelos pelos 10000 dilemas, e não apenas os 8 testados pelos autores. A divisão em 158 conceitos e dois formatos de pergunta permite comparar os modelos não por um único número, mas por um perfil de comportamento de valores.
O que isso significa
O D2VBench desloca a conversa sobre a "segurança" da IA do plano das declarações gerais para uma grade mensurável de 158 conceitos de valor. Para os desenvolvedores, é uma forma de ver exatamente onde o modelo falha diante de um conflito de valores, em vez de simplesmente obter uma única pontuação agregada.
Perguntas frequentes
O que é o D2VBench?
O D2VBench é um benchmark para avaliar o alinhamento de valores de grandes modelos de linguagem, composto por 10000 cenários de dilemas cotidianos e baseado em 158 conceitos de valor rotulados manualmente.
Quantos cenários tem o D2VBench?
O benchmark contém 10000 cenários de dilemas cotidianos reais, cada um dos quais foi montado em várias etapas com a participação de modelos de linguagem e anotadores humanos.
Onde baixar o dataset do D2VBench?
O dataset está publicado em acesso aberto no GitHub, no repositório tjunlp-lab/D2VBench — pode ser usado para testar modelos próprios.
Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?
Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.