arXiv cs.CL→ original

Como as redes neurais entendem os valores de diferentes países: um conjunto de dados de 500 mil exemplos

Modelos de linguagem são tendenciosos em direção aos valores ocidentais—e este é um problema sistêmico. Pesquisadores apresentaram PLURAL: ~500 mil exemplos de preferências de 20 países baseados na Integrated Values Survey (92 nações). O ajuste fino do modelo no conjunto de dados reduz o erro de alinhamento cultural em 27,7%. Em um teste cego, 176 participantes da Índia, Brasil e Japão consideraram respostas PLURAL mais precisas para sua cultura.

Processado por IA de arXiv cs.CL; editado por Hamidun News
Como as redes neurais entendem os valores de diferentes países: um conjunto de dados de 500 mil exemplos
Fonte: arXiv cs.CL. Colagem: Hamidun News.
◐ Ouvir artigo

Um conjunto de dados foi publicado para treinar redes neurais: uma coleção de 500.000 exemplos de preferências cobrindo os valores de 20 países, para que os modelos de linguagem reflitam a cosmovisão não apenas de usuários ocidentais.

Por que os modelos de IA são tendenciosos em direção ao

Ocidente?

A maioria dos modelos de linguagem modernos são treinados principalmente em textos em inglês e calibrados de acordo com as preferências de anotadores americanos e europeus. Quando esses modelos raciocinam sobre papéis familiares, atitudes em relação ao poder, religião ou direitos individuais, eles sistematicamente subestimam os sistemas de valores do Sul Global, Ásia e Oriente Médio.

Assistentes de IA, chatbots e sistemas educacionais são cada vez mais usados fora dos EUA — e o viés de cosmovisão é sentido diretamente pelos usuários. Em um teste cego de autores do PLURAL, participantes da Índia, Brasil e Japão observaram que as respostas padrão de LLM soavam como algo americano.

Como o conjunto de dados PLURAL é estruturado

No cerne do PLURAL está o Integrated Values Survey (IVS), uma pesquisa sociológica representativa de 92 países. Os pesquisadores desenvolveram um pipeline de duas etapas: as respostas de respondentes reais são transformadas em cenários temáticos, e então cada cenário recebe um par de classificações — mais e menos alinhadas com os valores de uma determinada cultura.

Fatos-chave sobre o conjunto de dados:

  • ~500.000 exemplos de preferências na primeira versão pública
  • Cobre 20 países de diferentes regiões do mundo
  • Construído em IVS — uma pesquisa de 92 estados
  • Reduz o erro absoluto médio do perfil cultural em 27,7% em comparação com modelos de linha de base fortes
  • 176 participantes de teste cego da Índia, Brasil e Japão reconheceram as respostas do PLURAL como mais precisas para sua cultura

Os autores validaram o PLURAL usando três métodos: validação em nível de dados (se as diferenças entre países da pesquisa original são preservadas), avaliação automática da precisão do ajuste fino e testes cegos com participantes reais em três países.

Por que isso é importante para desenvolvedores de produtos de IA

O processo de alinhamento de modelos de linguagem atualmente é construído principalmente através do RLHF com preferências de anotadores ocidentais. Para empresas que lançam produtos de IA na Índia, Brasil ou países árabes, isso significa: o modelo por padrão pode fornecer respostas que são culturalmente percebidas como alienígenas ou inadequadas.

A solução tradicional — contratar anotadores locais em cada país — é cara e escala mal. PLURAL oferece um caminho alternativo: usar dados de pesquisas sociológicas representativas como proxy para preferências culturais. O conjunto de dados é publicado em acesso aberto no HuggingFace.

O que isso significa

PLURAL é o primeiro recurso público em larga escala que permite treinar deliberadamente um modelo de linguagem aos valores de um país específico sem envolver equipes de anotação separadas. Se a abordagem provar ser reproduzível, poderia mudar a forma como as empresas de IA localizam modelos para mercados não-ocidentais.

Perguntas frequentes

Quanto PLURAL melhora o alinhamento cultural?

O ajuste fino no PLURAL reduz o erro absoluto médio (MAE) do perfil cultural do modelo em 27,7% em comparação com modelos de linha de base fortes — este é o resultado da avaliação automática descrita no pré-impressão.

Quais países participaram do teste cego?

Os testes cegos foram conduzidos em três países: Índia, Brasil e Japão. Envolveu 176 avaliadores que compararam as respostas do PLURAL com as respostas padrão do LLM quanto ao alinhamento com os valores da cultura nacional de cada um.

Por que os modelos de linguagem são tendenciosos em direção ao

Ocidente? A maioria dos modelos de linguagem modernos são treinados principalmente em textos em inglês e calibrados de acordo com as preferências de anotadores americanos e europeus.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Quer parar de ler sobre IA e começar a usar?

AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.

O que você acha?
Carregando comentários…