Privacidade de Dados
A privacidade de dados em IA refere-se às práticas, controles técnicos e requisitos legais que governam como informações pessoais são coletadas, armazenadas, usadas e protegidas durante o desenvolvimento e implantação de sistemas de IA. Cobre riscos específicos de IA, incluindo memorização de dados de treinamento e inferência de atributos sensíveis.
Sistemas de IA treinados em grandes conjuntos de dados frequentemente encontram informações pessoais — nomes, registros de saúde, comunicações e registros de comportamento — tanto como entradas deliberadas de treinamento quanto como inclusões incidentais em dados web coletados. A privacidade de dados governa quem tem o direito de controlar essas informações, sob quais condições podem ser usadas para treinamento de IA, por quanto tempo podem ser retidas e quais proteções se aplicam quando as saídas de IA podem expor ou inferir detalhes pessoais. Em estruturas regulatórias, "dados pessoais" é definido amplamente: o Regulamento Geral de Proteção de Dados da UE (GDPR) abrange qualquer informação que possa identificar um indivíduo direta ou indiretamente, incluindo atributos inferidos.
As medidas técnicas de privacidade em IA incluem privacidade diferencial — adicionar ruído matemático calibrado aos gradientes de treinamento para que o modelo não consiga reproduzir de forma confiável registros individuais de treinamento — e aprendizado federado, onde o treinamento ocorre localmente em dispositivos do usuário e apenas as atualizações de modelo agregadas são compartilhadas com um servidor central. No momento da inferência, controles de acesso, filtragem de saída e minimização de dados reduzem o risco de expor informações sensíveis. Legalmente, os mecanismos incluem requisitos de consentimento informado, direitos dos titulares de dados (acesso, exclusão e portabilidade), limitação de propósito e acordos contratuais de processamento de dados entre desenvolvedores de IA e fontes de dados.
Modelos de IA treinados em corpora em escala de internet demonstraram memorização mensurável — a capacidade de reproduzir textualmente passagens de texto de treinamento, incluindo informações de identificação pessoal, quando apropriadamente solicitados. Pesquisa de Carlini et al. (2021) mostrou que o GPT-2 poderia ser solicitado a produzir endereços de e-mail, números de telefone e nomes presentes em seus dados de treinamento. Além da memorização, sistemas de IA podem inferir atributos sensíveis como condições de saúde, visões políticas ou status financeiro a partir de entradas aparentemente inócuas, criando riscos secundários de privacidade que as regulamentações existentes não anteciparam originalmente.
Até 2026, o Ato de IA da UE adiciona obrigações específicas de IA sobre o GDPR, exigindo documentação das fontes de dados de treinamento e proibindo certos usos de dados pessoais sensíveis em sistemas de alto risco. A autoridade de proteção de dados da Itália (Garante) bloqueou temporariamente o ChatGPT em março de 2023 por preocupações com o GDPR, resultando em OpenAI implementando mecanismos de opt-out do usuário e solicitações de exclusão de dados para usuários europeus. A privacidade diferencial é padrão na Apple e Google para treinamento de modelo no dispositivo, embora sua adoção no pré-treinamento de grandes modelos de linguagem permaneça limitada devido ao compromisso entre precisão e privacidade em escala.