NVIDIA abre os datasets Nemotron: 10 trilhões de tokens para treinar agentes de AI
Em 8 de julho de 2026, a NVIDIA lançou os datasets abertos Nemotron para agentes de AI: mais de 10 trilhões de tokens de pré-treinamento e milhões de exemplos rotulados em oito domínios, incluindo falhas na invocação de ferramentas. As personas sintéticas Nemotron-Personas cobrem 2,4 bilhões de pessoas de 10 países. A empresa também lançou o Prompt Atlas interativo para explorar o corpus.
Processado por IA de Hugging Face Blog; editado por Hamidun News
Em 8 de julho de 2026, a NVIDIA publicou no Hugging Face um post de pesquisa sobre dados abertos para agentes de IA, simultaneamente lançando conjuntos de dados Nemotron contendo mais de 10 trilhões de tokens de pré-treinamento e milhões de exemplos de pós-treinamento. Este é um dos maiores lançamentos públicos de dados de treinamento especificamente orientados para sistemas de agentes.
Por que os pesos do modelo sozinhos são insuficientes
O comportamento do agente de IA é determinado não apenas pelos pesos da rede neural—mas também pelos dados específicos em que foi treinado. Os benchmarks padrão e os corpora de texto geral não refletem a verdadeira complexidade das tarefas de agentes: cadeias de ações de múltiplos passos, uso de ferramentas, falhas e recuperação de erros.
Os conjuntos de dados Nemotron cobrem oito domínios-chave:
- Traços de engenharia de software
- Falhas no uso de ferramentas
- Raciocínio multi-passo
- Busca e recuperação de informação
- Segurança e controle de comportamento
- Simulação de usuários
- Execução de fluxo de trabalho
- Verificação de resposta
A seção de pré-treinamento excede 10 trilhões de tokens; a seção de pós-treinamento contém milhões de exemplos rotulados em múltiplos domínios. Particularmente valioso é a inclusão de dados de falhas—chamadas de ferramentas errôneas e cadeias de ações falhadas. A maioria dos conjuntos de dados abertos captura apenas cenários bem-sucedidos; os dados de falhas permitem que agentes aprendam recuperação em vez de apenas alcançar resultados na primeira tentativa.
Como os dados sintéticos protegem a confidencialidade
Um dos principais obstáculos no desenvolvimento de agentes corporativos de IA é a impossibilidade de compartilhar abertamente fluxos de trabalho reais. Pipelines internos, dados de clientes e lógica de negócios são fechados por definição: as empresas não podem publicar o que constitui sua vantagem competitiva.
Os dados sintéticos resolvem este problema: as organizações geram sinais de treinamento úteis a partir de processos reais sem revelar os próprios processos. Isto abre o caminho para participação em ecossistemas de dados abertos sem riscar vazamento de informação comercial.
A NVIDIA enfatiza que esta abordagem requer transparência: deve-se documentar o que foi gerado, em que base, e o que passou revisão de especialista. Os dados sintéticos não são uma solução universal—sua qualidade depende diretamente da correção dos modelos geradores e dos processos de validação.
"Os dados sintéticos permitem participação em ecossistemas de dados abertos sem revelar fluxos de trabalho confidenciais ou dados de clientes"—equipe
Nemotron.
Prompt Atlas e 2,4 bilhões de personas sintéticos
Para pesquisadores, a NVIDIA criou Nemotron Post-Training v3 Prompt Atlas—uma ferramenta visual interativa para explorar milhões de exemplos. Os dados são organizados por conjunto de dados, domínio e padrões de chamada de ferramentas, tornando o corpus não apenas um arquivo para download, mas um espaço para analisar distribuições e padrões.
Nemotron-Personas merece atenção separada—um conjunto de personas sintéticos que a partir de 8 de julho de 2026 cobre mais de 2,4 bilhões de pessoas de dez países. Os personas são "localmente fundamentados": refletem especificidade regional, padrões culturais e diversidade demográfica da população. Isto permite treinar agentes que entendem contexto local em solicitações—não apenas inglês técnico universal, mas padrões de comunicação característicos de regiões específicas.
O que isso significa
O lançamento dos conjuntos de dados Nemotron estabelece um novo padrão de abertura no desenvolvimento de agentes de IA. A inclusão de dados de falha de ferramentas, personas sintéticos e um atlas interativo sugere que a NVIDIA vê agentes não como chatbots aprimorados, mas como sistemas operando no mundo real com usuários reais e falhas reais. Equipes construindo agentes especializados agora têm uma base pronta para fine-tuning—sem necessidade de coletar anotações do zero.
Quer parar de ler sobre IA e começar a usar?
AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.