Hugging Face Blog→ original

NVIDIA ouvre les datasets Nemotron : 10 000 milliards de tokens pour entraîner des agents AI

Le 8 juillet 2026, NVIDIA a publié les datasets ouverts Nemotron pour les agents AI : plus de 10 000 milliards de tokens de pré-entraînement et des millions d’exemples annotés dans huit domaines, y compris des échecs d’appel d’outils. Les personas synthétiques Nemotron-Personas couvrent 2,4 milliards de personnes dans 10 pays. L’entreprise a aussi lancé le Prompt Atlas interactif pour explorer le corpus.

Traité par IA depuis Hugging Face Blog ; édité par Hamidun News
NVIDIA ouvre les datasets Nemotron : 10 000 milliards de tokens pour entraîner des agents AI
Source : Hugging Face Blog. Collage: Hamidun News.
◐ Écouter l'article

Le 8 juillet 2026, NVIDIA a publié sur Hugging Face un article de recherche sur les données ouvertes pour les agents d'IA, tout en lançant simultanément les ensembles de données Nemotron contenant plus de 10 billions de tokens de pré-entraînement et des millions d'exemples de post-entraînement. Il s'agit de l'un des plus importants lancements publics de données d'entraînement spécifiquement orientées vers les systèmes d'agents.

Pourquoi les poids du modèle seuls sont insuffisants

Le comportement d'un agent d'IA est déterminé non seulement par les poids du réseau de neurones—mais aussi par les données spécifiques sur lesquelles il a été entraîné. Les benchmarks standards et les corpus textuels généraux ne reflètent pas la véritable complexité des tâches d'agents : les chaînes d'actions à plusieurs étapes, l'utilisation d'outils, les défaillances et la récupération après erreurs.

Les ensembles de données Nemotron couvrent huit domaines clés :

  • Traçages d'ingénierie logicielle
  • Défaillances d'utilisation d'outils
  • Raisonnement multi-étapes
  • Recherche et récupération d'informations
  • Sécurité et contrôle comportemental
  • Simulation d'utilisateurs
  • Exécution de workflows
  • Vérification des réponses

La section de pré-entraînement dépasse 10 billions de tokens ; la section de post-entraînement contient des millions d'exemples étiquetés sur plusieurs domaines. Particulièrement précieuse est l'inclusion de données d'échec—les appels d'outils erronés et les chaînes d'actions échouées. La plupart des ensembles de données ouverts ne capturent que les scénarios réussis ; les données d'échec permettent aux agents d'apprendre la récupération plutôt que simplement d'obtenir des résultats au premier coup.

Comment les données synthétiques protègent la confidentialité

L'un des principaux obstacles au développement des agents d'IA d'entreprise est l'impossibilité de partager ouvertement les workflows réels. Les pipelines internes, les données clients et la logique métier sont fermés par définition : les entreprises ne peuvent pas publier ce qui constitue leur avantage concurrentiel.

Les données synthétiques résolvent ce problème : les organisations génèrent des signaux d'entraînement utiles à partir de processus réels sans révéler les processus eux-mêmes. Cela ouvre la voie à la participation aux écosystèmes de données ouvertes sans risque de fuite d'informations commerciales.

NVIDIA souligne que cette approche nécessite de la transparence : il faut documenter ce qui a été généré, sur quelle base, et ce qui a passé l'examen des experts. Les données synthétiques ne sont pas une solution universelle—leur qualité dépend directement de la correction des modèles générateurs et des processus de validation.

"Les données synthétiques permettent de participer aux écosystèmes de données ouvertes sans révéler les workflows confidentiels ou les données clients"—l'équipe

Nemotron.

Prompt Atlas et 2,4 milliards de personnes synthétiques

Pour les chercheurs, NVIDIA a créé Nemotron Post-Training v3 Prompt Atlas—un outil visuel interactif pour explorer des millions d'exemples. Les données sont organisées par ensemble de données, domaine et motifs d'appel d'outils, faisant du corpus non seulement une archive téléchargeable mais un espace pour analyser les distributions et les motifs.

Nemotron-Personas mérite une attention particulière—un ensemble de personnes synthétiques qui au 8 juillet 2026 couvre plus de 2,4 milliards de personnes en provenance de dix pays. Les personas sont "ancrés localement" : ils reflètent la spécificité régionale, les motifs culturels et la diversité démographique de la population. Cela permet d'entraîner des agents qui comprennent le contexte local des requêtes—non seulement l'anglais technique universel, mais les motifs de communication caractéristiques de régions spécifiques.

Ce que cela signifie

Le lancement des ensembles de données Nemotron établit une nouvelle norme d'ouverture dans le développement des agents d'IA. L'inclusion de données d'échec d'outils, de personas synthétiques et d'un atlas interactif suggère que NVIDIA considère les agents non pas comme des chatbots améliorés mais comme des systèmes fonctionnant dans le monde réel avec des utilisateurs réels et des défaillances réelles. Les équipes construisant des agents spécialisés disposent maintenant d'une base prête pour le fine-tuning—sans avoir besoin de collecter des annotations à partir de zéro.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?

AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.

Qu'en pensez-vous ?
Chargement des commentaires…