Hugging Face Blog→ original

NVIDIA abre los datasets Nemotron: 10 billones de tokens para entrenar agentes de AI

El 8 de julio de 2026, NVIDIA lanzó los datasets abiertos Nemotron para agentes de AI: más de 10 billones de tokens de preentrenamiento y millones de ejemplos etiquetados en ocho dominios, incluidos fallos en la invocación de herramientas. Las personas sintéticas Nemotron-Personas abarcan a 2,4 mil millones de personas de 10 países. La compañía también lanzó el Prompt Atlas interactivo para explorar el corpus.

Procesado por IA desde Hugging Face Blog; editado por Hamidun News
NVIDIA abre los datasets Nemotron: 10 billones de tokens para entrenar agentes de AI
Fuente: Hugging Face Blog. Collage: Hamidun News.
◐ Escuchar artículo

El 8 de julio de 2026, NVIDIA publicó en Hugging Face un artículo de investigación sobre datos abiertos para agentes de IA, simultáneamente lanzando conjuntos de datos Nemotron que contienen más de 10 billones de tokens de preentrenamiento y millones de ejemplos de postentrenamiento. Este es uno de los mayores lanzamientos públicos de datos de entrenamiento específicamente orientados a sistemas de agentes.

Por qué los pesos del modelo solos son insuficientes

El comportamiento del agente de IA se determina no solo por los pesos de la red neuronal, sino también por los datos específicos en los que fue entrenado. Los puntos de referencia estándar y los corpus de texto general no reflejan la verdadera complejidad de las tareas de agentes: cadenas de acciones de múltiples pasos, uso de herramientas, fallos y recuperación de errores.

Los conjuntos de datos Nemotron cubren ocho dominios clave:

  • Trazas de ingeniería de software
  • Fallos en el uso de herramientas
  • Razonamiento de múltiples pasos
  • Búsqueda y recuperación de información
  • Seguridad y control de comportamiento
  • Simulación de usuarios
  • Ejecución de flujos de trabajo
  • Verificación de respuestas

La sección de preentrenamiento supera 10 billones de tokens; la sección de postentrenamiento contiene millones de ejemplos etiquetados en múltiples dominios. Particularmente valioso es la inclusión de datos de fallos—llamadas de herramientas erróneas y cadenas de acciones fallidas. La mayoría de los conjuntos de datos abiertos capturan solo escenarios exitosos; los datos de fallos permiten que los agentes aprendan a recuperarse en lugar de solo lograr resultados al primer intento.

Cómo los datos sintéticos protegen la confidencialidad

Uno de los principales obstáculos en el desarrollo de agentes corporativos de IA es la imposibilidad de compartir abiertamente flujos de trabajo reales. Los pipelines internos, los datos de clientes y la lógica empresarial están cerrados por definición: las empresas no pueden publicar lo que constituye su ventaja competitiva.

Los datos sintéticos resuelven este problema: las organizaciones generan señales de entrenamiento útiles a partir de procesos reales sin revelar los procesos mismos. Esto abre el camino para participar en ecosistemas de datos abiertos sin arriesgar la filtración de información comercial.

NVIDIA enfatiza que este enfoque requiere transparencia: se debe documentar qué fue generado, sobre qué base, y qué pasó la revisión de expertos. Los datos sintéticos no son una solución universal: su calidad depende directamente de la corrección de los modelos de generador y los procesos de validación.

"Los datos sintéticos permiten participar en ecosistemas de datos abiertos sin revelar flujos de trabajo confidenciales o datos de clientes"—el equipo

Nemotron.

Prompt Atlas y 2.4 mil millones de personas sintéticas

Para investigadores, NVIDIA creó Nemotron Post-Training v3 Prompt Atlas—una herramienta visual interactiva para explorar millones de ejemplos. Los datos se organizan por conjunto de datos, dominio y patrones de llamadas de herramientas, convirtiendo el corpus no solo en un archivo descargable sino en un espacio para analizar distribuciones y patrones.

Nemotron-Personas merece atención separada—un conjunto de personas sintéticas que a partir del 8 de julio de 2026 cubre más de 2.4 mil millones de personas de diez países. Las personas están "localmente fundamentadas": reflejan especificidad regional, patrones culturales y diversidad demográfica de población. Esto permite entrenar agentes que comprendan el contexto local en solicitudes—no solo el inglés técnico universal, sino patrones de comunicación característicos de regiones específicas.

Lo que esto significa

El lanzamiento de conjuntos de datos Nemotron establece un nuevo estándar de apertura en el desarrollo de agentes de IA. La inclusión de datos de fallos de herramientas, personas sintéticas y un atlas interactivo sugiere que NVIDIA ve los agentes no como chatbots mejorados sino como sistemas que operan en el mundo real con usuarios reales y fallos reales. Los equipos que construyen agentes especializados ahora tienen una base lista para el fine-tuning sin necesidad de recopilar anotaciones desde cero.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Quieres dejar de leer sobre IA y empezar a usarla?

AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.

¿Qué te parece?
Cargando comentarios…