arXiv cs.CL→ original

DeepSearch-Evolve: un agente web de 9.000 millones de parámetros aprende sin supervisión y logra 61% en GAIA

Investigadores publicaron el preprint DeepSearch-World: el framework de autodestilación DeepSearch-Evolve entrena agentes web a partir de su propia experiencia sin ayuda de modelos maestros más potentes. La base es un entorno verificable con 420.000 tareas de varios pasos. El modelo DeepSearch-World-9B logró 61,5% en GAIA y 93,4% en HotpotQA, compitiendo con los mejores agentes abiertos. El entorno, el dataset, el modelo y el código se publicarán en abierto.

Procesado por IA desde arXiv cs.CL; editado por Hamidun News
DeepSearch-Evolve: un agente web de 9.000 millones de parámetros aprende sin supervisión y logra 61% en GAIA
Fuente: arXiv cs.CL. Collage: Hamidun News.
◐ Escuchar artículo

Los investigadores publicaron un preimpreso en arXiv el 9 de julio de 2026 de DeepSearch-World: el marco de autodestilación DeepSearch-Evolve permite que los agentes web aprendan de su propia experiencia sin depender de modelos de maestros más poderosos. Un modelo con 9 mil millones de parámetros logró 61,5% en GAIA y 93,4% en HotpotQA.

Por qué aprender agentes de la experiencia es tan difícil

Dos paradigmas dominantes para entrenar agentes tienen debilidades fundamentales. El ajuste fino supervisado (SFT) entrena al agente en trayectorias fijas destiladas de un maestro: el modelo copia la experiencia de otros sin desarrollar la suya propia. El aprendizaje por refuerzo (RL) potencialmente permite que un agente aprenda de sus errores, pero en interacciones largas — cuando el agente da docenas de pasos en internet antes de recibir una recompensa final — la recompensa se vuelve demasiado escasa para un aprendizaje efectivo.

Los autores resolvieron el problema de manera diferente: crearon un entorno verificable donde el agente recibe retroalimentación densa en cada paso sin depender de un juez externo.

Cómo funciona el entorno DeepSearch-World

DeepSearch-World es un entorno determinista y reproducible con dos herramientas: búsqueda y lectura de páginas. Determinismo significa que la misma consulta siempre devuelve el mismo resultado — condiciones ideales para entrenar y comparar agentes.

Características clave:

  • 420.000 tareas de múltiples pasos construidas a través de recorridos aleatorios en un gráfico de entidades
  • Tres comportamientos cognitivos incorporados: verificación de progreso, reflexión fundamentada, recuperación de fallos
  • Reproducibilidad completa de cualquier trayectoria de agente

Las tareas son "de múltiples pasos": para responder una pregunta, el agente debe encontrar secuencialmente varios hechos relacionados, cada uno basándose en el anterior.

Qué resultados logró el modelo sin maestro

El marco DeepSearch-Evolve itera a través de cuatro etapas: generación de trayectoria → filtración → mezcla de datos → ajuste fino. En cada iteración, el agente selecciona trayectorias exitosas, las agrega a datos acumulados y se reentrana — mejorando gradualmente sin ayuda externa.

El modelo DeepSearch-World-9B sin destilación de GPT-4 u otros modelos fronterizos mostró resultados competitivos entre agentes abiertos:

  • 31,2% en BrowseComp — un punto de referencia de navegación web real de OpenAI
  • 61,5% en GAIA — una prueba universal de asistentes de IA
  • 93,4% en HotpotQA — búsqueda de múltiples pasos de hechos relacionados
"Los entornos verificables abren el camino hacia la auto-evolución

escalable para agentes con horizontes de interacción largos".

Los autores planean abrir el entorno, un grupo de 420k tareas, un conjunto de validación, un punto de control de modelo y código completo.

Qué significa esto

El estudio cierra una pregunta importante: ¿necesitas un modelo fronterizo para hacer crecer un agente fuerte? Resulta que — no, si el entorno de entrenamiento está estructurado correctamente. Un entorno verificable con recompensas densas permite que un agente se mejore a sí mismo sin dependencia de modelos comerciales cerrados — un paso importante hacia agentes web de próxima generación abiertos y escalables.

Preguntas frecuentes

¿Qué es BrowseComp y por qué 31,2% es un buen resultado?

BrowseComp es una referencia de OpenAI para evaluar la capacidad de los agentes de trabajar con internet real; las tareas son intencionalmente complejas, y los resultados superiores al 30% se consideran competitivos entre modelos abiertos de hasta 10 mil millones de parámetros.

¿Cuándo se publicará el conjunto de datos abierto de

DeepSearch-World?

Los autores anunciaron la apertura del entorno, 420k tareas, conjunto de validación, modelo y código, pero no se proporciona una fecha específica para el lanzamiento público en el preimpreso del 9 de julio de 2026.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Quieres dejar de leer sobre IA y empezar a usarla?

AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.

¿Qué te parece?
Cargando comentarios…