DeepSearch-Evolve: un agente web de 9.000 millones de parámetros aprende sin supervisión y logra 61% en GAIA
Investigadores publicaron el preprint DeepSearch-World: el framework de autodestilación DeepSearch-Evolve entrena agentes web a partir de su propia experiencia sin ayuda de modelos maestros más potentes. La base es un entorno verificable con 420.000 tareas de varios pasos. El modelo DeepSearch-World-9B logró 61,5% en GAIA y 93,4% en HotpotQA, compitiendo con los mejores agentes abiertos. El entorno, el dataset, el modelo y el código se publicarán en abierto.
Procesado por IA desde arXiv cs.CL; editado por Hamidun News
Los investigadores publicaron un preimpreso en arXiv el 9 de julio de 2026 de DeepSearch-World: el marco de autodestilación DeepSearch-Evolve permite que los agentes web aprendan de su propia experiencia sin depender de modelos de maestros más poderosos. Un modelo con 9 mil millones de parámetros logró 61,5% en GAIA y 93,4% en HotpotQA.
Por qué aprender agentes de la experiencia es tan difícil
Dos paradigmas dominantes para entrenar agentes tienen debilidades fundamentales. El ajuste fino supervisado (SFT) entrena al agente en trayectorias fijas destiladas de un maestro: el modelo copia la experiencia de otros sin desarrollar la suya propia. El aprendizaje por refuerzo (RL) potencialmente permite que un agente aprenda de sus errores, pero en interacciones largas — cuando el agente da docenas de pasos en internet antes de recibir una recompensa final — la recompensa se vuelve demasiado escasa para un aprendizaje efectivo.
Los autores resolvieron el problema de manera diferente: crearon un entorno verificable donde el agente recibe retroalimentación densa en cada paso sin depender de un juez externo.
Cómo funciona el entorno DeepSearch-World
DeepSearch-World es un entorno determinista y reproducible con dos herramientas: búsqueda y lectura de páginas. Determinismo significa que la misma consulta siempre devuelve el mismo resultado — condiciones ideales para entrenar y comparar agentes.
Características clave:
- 420.000 tareas de múltiples pasos construidas a través de recorridos aleatorios en un gráfico de entidades
- Tres comportamientos cognitivos incorporados: verificación de progreso, reflexión fundamentada, recuperación de fallos
- Reproducibilidad completa de cualquier trayectoria de agente
Las tareas son "de múltiples pasos": para responder una pregunta, el agente debe encontrar secuencialmente varios hechos relacionados, cada uno basándose en el anterior.
Qué resultados logró el modelo sin maestro
El marco DeepSearch-Evolve itera a través de cuatro etapas: generación de trayectoria → filtración → mezcla de datos → ajuste fino. En cada iteración, el agente selecciona trayectorias exitosas, las agrega a datos acumulados y se reentrana — mejorando gradualmente sin ayuda externa.
El modelo DeepSearch-World-9B sin destilación de GPT-4 u otros modelos fronterizos mostró resultados competitivos entre agentes abiertos:
- 31,2% en BrowseComp — un punto de referencia de navegación web real de OpenAI
- 61,5% en GAIA — una prueba universal de asistentes de IA
- 93,4% en HotpotQA — búsqueda de múltiples pasos de hechos relacionados
"Los entornos verificables abren el camino hacia la auto-evolución
escalable para agentes con horizontes de interacción largos".
Los autores planean abrir el entorno, un grupo de 420k tareas, un conjunto de validación, un punto de control de modelo y código completo.
Qué significa esto
El estudio cierra una pregunta importante: ¿necesitas un modelo fronterizo para hacer crecer un agente fuerte? Resulta que — no, si el entorno de entrenamiento está estructurado correctamente. Un entorno verificable con recompensas densas permite que un agente se mejore a sí mismo sin dependencia de modelos comerciales cerrados — un paso importante hacia agentes web de próxima generación abiertos y escalables.
Preguntas frecuentes
¿Qué es BrowseComp y por qué 31,2% es un buen resultado?
BrowseComp es una referencia de OpenAI para evaluar la capacidad de los agentes de trabajar con internet real; las tareas son intencionalmente complejas, y los resultados superiores al 30% se consideran competitivos entre modelos abiertos de hasta 10 mil millones de parámetros.
¿Cuándo se publicará el conjunto de datos abierto de
DeepSearch-World?
Los autores anunciaron la apertura del entorno, 420k tareas, conjunto de validación, modelo y código, pero no se proporciona una fecha específica para el lanzamiento público en el preimpreso del 9 de julio de 2026.
¿Quieres dejar de leer sobre IA y empezar a usarla?
AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.