DeepSearch-Evolve: agente web de 9 bilhões de parâmetros aprende sem supervisão e alcança 61% no GAIA
Pesquisadores publicaram o preprint DeepSearch-World: o framework de auto-destilação DeepSearch-Evolve treina agentes web a partir da própria experiência, sem ajuda de modelos-professores mais poderosos. A base é um ambiente verificável com 420 mil tarefas de múltiplas etapas. O modelo DeepSearch-World-9B alcançou 61,5% no GAIA e 93,4% no HotpotQA, competindo com os melhores agentes abertos. O ambiente, o dataset, o modelo e o código serão disponibilizados abertamente.
Processado por IA de arXiv cs.CL; editado por Hamidun News
Os pesquisadores publicaram um preimpresso no arXiv em 9 de julho de 2026 de DeepSearch-World: a estrutura de autodestilação DeepSearch-Evolve permite que agentes web aprendam com sua própria experiência sem depender de modelos de professores mais poderosos. Um modelo com 9 bilhões de parâmetros alcançou 61,5% no GAIA e 93,4% no HotpotQA.
Por que aprender agentes a partir da experiência é tão difícil
Dois paradigmas dominantes para treinar agentes têm fraquezas fundamentais. Ajuste fino supervisionado (SFT) treina o agente em trajetórias fixas destiladas de um professor: o modelo copia a experiência de outros sem desenvolver a sua própria. Aprendizagem por reforço (RL) potencialmente permite que um agente aprenda com seus erros, mas em interações longas — quando o agente dá dezenas de passos na internet antes de receber uma recompensa final — a recompensa fica muito escassa para um aprendizado eficaz.
Os autores resolveram o problema de forma diferente: criaram um ambiente verificável onde o agente recebe retroalimentação densa em cada passo sem depender de um juiz externo.
Como o ambiente DeepSearch-World funciona
DeepSearch-World é um ambiente determinístico e reproduzível com duas ferramentas: busca e leitura de páginas. Determinismo significa que a mesma consulta sempre retorna o mesmo resultado — condições ideais para treinar e comparar agentes.
Características principais:
- 420.000 tarefas de múltiplas etapas construídas por meio de caminhadas aleatórias em um gráfico de entidades
- Três comportamentos cognitivos integrados: verificação de progresso, reflexão fundamentada, recuperação de falhas
- Reprodutibilidade completa de qualquer trajetória de agente
As tarefas são "de múltiplas etapas": para responder uma pergunta, o agente deve encontrar sequencialmente vários fatos relacionados, cada um construído no anterior.
Quais resultados o modelo alcançou sem um professor
A estrutura DeepSearch-Evolve itera por quatro estágios: geração de trajetória → filtragem → mistura de dados → ajuste fino. Em cada iteração, o agente seleciona trajetórias bem-sucedidas, adiciona-as aos dados acumulados e retreina — melhorando gradualmente sem ajuda externa.
O modelo DeepSearch-World-9B sem destilação de GPT-4 ou outros modelos de fronteira mostrou resultados competitivos entre agentes abertos:
- 31,2% no BrowseComp — um benchmark de navegação web real da OpenAI
- 61,5% no GAIA — um teste universal de assistentes de IA
- 93,4% no HotpotQA — busca de múltiplas etapas de fatos relacionados
"Ambientes verificáveis abrem o caminho para auto-evolução escalável
para agentes com horizontes de interação longos".
Os autores planejam abrir o ambiente, um conjunto de 420k tarefas, um conjunto de validação, um checkpoint de modelo e código completo.
O que isso significa
O estudo fecha uma pergunta importante: você precisa de um modelo de fronteira para crescer um agente forte? Descobriu-se que — não, se o ambiente de treinamento for estruturado corretamente. Um ambiente verificável com recompensas densas permite que um agente se melhore automaticamente sem dependência de modelos comerciais fechados — um passo importante em direção a agentes web de próxima geração abertos e escaláveis.
Perguntas frequentes
O que é BrowseComp e por que 31,2% é um bom resultado?
BrowseComp é um benchmark da OpenAI para avaliar a capacidade dos agentes de trabalhar com a internet real; as tarefas são intencionalmente complexas, e resultados acima de 30% são considerados competitivos entre modelos abertos de até 10 bilhões de parâmetros.
Quando o conjunto de dados aberto de
DeepSearch-World será lançado?
Os autores anunciaram a abertura do ambiente, 420k tarefas, conjunto de validação, modelo e código, mas nenhuma data específica para lançamento público é fornecida no preimpresso de 9 de julho de 2026.
Quer parar de ler sobre IA e começar a usar?
AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.