arXiv cs.CL→ original

DeepSearch-Evolve: agente web de 9 bilhões de parâmetros aprende sem supervisão e alcança 61% no GAIA

Pesquisadores publicaram o preprint DeepSearch-World: o framework de auto-destilação DeepSearch-Evolve treina agentes web a partir da própria experiência, sem ajuda de modelos-professores mais poderosos. A base é um ambiente verificável com 420 mil tarefas de múltiplas etapas. O modelo DeepSearch-World-9B alcançou 61,5% no GAIA e 93,4% no HotpotQA, competindo com os melhores agentes abertos. O ambiente, o dataset, o modelo e o código serão disponibilizados abertamente.

Processado por IA de arXiv cs.CL; editado por Hamidun News
DeepSearch-Evolve: agente web de 9 bilhões de parâmetros aprende sem supervisão e alcança 61% no GAIA
Fonte: arXiv cs.CL. Colagem: Hamidun News.
◐ Ouvir artigo

Os pesquisadores publicaram um preimpresso no arXiv em 9 de julho de 2026 de DeepSearch-World: a estrutura de autodestilação DeepSearch-Evolve permite que agentes web aprendam com sua própria experiência sem depender de modelos de professores mais poderosos. Um modelo com 9 bilhões de parâmetros alcançou 61,5% no GAIA e 93,4% no HotpotQA.

Por que aprender agentes a partir da experiência é tão difícil

Dois paradigmas dominantes para treinar agentes têm fraquezas fundamentais. Ajuste fino supervisionado (SFT) treina o agente em trajetórias fixas destiladas de um professor: o modelo copia a experiência de outros sem desenvolver a sua própria. Aprendizagem por reforço (RL) potencialmente permite que um agente aprenda com seus erros, mas em interações longas — quando o agente dá dezenas de passos na internet antes de receber uma recompensa final — a recompensa fica muito escassa para um aprendizado eficaz.

Os autores resolveram o problema de forma diferente: criaram um ambiente verificável onde o agente recebe retroalimentação densa em cada passo sem depender de um juiz externo.

Como o ambiente DeepSearch-World funciona

DeepSearch-World é um ambiente determinístico e reproduzível com duas ferramentas: busca e leitura de páginas. Determinismo significa que a mesma consulta sempre retorna o mesmo resultado — condições ideais para treinar e comparar agentes.

Características principais:

  • 420.000 tarefas de múltiplas etapas construídas por meio de caminhadas aleatórias em um gráfico de entidades
  • Três comportamentos cognitivos integrados: verificação de progresso, reflexão fundamentada, recuperação de falhas
  • Reprodutibilidade completa de qualquer trajetória de agente

As tarefas são "de múltiplas etapas": para responder uma pergunta, o agente deve encontrar sequencialmente vários fatos relacionados, cada um construído no anterior.

Quais resultados o modelo alcançou sem um professor

A estrutura DeepSearch-Evolve itera por quatro estágios: geração de trajetória → filtragem → mistura de dados → ajuste fino. Em cada iteração, o agente seleciona trajetórias bem-sucedidas, adiciona-as aos dados acumulados e retreina — melhorando gradualmente sem ajuda externa.

O modelo DeepSearch-World-9B sem destilação de GPT-4 ou outros modelos de fronteira mostrou resultados competitivos entre agentes abertos:

  • 31,2% no BrowseComp — um benchmark de navegação web real da OpenAI
  • 61,5% no GAIA — um teste universal de assistentes de IA
  • 93,4% no HotpotQA — busca de múltiplas etapas de fatos relacionados
"Ambientes verificáveis abrem o caminho para auto-evolução escalável

para agentes com horizontes de interação longos".

Os autores planejam abrir o ambiente, um conjunto de 420k tarefas, um conjunto de validação, um checkpoint de modelo e código completo.

O que isso significa

O estudo fecha uma pergunta importante: você precisa de um modelo de fronteira para crescer um agente forte? Descobriu-se que — não, se o ambiente de treinamento for estruturado corretamente. Um ambiente verificável com recompensas densas permite que um agente se melhore automaticamente sem dependência de modelos comerciais fechados — um passo importante em direção a agentes web de próxima geração abertos e escaláveis.

Perguntas frequentes

O que é BrowseComp e por que 31,2% é um bom resultado?

BrowseComp é um benchmark da OpenAI para avaliar a capacidade dos agentes de trabalhar com a internet real; as tarefas são intencionalmente complexas, e resultados acima de 30% são considerados competitivos entre modelos abertos de até 10 bilhões de parâmetros.

Quando o conjunto de dados aberto de

DeepSearch-World será lançado?

Os autores anunciaram a abertura do ambiente, 420k tarefas, conjunto de validação, modelo e código, mas nenhuma data específica para lançamento público é fornecida no preimpresso de 9 de julho de 2026.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Quer parar de ler sobre IA e começar a usar?

AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.

O que você acha?
Carregando comentários…