arXiv cs.CL→ original

DeepSearch-Evolve : un agent web de 9 milliards de paramètres apprend sans supervision et atteint 61 % sur GAIA

Des chercheurs ont publié le préprint DeepSearch-World : le framework d’auto-distillation DeepSearch-Evolve entraîne des agents web à partir de leur propre expérience, sans l’aide de modèles enseignants plus puissants. Il repose sur un environnement vérifiable comprenant 420 000 tâches en plusieurs étapes. Le modèle DeepSearch-World-9B a obtenu 61,5 % sur GAIA et 93,4 % sur HotpotQA, rivalisant avec les meilleurs agents ouverts. L’environnement, le dataset, le modèle et le code seront publiés en accès libre.

Traité par IA depuis arXiv cs.CL ; édité par Hamidun News
DeepSearch-Evolve : un agent web de 9 milliards de paramètres apprend sans supervision et atteint 61 % sur GAIA
Source : arXiv cs.CL. Collage: Hamidun News.
◐ Écouter l'article

Les chercheurs ont publié une prépublication sur arXiv le 9 juillet 2026 de DeepSearch-World : le cadre d'autodestillation DeepSearch-Evolve permet aux agents web d'apprendre de leur propre expérience sans dépendre de modèles d'enseignants plus puissants. Un modèle avec 9 milliards de paramètres a obtenu 61,5% sur GAIA et 93,4% sur HotpotQA.

Pourquoi apprendre les agents de l'expérience est si difficile

Deux paradigmes dominants pour l'entraînement des agents ont des faiblesses fondamentales. L'ajustement fin supervisé (SFT) entraîne l'agent sur des trajectoires fixes distillées d'un enseignant : le modèle copie l'expérience des autres sans développer la sienne. L'apprentissage par renforcement (RL) permet potentiellement à un agent d'apprendre de ses erreurs, mais dans les interactions longues — lorsque l'agent fait des dizaines d'étapes sur Internet avant de recevoir une récompense finale — la récompense devient trop rare pour un apprentissage efficace.

Les auteurs ont résolu le problème différemment : ils ont créé un environnement vérifiable où l'agent reçoit une rétroaction dense à chaque étape sans dépendre d'un juge externe.

Comment fonctionne l'environnement DeepSearch-World

DeepSearch-World est un environnement déterministe et reproductible avec deux outils : la recherche et la lecture de pages. Le déterminisme signifie que la même requête retourne toujours le même résultat — conditions idéales pour entraîner et comparer les agents.

Caractéristiques clés :

  • 420 000 tâches multiples construites par des promenades aléatoires sur un graphique d'entités
  • Trois comportements cognitifs intégrés : vérification des progrès, réflexion fondée, récupération d'erreurs
  • Reproductibilité complète de toute trajectoire d'agent

Les tâches sont "multi-étapes" : pour répondre à une question, l'agent doit trouver successivement plusieurs faits connexes, chacun s'appuyant sur le précédent.

Quels résultats le modèle a-t-il atteint sans enseignant

Le cadre DeepSearch-Evolve traverse itérativement quatre étapes : génération de trajectoire → filtrage → mélange de données → ajustement fin. À chaque itération, l'agent sélectionne les trajectoires réussies, les ajoute aux données accumulées et s'entraîne à nouveau — s'améliorant progressivement sans aide externe.

Le modèle DeepSearch-World-9B sans distillation de GPT-4 ou d'autres modèles de frontière a montré des résultats compétitifs parmi les agents ouverts :

  • 31,2% sur BrowseComp — un benchmark de navigation web réelle d'OpenAI
  • 61,5% sur GAIA — un test universel des assistants IA
  • 93,4% sur HotpotQA — recherche multi-étapes de faits connexes
"Les environnements vérifiables ouvrent la voie à l'auto-évolution

évolutive pour les agents ayant des horizons d'interaction longs".

Les auteurs prévoient d'ouvrir l'environnement, un ensemble de 420k tâches, un ensemble de validation, un point de contrôle du modèle et le code complet.

Ce que cela signifie

L'étude ferme une question importante : avez-vous besoin d'un modèle de frontière pour développer un agent fort ? Il s'avère que — non, si l'environnement d'entraînement est correctement structuré. Un environnement vérifiable avec des récompenses denses permet à un agent de s'auto-améliorer sans dépendance vis-à-vis des modèles commerciaux fermés — une étape importante vers les agents web de prochaine génération ouverts et évolutifs.

Foire aux questions

Qu'est-ce que

BrowseComp et pourquoi 31,2% est un bon résultat ?

BrowseComp est un benchmark d'OpenAI pour évaluer la capacité des agents à travailler avec l'Internet réel ; les tâches sont intentionnellement complexes, et les résultats supérieurs à 30% sont considérés comme compétitifs parmi les modèles ouverts jusqu'à 10 milliards de paramètres.

Quand l'ensemble de données ouvert

DeepSearch-World sera-t-il publié ?

Les auteurs ont annoncé l'ouverture de l'environnement, 420k tâches, ensemble de validation, modèle et code, mais aucune date spécifique pour la version publique n'est donnée dans la prépublication du 9 juillet 2026.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?

AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.

Qu'en pensez-vous ?
Chargement des commentaires…