AIRI→ original

Ouroboros vs Claude Code: агент написал себя сам и достиг SOTA на Terminal-Bench 2.1

Агент Ouroboros на Python несколько месяцев переписывал собственный код и достиг SOTA на Terminal-Bench 2.1, CL-Bench и OSWorld. На GAIA и SWE-Pro — паритет с Claude Code и Codex. Систему запустил один исследователь из AIRI в Google Colab: агент развивался автономно, сжигал токены — и создал архитектуру, которую разработчик «сам бы не придумал».

Traité par IA depuis AIRI ; édité par Hamidun News
Ouroboros vs Claude Code: агент написал себя сам и достиг SOTA на Terminal-Bench 2.1
Source : AIRI. Collage: Hamidun News.
◐ Écouter l'article

Un chercheur de l'AIRI a publié le 3 août 2026 sur Habr une analyse détaillée de l'agent auto-évolutif Ouroboros — un système en Python pur qui a réécrit de manière autonome son propre code pendant plusieurs mois et a atteint des résultats SOTA sur Terminal-Bench 2.1, CL-Bench et OSWorld, se hissant au niveau de Claude Code et Codex sur les benchmarks GAIA et SWE-Pro.

Comment Ouroboros s'écrit lui-même

Ouroboros est une boucle agente en Python avec un accès direct à git et la capacité de réécrire son propre runtime en cours d'exécution. Le cycle fermé fonctionne ainsi : l'agent reçoit une tâche, l'exécute, analyse le résultat et apporte des modifications à son propre code source — puis redémarre en toute sécurité sur la version mise à jour. Si une nouvelle itération casse quelque chose, le système revient automatiquement à la version précédente.

L'auteur a délibérément hébergé la première version sur Google Colab plutôt que sur une machine locale : l'isolation de l'environnement cloud protégeait contre les conséquences imprévisibles de l'auto-évolution. Le système a démarré modestement.

  • Langage : Python pur sans frameworks d'agents tiers
  • Environnement : Google Colab, isolé de la machine locale du développeur
  • Outils : git, droit de réécrire le runtime, mécanisme de rollback sécurisé
  • Premières tâches : dessinait des chatons, traînait sur YouTube, changeait les fonds d'écran du bureau
  • Budget : dépense autonome de tokens sans surveillance constante du développeur

Ce que montrent les benchmarks

Sur trois benchmarks — Terminal-Bench 2.1, CL-Bench et OSWorld — Ouroboros a atteint des résultats de niveau SOTA. Les trois évaluent différentes facettes des capacités des agents : Terminal-Bench évalue le travail en ligne de commande, OSWorld évalue le contrôle du bureau et des interfaces GUI, et CL-Bench évalue des tâches de programmation complexes. Sur GAIA et SWE-Pro, une parité avec Claude Code (Anthropic) et Codex (OpenAI) a été enregistrée.

«

Je n'aurais pas imaginé un tel harness moi-même, mais l'évolution autonome et une belle somme de tokens brûlés — oui », — l'auteur du projet, chercheur à l'AIRI.

L'architecture actuelle du système ne s'est pas constituée par une conception manuelle, mais à travers des dizaines d'itérations autonomes, chacune coûtant de vrais tokens. Il est remarquable qu'Ouroboros ait atteint ces résultats sans grandes ressources de calcul — uniquement l'environnement cloud de Google Colab et un budget pour les requêtes API.

En quoi cette approche diffère des agents ordinaires

La plupart des systèmes agentiques s'améliorent via le prompt engineering ou le fine-tuning sur de nouvelles données — le code source reste inchangé pendant ce temps. Ouroboros fonctionne différemment : l'agent modifie son propre code source dans un cycle de production, et c'est précisément l'évolution de l'architecture — et non la variation des prompts — qui a conduit aux résultats SOTA.

Cela fait d'Ouroboros l'un des rares exemples publiquement documentés de véritable auto-modification agentique avec des résultats numériques vérifiables. La plupart des expériences similaires restent fermées ou ne s'accompagnent pas de données de benchmark ouvertes. Selon la publication de l'auteur sur Habr, l'analyse comprend des traces, des chiffres pour la reproductibilité et « quelques histoires gênantes issues de l'audit » — des cas où l'agent a pris des décisions inattendues au cours de son évolution.

L'auteur indique qu'il fait désormais « presque tout à travers lui » — Ouroboros est passé d'un projet de recherche à un outil de travail principal.

Ce que cela signifie

Ouroboros est la preuve concrète que l'auto-évolution agentique sans budgets de calcul multimillionnaires peut produire des résultats compétitifs. Un seul chercheur avec un environnement Colab a atteint le SOTA dans un espace où se disputent des laboratoires dotés d'équipes et d'infrastructures serveur. La prochaine question est de savoir comment gérer une telle évolution à grande échelle et comment prévenir les comportements indésirables d'un agent qui s'écrit lui-même.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?

Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).

Qu'en pensez-vous ?
Chargement des commentaires…