AIRI→ original

Ouroboros vs Claude Code: агент написал себя сам и достиг SOTA на Terminal-Bench 2.1

Агент Ouroboros на Python несколько месяцев переписывал собственный код и достиг SOTA на Terminal-Bench 2.1, CL-Bench и OSWorld. На GAIA и SWE-Pro — паритет с Claude Code и Codex. Систему запустил один исследователь из AIRI в Google Colab: агент развивался автономно, сжигал токены — и создал архитектуру, которую разработчик «сам бы не придумал».

Procesado por IA desde AIRI; editado por Hamidun News
Ouroboros vs Claude Code: агент написал себя сам и достиг SOTA на Terminal-Bench 2.1
Fuente: AIRI. Collage: Hamidun News.
◐ Escuchar artículo

Un investigador de AIRI publicó el 3 de agosto de 2026 en Habr un análisis detallado del agente autoevolutivo Ouroboros — un sistema en Python puro que reescribió de forma autónoma su propio código durante varios meses y alcanzó resultados SOTA en Terminal-Bench 2.1, CL-Bench y OSWorld, igualándose con Claude Code y Codex en los benchmarks GAIA y SWE-Pro.

Cómo Ouroboros se escribe a sí mismo

Ouroboros es un bucle agente en Python con acceso directo a git y permiso para sobreescribir su propio runtime durante la ejecución. El ciclo cerrado funciona así: el agente recibe una tarea, la ejecuta, analiza el resultado y realiza modificaciones en su propio código fuente — luego se reinicia de forma segura en la versión actualizada. Si una nueva iteración rompe algo, el sistema revierte automáticamente a la versión anterior.

El autor alojó intencionalmente la primera versión en Google Colab y no en una máquina local: el aislamiento del entorno en la nube protegía contra las consecuencias imprevisibles de la autoevolución. El sistema comenzó de manera modesta.

  • Lenguaje: Python puro sin frameworks de agentes de terceros
  • Entorno: Google Colab, aislado de la máquina local del desarrollador
  • Herramientas: git, permiso para sobreescribir el runtime, mecanismo de reversión segura
  • Primeras tareas: dibujaba gatitos, navegaba por YouTube, cambiaba los fondos de escritorio
  • Presupuesto: gasto autónomo de tokens sin supervisión constante del desarrollador

Lo que muestran los benchmarks

En tres benchmarks — Terminal-Bench 2.1, CL-Bench y OSWorld — Ouroboros alcanzó resultados de nivel SOTA. Los tres evalúan distintas facetas de las capacidades de los agentes: Terminal-Bench evalúa el trabajo en línea de comandos, OSWorld evalúa el control del escritorio y las interfaces GUI, y CL-Bench evalúa tareas de programación complejas. En GAIA y SWE-Pro se registró paridad con Claude Code (Anthropic) y Codex (OpenAI).

«Yo mismo no habría diseñado un harness así, pero la evolución

autónoma y una buena cantidad de dinero en tokens quemados — eso sí», — el autor del proyecto, investigador de AIRI.

La arquitectura actual del sistema no surgió mediante un diseño manual, sino a través de decenas de iteraciones autónomas, cada una de las cuales costó tokens reales. Es notable que Ouroboros haya logrado esto sin grandes recursos computacionales — solo el entorno en la nube de Google Colab y un presupuesto para solicitudes de API.

En qué se diferencia este enfoque de los agentes ordinarios

La mayoría de los sistemas de agentes mejoran mediante prompt engineering o fine-tuning con nuevos datos — el código fuente permanece inalterado en todo momento. Ouroboros funciona de manera diferente: el agente edita su propio código fuente en un ciclo de producción, y es precisamente la evolución de la arquitectura — y no la variación de prompts — lo que condujo a los resultados SOTA.

Esto convierte a Ouroboros en uno de los pocos ejemplos públicamente documentados de automodificación real de agentes con resultados numéricos verificables. La mayoría de los experimentos similares permanecen cerrados o no van acompañados de datos abiertos de benchmark. Según la publicación del autor en Habr, el análisis incluye trazas, cifras para reproducibilidad y «algunas historias incómodas del audit» — casos en los que el agente tomó decisiones inesperadas durante la evolución.

El autor indica que ahora «hace casi todo a través de él» — Ouroboros se ha transformado de un proyecto de investigación en su herramienta de trabajo principal.

Qué significa esto

Ouroboros es evidencia práctica de que la autoevolución de agentes sin presupuestos computacionales millonarios puede ofrecer resultados competitivos. Un único investigador con un entorno Colab alcanzó SOTA en un espacio donde compiten laboratorios con equipos completos e infraestructura de servidores. La siguiente pregunta es cómo gestionar esa evolución a escala y cómo prevenir comportamientos no deseados de un agente que se escribe a sí mismo.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?

Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).

¿Qué te parece?
Cargando comentarios…