AIRI→ оригинал

Ouroboros vs Claude Code: агент написал себя сам и достиг SOTA на Terminal-Bench 2.1

Агент Ouroboros на Python несколько месяцев переписывал собственный код и достиг SOTA на Terminal-Bench 2.1, CL-Bench и OSWorld. На GAIA и SWE-Pro — паритет с Claude Code и Codex. Систему запустил один исследователь из AIRI в Google Colab: агент развивался автономно, сжигал токены — и создал архитектуру, которую разработчик «сам бы не придумал».

AI-обработка оригинала AIRI; редакция Hamidun News
Ouroboros vs Claude Code: агент написал себя сам и достиг SOTA на Terminal-Bench 2.1
Источник: AIRI. Коллаж: Hamidun News.
◐ Слушать статью

Исследователь из AIRI 3 августа 2026 года опубликовал на Хабре детальный разбор самоэволюционирующего агента Ouroboros — системы на чистом Python, которая несколько месяцев автономно переписывала собственный код и достигла SOTA-результатов на Terminal-Bench 2.1, CL-Bench и OSWorld, сравнявшись с Claude Code и Codex на бенчмарках GAIA и SWE-Pro.

Как Ouroboros пишет себя сам?

Ouroboros — агентный луп на Python с прямым доступом к git и правом перезаписывать собственный рантайм прямо в ходе работы. Замкнутый цикл выглядит так: агент получает задачу, выполняет её, анализирует результат и вносит правки в собственный исходный код — затем безопасно перезапускается на обновлённой версии. Если новая итерация что-то ломает, система автоматически откатывается к предыдущей.

Первую версию автор намеренно поселил в Google Colab, а не на локальной машине: изоляция облачной среды защищала от непредсказуемых последствий самоэволюции. Начинала система скромно.

  • Язык: чистый Python без сторонних агентных фреймворков
  • Среда: Google Colab с изоляцией от локальной машины разработчика
  • Инструменты: git, право перезаписывать рантайм, механизм безопасного отката
  • Первые задачи: рисовала котиков, зависала на YouTube, меняла обои рабочего стола
  • Бюджет: автономный расход токенов без постоянного контроля разработчика

Что показывают бенчмарки

На трёх бенчмарках — Terminal-Bench 2.1, CL-Bench и OSWorld — Ouroboros достиг результатов уровня SOTA. Все три оценивают разные грани агентных возможностей: Terminal-Bench — работу в командной строке, OSWorld — управление рабочим столом и GUI-интерфейсами, CL-Bench — сложные программные задачи. На GAIA и SWE-Pro зафиксирован паритет с Claude Code (Anthropic) и Codex (OpenAI).

«Сам бы я такой харнесс не придумал, а вот автономная эволюция и куча

сожжённых денег на токены — да», — автор проекта, исследователь AIRI.

Нынешняя архитектура системы сложилась не через ручной дизайн, а через десятки автономных итераций, каждая из которых стоила реальных токенов. Примечательно, что Ouroboros достиг этого без крупных вычислительных ресурсов — только облачная среда Google Colab и бюджет на API-запросы.

Чем этот подход отличается от обычных агентов

Большинство агентных систем совершенствуются через промпт-инжиниринг или fine-tuning на новых данных — исходный код при этом остаётся неизменным. Ouroboros работает иначе: агент правит собственный исходный код в production-цикле, и именно эволюция архитектуры — а не перебор промптов — привела к SOTA-результатам.

Это делает Ouroboros одним из немногих публично задокументированных примеров реальной агентской самомодификации с верифицируемыми числовыми результатами. Большинство похожих экспериментов либо остаются закрытыми, либо не сопровождаются открытыми бенчмарк-данными. По словам автора в публикации на Хабре, разбор включает трейсы, цифры для воспроизведения и «несколько неловких историй из аудита» — случаев, когда агент принимал неожиданные решения в ходе эволюции.

Автор сообщает, что сейчас «почти всё делает через него» — Ouroboros превратился из исследовательского проекта в основной рабочий инструмент.

Что это значит

Ouroboros — практическое свидетельство того, что агентская самоэволюция без многомиллионных вычислительных бюджетов способна давать конкурентные результаты. Один исследователь с Colab-окружением достиг SOTA там, где соревнуются лаборатории с командами и серверной инфраструктурой. Следующий вопрос — как управлять такой эволюцией при масштабировании и предотвращать нежелательное поведение агента, который сам пишет себя.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…