Cursor: рой ИИ-агентов собрал SQLite на 80% за 4 часа — и в разы дешевле старого
Cursor прогнала старый и новый рой ИИ-агентов на одной задаче — собрать SQLite с нуля на Rust по одной документации. Новый рой обошёл старый во всех конфигурациях: с Grok 4.5 он прошёл 80% тестового набора SQL за 4 часа, а старый забуксовал, и его остановили ещё до второго часа. При схожем качестве стоимость прогонов различалась в разы — в зависимости от того, какие модели планировали, а какие исполняли.
AI-обработка оригинала Cursor Blog; редакция Hamidun News
Компания Cursor сравнила старую и новую версии своего роя ИИ-агентов на одной задаче — собрать СУБД SQLite с нуля на языке Rust, имея на входе только её документацию — и новый рой прошёл 80% скрытого набора SQL-тестов за четыре часа на модели Grok 4.5, тогда как старый рой забуксовал и был остановлен ещё до второго часа работы.
Что показал эксперимент
Новый рой Cursor обошёл старый в каждой конфигурации моделей при одинаковом бюджете времени и одних и тех же моделях. Команда измеряла долю пройденного скрытого (held-out) набора SQL-тестов — и по этой метрике преимущество оказалось стабильным, а не разовым.
- Задача — построить SQLite с нуля на Rust только по документации
- Grok 4.5 в новом рое: 80% тестов за 4 часа
- Старый рой на той же задаче забуксовал и был остановлен до второго часа
- Флагман прошлых экспериментов (начало 2026 года) — рой, строивший веб-браузер с нуля: proof of concept, но не отполированный продукт
- Внутри Cursor рой уже искал и чинил уязвимости в open-source, поднимал покрытие тестами и генерировал миллиарды токенов синтетических данных для обучения
Почему рой обгоняет одиночного агента?
Рой выигрывает за счёт эффективности контекста, а не параллелизма как такового — на этом настаивает сама Cursor. Большие задачи естественно раскладываются в дерево: цель в корне рекурсивно дробится на элементарные единицы работы. Рой Cursor устроен вокруг двух ролей: Planner-агенты на самых умных моделях делят цель и делегируют куски, а Worker-агенты на быстрых и дешёвых моделях эти куски исполняют.
Ключ в том, что planner никогда не пишет код, а worker никогда не планирует. Поэтому контекст планировщика не забивается низкоуровневыми деталями, а исполнитель тратит весь свой контекст на одну узкую задачу. Одиночный же агент вынужден держать в голове и общую цель, и текущую позицию в дереве — и со временем «плывёт». Сам дизайн роя — надмножество более жёстких схем оркестрации: вместо фиксированной топологии его форма растёт под контуры задачи, поэтому подход обобщается и на сборку браузера, и на решение математических задач, и на оптимизацию GPU-ядер.
«Мы полагаем, что способность масштабировать рой агентов проистекает из этой эффективности контекста, а не из параллелизма как такового», — команда
Cursor, в блоге компании.
Сколько это стоит
Стоимость прогонов различалась колоссально при почти одинаковом качестве — это и есть «новая экономика моделей» из заголовка исследования. Cursor варьировала распределение ролей: в одних прогонах одна модель делала всё, в других фронтир-модель планировала, а быстрая и дешёвая исполняла работу. Итоговое качество выходило схожим, а счёт — принципиально разным. Похожую логику ещё в 1937 году описал экономист Рональд Коуз: издержки координации растут быстрее самой работы, поэтому организации дробятся на уровни ограниченных единиц, а не позволяют всем общаться со всеми.
Отдельная инженерная проблема — контроль версий. Git и Cargo полагаются на грубые блокировки, что нормально для одного разработчика, но не выдерживает сотен параллельных агентов. По данным Cursor, прошлогодний браузерный рой упирался в потолок около 1000 коммитов в час на Git; новая система выдерживает порядка 1000 коммитов в секунду — ради чего Cursor построила собственную систему контроля версий.
Что это значит
Мультиагентные системы переходят от принципа «запустим побольше агентов» к осознанной инженерии координации: правильное разделение ролей между дорогой и дешёвой моделями даёт то же качество за долю стоимости. Экономика решений теперь зависит не только от того, какую модель взять, но и от того, как распределить работу между ними.
Частые вопросы
Что такое рой ИИ-агентов?
Это система из множества агентов, которые совместно решают одну большую задачу. У Cursor рой состоит из Planner-агентов (умные модели планируют и делегируют) и Worker-агентов (быстрые дешёвые модели исполняют), а форма роя растёт под контуры задачи.
Зачем строить SQLite с нуля?
SQLite — сложная и хорошо документированная СУБД, поэтому это удобный тест на пределы координации агентов. Cursor давала рою только документацию и измеряла долю пройденных SQL-тестов; новый рой на Grok 4.5 дошёл до 80% за 4 часа.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.