Cursor Blog→ оригинал

Cursor: рой ИИ-агентов собрал SQLite на 80% за 4 часа — и в разы дешевле старого

Cursor прогнала старый и новый рой ИИ-агентов на одной задаче — собрать SQLite с нуля на Rust по одной документации. Новый рой обошёл старый во всех конфигурациях: с Grok 4.5 он прошёл 80% тестового набора SQL за 4 часа, а старый забуксовал, и его остановили ещё до второго часа. При схожем качестве стоимость прогонов различалась в разы — в зависимости от того, какие модели планировали, а какие исполняли.

AI-обработка оригинала Cursor Blog; редакция Hamidun News
Cursor: рой ИИ-агентов собрал SQLite на 80% за 4 часа — и в разы дешевле старого
Источник: Cursor Blog. Коллаж: Hamidun News.
◐ Слушать статью

Компания Cursor сравнила старую и новую версии своего роя ИИ-агентов на одной задаче — собрать СУБД SQLite с нуля на языке Rust, имея на входе только её документацию — и новый рой прошёл 80% скрытого набора SQL-тестов за четыре часа на модели Grok 4.5, тогда как старый рой забуксовал и был остановлен ещё до второго часа работы.

Что показал эксперимент

Новый рой Cursor обошёл старый в каждой конфигурации моделей при одинаковом бюджете времени и одних и тех же моделях. Команда измеряла долю пройденного скрытого (held-out) набора SQL-тестов — и по этой метрике преимущество оказалось стабильным, а не разовым.

  • Задача — построить SQLite с нуля на Rust только по документации
  • Grok 4.5 в новом рое: 80% тестов за 4 часа
  • Старый рой на той же задаче забуксовал и был остановлен до второго часа
  • Флагман прошлых экспериментов (начало 2026 года) — рой, строивший веб-браузер с нуля: proof of concept, но не отполированный продукт
  • Внутри Cursor рой уже искал и чинил уязвимости в open-source, поднимал покрытие тестами и генерировал миллиарды токенов синтетических данных для обучения

Почему рой обгоняет одиночного агента?

Рой выигрывает за счёт эффективности контекста, а не параллелизма как такового — на этом настаивает сама Cursor. Большие задачи естественно раскладываются в дерево: цель в корне рекурсивно дробится на элементарные единицы работы. Рой Cursor устроен вокруг двух ролей: Planner-агенты на самых умных моделях делят цель и делегируют куски, а Worker-агенты на быстрых и дешёвых моделях эти куски исполняют.

Ключ в том, что planner никогда не пишет код, а worker никогда не планирует. Поэтому контекст планировщика не забивается низкоуровневыми деталями, а исполнитель тратит весь свой контекст на одну узкую задачу. Одиночный же агент вынужден держать в голове и общую цель, и текущую позицию в дереве — и со временем «плывёт». Сам дизайн роя — надмножество более жёстких схем оркестрации: вместо фиксированной топологии его форма растёт под контуры задачи, поэтому подход обобщается и на сборку браузера, и на решение математических задач, и на оптимизацию GPU-ядер.

«Мы полагаем, что способность масштабировать рой агентов проистекает из этой эффективности контекста, а не из параллелизма как такового», — команда

Cursor, в блоге компании.

Сколько это стоит

Стоимость прогонов различалась колоссально при почти одинаковом качестве — это и есть «новая экономика моделей» из заголовка исследования. Cursor варьировала распределение ролей: в одних прогонах одна модель делала всё, в других фронтир-модель планировала, а быстрая и дешёвая исполняла работу. Итоговое качество выходило схожим, а счёт — принципиально разным. Похожую логику ещё в 1937 году описал экономист Рональд Коуз: издержки координации растут быстрее самой работы, поэтому организации дробятся на уровни ограниченных единиц, а не позволяют всем общаться со всеми.

Отдельная инженерная проблема — контроль версий. Git и Cargo полагаются на грубые блокировки, что нормально для одного разработчика, но не выдерживает сотен параллельных агентов. По данным Cursor, прошлогодний браузерный рой упирался в потолок около 1000 коммитов в час на Git; новая система выдерживает порядка 1000 коммитов в секунду — ради чего Cursor построила собственную систему контроля версий.

Что это значит

Мультиагентные системы переходят от принципа «запустим побольше агентов» к осознанной инженерии координации: правильное разделение ролей между дорогой и дешёвой моделями даёт то же качество за долю стоимости. Экономика решений теперь зависит не только от того, какую модель взять, но и от того, как распределить работу между ними.

Частые вопросы

Что такое рой ИИ-агентов?

Это система из множества агентов, которые совместно решают одну большую задачу. У Cursor рой состоит из Planner-агентов (умные модели планируют и делегируют) и Worker-агентов (быстрые дешёвые модели исполняют), а форма роя растёт под контуры задачи.

Зачем строить SQLite с нуля?

SQLite — сложная и хорошо документированная СУБД, поэтому это удобный тест на пределы координации агентов. Cursor давала рою только документацию и измеряла долю пройденных SQL-тестов; новый рой на Grok 4.5 дошёл до 80% за 4 часа.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…