Cursor Blog→ original

Cursor: рой ИИ-агентов собрал SQLite на 80% за 4 часа — и в разы дешевле старого

Cursor прогнала старый и новый рой ИИ-агентов на одной задаче — собрать SQLite с нуля на Rust по одной документации. Новый рой обошёл старый во всех конфигурациях: с Grok 4.5 он прошёл 80% тестового набора SQL за 4 часа, а старый забуксовал, и его остановили ещё до второго часа. При схожем качестве стоимость прогонов различалась в разы — в зависимости от того, какие модели планировали, а какие исполняли.

Processado por IA de Cursor Blog; editado por Hamidun News
Cursor: рой ИИ-агентов собрал SQLite на 80% за 4 часа — и в разы дешевле старого
Fonte: Cursor Blog. Colagem: Hamidun News.
◐ Ouvir artigo

A Cursor comparou a versão antiga e a nova do seu enxame de agentes de IA em uma mesma tarefa — construir o SGBD SQLite do zero em Rust, tendo como entrada apenas a sua documentação — e o novo enxame passou em 80% de um conjunto oculto de testes SQL em quatro horas usando o modelo Grok 4.5, enquanto o enxame antigo travou e foi interrompido antes de completar a segunda hora de trabalho.

O que o experimento mostrou

O novo enxame da Cursor superou o antigo em cada configuração de modelos, com o mesmo orçamento de tempo e os mesmos modelos. A equipe mediu a proporção do conjunto oculto (held-out) de testes SQL que foi superada — e, por essa métrica, a vantagem se mostrou consistente, não pontual.

  • A tarefa: construir o SQLite do zero em Rust usando apenas a documentação
  • Grok 4.5 no novo enxame: 80% dos testes em 4 horas
  • O enxame antigo travou na mesma tarefa e foi interrompido antes da segunda hora
  • O carro-chefe dos experimentos anteriores (início de 2026) — um enxame que construiu um navegador web do zero: uma prova de conceito, mas não um produto polido
  • Dentro da Cursor, o enxame já procurou e corrigiu vulnerabilidades em projetos open source, aumentou a cobertura de testes e gerou bilhões de tokens de dados sintéticos para treinamento

Por que um enxame supera um agente único?

O enxame vence pela eficiência de contexto, não pelo paralelismo em si — a própria Cursor insiste nisso. Tarefas grandes se decompõem naturalmente em uma árvore: o objetivo na raiz é dividido recursivamente em unidades elementares de trabalho. O enxame da Cursor é organizado em torno de dois papéis: agentes Planner, nos modelos mais inteligentes, dividem o objetivo e delegam partes, enquanto agentes Worker, em modelos rápidos e baratos, executam essas partes.

A chave é que o planner nunca escreve código, e o worker nunca planeja. Assim, o contexto do planejador não fica sobrecarregado com detalhes de baixo nível, e o executor gasta todo o seu contexto em uma única tarefa restrita. Já um agente único precisa manter em mente tanto o objetivo geral quanto sua posição atual na árvore — e, com o tempo, "se perde".

O próprio design do enxame é um superconjunto de esquemas de orquestração mais rígidos: em vez de uma topologia fixa, sua forma cresce conforme os contornos da tarefa, por isso a abordagem se generaliza tanto para a construção de um navegador quanto para a resolução de problemas matemáticos ou a otimização de kernels de GPU.

"Acreditamos que a capacidade de escalar um enxame de agentes vem dessa eficiência de contexto, e não do paralelismo em si", — equipe da

Cursor, no blog da empresa.

Quanto isso custa

O custo das execuções variou enormemente com uma qualidade quase idêntica — essa é a "nova economia dos modelos" do título do estudo. A Cursor variou a distribuição de papéis: em algumas execuções, um único modelo fazia tudo; em outras, um modelo de fronteira planejava e um modelo rápido e barato executava o trabalho. A qualidade final saía parecida, mas o custo era fundamentalmente diferente. Uma lógica semelhante foi descrita já em 1937 pelo economista Ronald Coase: os custos de coordenação crescem mais rápido que o próprio trabalho, por isso as organizações se dividem em níveis de unidades limitadas, em vez de permitir que todos se comuniquem com todos.

Um problema de engenharia à parte é o controle de versão. Git e Cargo se baseiam em travas grosseiras, o que é normal para um único desenvolvedor, mas não aguenta centenas de agentes em paralelo. Segundo dados da Cursor, o enxame do navegador do ano passado esbarrava em um teto de cerca de 1000 commits por hora no Git; o novo sistema suporta algo em torno de 1000 commits por segundo — motivo pelo qual a Cursor construiu seu próprio sistema de controle de versão.

O que isso significa

Os sistemas multiagentes estão passando do princípio de "vamos rodar mais agentes" para uma engenharia de coordenação deliberada: a divisão correta de papéis entre um modelo caro e um barato entrega a mesma qualidade por uma fração do custo. A economia das decisões agora depende não só de qual modelo escolher, mas também de como distribuir o trabalho entre eles.

Perguntas frequentes

O que é um enxame de agentes de IA?

É um sistema formado por múltiplos agentes que resolvem juntos uma única tarefa grande. Na Cursor, o enxame é composto por agentes Planner (modelos inteligentes que planejam e delegam) e agentes Worker (modelos rápidos e baratos que executam), e a forma do enxame cresce conforme os contornos da tarefa.

Por que construir o SQLite do zero?

O SQLite é um SGBD complexo e bem documentado, por isso é um teste conveniente dos limites da coordenação entre agentes. A Cursor deu ao enxame apenas a documentação e mediu a proporção de testes SQL superados; o novo enxame com Grok 4.5 chegou a 80% em 4 horas.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Quer parar de ler sobre IA e começar a usar?

AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.

O que você acha?
Carregando comentários…