Cursor: рой ИИ-агентов собрал SQLite на 80% за 4 часа — и в разы дешевле старого
Cursor прогнала старый и новый рой ИИ-агентов на одной задаче — собрать SQLite с нуля на Rust по одной документации. Новый рой обошёл старый во всех конфигурациях: с Grok 4.5 он прошёл 80% тестового набора SQL за 4 часа, а старый забуксовал, и его остановили ещё до второго часа. При схожем качестве стоимость прогонов различалась в разы — в зависимости от того, какие модели планировали, а какие исполняли.
Processado por IA de Cursor Blog; editado por Hamidun News
A Cursor comparou a versão antiga e a nova do seu enxame de agentes de IA em uma mesma tarefa — construir o SGBD SQLite do zero em Rust, tendo como entrada apenas a sua documentação — e o novo enxame passou em 80% de um conjunto oculto de testes SQL em quatro horas usando o modelo Grok 4.5, enquanto o enxame antigo travou e foi interrompido antes de completar a segunda hora de trabalho.
O que o experimento mostrou
O novo enxame da Cursor superou o antigo em cada configuração de modelos, com o mesmo orçamento de tempo e os mesmos modelos. A equipe mediu a proporção do conjunto oculto (held-out) de testes SQL que foi superada — e, por essa métrica, a vantagem se mostrou consistente, não pontual.
- A tarefa: construir o SQLite do zero em Rust usando apenas a documentação
- Grok 4.5 no novo enxame: 80% dos testes em 4 horas
- O enxame antigo travou na mesma tarefa e foi interrompido antes da segunda hora
- O carro-chefe dos experimentos anteriores (início de 2026) — um enxame que construiu um navegador web do zero: uma prova de conceito, mas não um produto polido
- Dentro da Cursor, o enxame já procurou e corrigiu vulnerabilidades em projetos open source, aumentou a cobertura de testes e gerou bilhões de tokens de dados sintéticos para treinamento
Por que um enxame supera um agente único?
O enxame vence pela eficiência de contexto, não pelo paralelismo em si — a própria Cursor insiste nisso. Tarefas grandes se decompõem naturalmente em uma árvore: o objetivo na raiz é dividido recursivamente em unidades elementares de trabalho. O enxame da Cursor é organizado em torno de dois papéis: agentes Planner, nos modelos mais inteligentes, dividem o objetivo e delegam partes, enquanto agentes Worker, em modelos rápidos e baratos, executam essas partes.
A chave é que o planner nunca escreve código, e o worker nunca planeja. Assim, o contexto do planejador não fica sobrecarregado com detalhes de baixo nível, e o executor gasta todo o seu contexto em uma única tarefa restrita. Já um agente único precisa manter em mente tanto o objetivo geral quanto sua posição atual na árvore — e, com o tempo, "se perde".
O próprio design do enxame é um superconjunto de esquemas de orquestração mais rígidos: em vez de uma topologia fixa, sua forma cresce conforme os contornos da tarefa, por isso a abordagem se generaliza tanto para a construção de um navegador quanto para a resolução de problemas matemáticos ou a otimização de kernels de GPU.
"Acreditamos que a capacidade de escalar um enxame de agentes vem dessa eficiência de contexto, e não do paralelismo em si", — equipe da
Cursor, no blog da empresa.
Quanto isso custa
O custo das execuções variou enormemente com uma qualidade quase idêntica — essa é a "nova economia dos modelos" do título do estudo. A Cursor variou a distribuição de papéis: em algumas execuções, um único modelo fazia tudo; em outras, um modelo de fronteira planejava e um modelo rápido e barato executava o trabalho. A qualidade final saía parecida, mas o custo era fundamentalmente diferente. Uma lógica semelhante foi descrita já em 1937 pelo economista Ronald Coase: os custos de coordenação crescem mais rápido que o próprio trabalho, por isso as organizações se dividem em níveis de unidades limitadas, em vez de permitir que todos se comuniquem com todos.
Um problema de engenharia à parte é o controle de versão. Git e Cargo se baseiam em travas grosseiras, o que é normal para um único desenvolvedor, mas não aguenta centenas de agentes em paralelo. Segundo dados da Cursor, o enxame do navegador do ano passado esbarrava em um teto de cerca de 1000 commits por hora no Git; o novo sistema suporta algo em torno de 1000 commits por segundo — motivo pelo qual a Cursor construiu seu próprio sistema de controle de versão.
O que isso significa
Os sistemas multiagentes estão passando do princípio de "vamos rodar mais agentes" para uma engenharia de coordenação deliberada: a divisão correta de papéis entre um modelo caro e um barato entrega a mesma qualidade por uma fração do custo. A economia das decisões agora depende não só de qual modelo escolher, mas também de como distribuir o trabalho entre eles.
Perguntas frequentes
O que é um enxame de agentes de IA?
É um sistema formado por múltiplos agentes que resolvem juntos uma única tarefa grande. Na Cursor, o enxame é composto por agentes Planner (modelos inteligentes que planejam e delegam) e agentes Worker (modelos rápidos e baratos que executam), e a forma do enxame cresce conforme os contornos da tarefa.
Por que construir o SQLite do zero?
O SQLite é um SGBD complexo e bem documentado, por isso é um teste conveniente dos limites da coordenação entre agentes. A Cursor deu ao enxame apenas a documentação e mediu a proporção de testes SQL superados; o novo enxame com Grok 4.5 chegou a 80% em 4 horas.
Quer parar de ler sobre IA e começar a usar?
AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.