Cursor: рой ИИ-агентов собрал SQLite на 80% за 4 часа — и в разы дешевле старого
Cursor прогнала старый и новый рой ИИ-агентов на одной задаче — собрать SQLite с нуля на Rust по одной документации. Новый рой обошёл старый во всех конфигурациях: с Grok 4.5 он прошёл 80% тестового набора SQL за 4 часа, а старый забуксовал, и его остановили ещё до второго часа. При схожем качестве стоимость прогонов различалась в разы — в зависимости от того, какие модели планировали, а какие исполняли.
Traité par IA depuis Cursor Blog ; édité par Hamidun News
Cursor a comparé l'ancienne et la nouvelle version de son essaim d'agents IA sur une même tâche — construire le SGBD SQLite à partir de zéro en Rust, en ne disposant que de sa documentation en entrée — et le nouvel essaim a réussi 80 % d'un jeu de tests SQL tenu secret (held-out) en quatre heures avec le modèle Grok 4.5, tandis que l'ancien essaim s'est enlisé et a été arrêté avant la fin de la deuxième heure de travail.
Ce que l'expérience a montré
Le nouvel essaim de Cursor a devancé l'ancien dans chaque configuration de modèles, à budget de temps égal et avec les mêmes modèles. L'équipe a mesuré la part du jeu de tests SQL tenu secret (held-out) qui était réussie — et selon cette métrique, l'avantage s'est révélé constant, pas ponctuel.
- La tâche : construire SQLite à partir de zéro en Rust en utilisant uniquement la documentation
- Grok 4.5 dans le nouvel essaim : 80 % des tests en 4 heures
- L'ancien essaim s'est enlisé sur la même tâche et a été arrêté avant la deuxième heure
- Le fleuron des expériences précédentes (début 2026) — un essaim qui a construit un navigateur web à partir de zéro : une preuve de concept, mais pas un produit abouti
- Chez Cursor, l'essaim a déjà recherché et corrigé des vulnérabilités dans des projets open source, augmenté la couverture de tests et généré des milliards de tokens de données synthétiques d'entraînement
Pourquoi un essaim devance-t-il un agent unique ?
L'essaim gagne grâce à l'efficacité du contexte, et non au parallélisme en tant que tel — Cursor elle-même insiste sur ce point. Les tâches importantes se décomposent naturellement en arbre : l'objectif à la racine est découpé récursivement en unités élémentaires de travail. L'essaim de Cursor est organisé autour de deux rôles : les agents Planner, sur les modèles les plus intelligents, divisent l'objectif et délèguent les morceaux, tandis que les agents Worker, sur des modèles rapides et bon marché, exécutent ces morceaux.
La clé est que le planner n'écrit jamais de code, et que le worker ne planifie jamais. Le contexte du planificateur n'est donc pas encombré de détails de bas niveau, et l'exécutant consacre tout son contexte à une seule tâche étroite. Un agent unique, en revanche, doit garder en tête à la fois l'objectif global et sa position actuelle dans l'arbre — et finit par « dériver » avec le temps.
La conception même de l'essaim est un sur-ensemble de schémas d'orchestration plus rigides : au lieu d'une topologie fixe, sa forme s'adapte aux contours de la tâche, ce qui permet à l'approche de se généraliser aussi bien à la construction d'un navigateur qu'à la résolution de problèmes mathématiques ou à l'optimisation de noyaux GPU.
«
Nous pensons que la capacité à faire monter en échelle un essaim d'agents provient de cette efficacité du contexte, et non du parallélisme en tant que tel », — l'équipe de Cursor, sur le blog de l'entreprise.
Combien ça coûte
Le coût des exécutions variait considérablement pour une qualité presque identique — c'est la « nouvelle économie des modèles » du titre de l'étude. Cursor a fait varier la répartition des rôles : dans certaines exécutions, un seul modèle faisait tout ; dans d'autres, un modèle de pointe planifiait pendant qu'un modèle rapide et bon marché exécutait le travail. La qualité finale s'avérait similaire, mais la facture était radicalement différente. Une logique semblable a été décrite dès 1937 par l'économiste Ronald Coase : les coûts de coordination croissent plus vite que le travail lui-même, ce qui pousse les organisations à se scinder en niveaux d'unités restreintes plutôt que de laisser tout le monde communiquer avec tout le monde.
Le contrôle de versions constitue un problème d'ingénierie à part. Git et Cargo reposent sur des verrous grossiers, ce qui convient à un développeur seul mais ne tient pas face à des centaines d'agents en parallèle. Selon Cursor, l'essaim navigateur de l'an dernier plafonnait à environ 1000 commits par heure sur Git ; le nouveau système en supporte de l'ordre de 1000 par seconde — ce qui a conduit Cursor à construire son propre système de contrôle de versions.
Ce que cela signifie
Les systèmes multi-agents passent du principe « lançons plus d'agents » à une ingénierie de coordination réfléchie : bien répartir les rôles entre un modèle coûteux et un modèle bon marché permet d'obtenir la même qualité pour une fraction du coût. L'économie des décisions dépend désormais non seulement du modèle choisi, mais aussi de la manière de répartir le travail entre eux.
Questions fréquentes
Qu'est-ce qu'un essaim d'agents IA ?
C'est un système composé de multiples agents qui résolvent ensemble une seule tâche de grande ampleur. Chez Cursor, l'essaim se compose d'agents Planner (des modèles intelligents qui planifient et délèguent) et d'agents Worker (des modèles rapides et bon marché qui exécutent), et la forme de l'essaim s'adapte aux contours de la tâche.
Pourquoi construire SQLite à partir de zéro ?
SQLite est un SGBD complexe et bien documenté, ce qui en fait un test pratique des limites de la coordination entre agents. Cursor n'a donné à l'essaim que la documentation et a mesuré la part de tests SQL réussis ; le nouvel essaim sur Grok 4.5 a atteint 80 % en 4 heures.
Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?
AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.
L'essentiel de l'IA — une fois par semaine
Sept actus qui ont vraiment compté, choisies à la main. Sans bruit ni communiqués.
C'est fait ! Vérifiez votre boîte mail pour la confirmation.