Cursor: дешёвые модели пишут код по плану frontier-моделей — стоимость упала в 15 раз
Cursor устроил экзамен рою из ИИ-агентов: перестроить СУБД SQLite на Rust по одной документации, без исходников и интернета. Новая система разделила роли — топовая модель (Opus 4.8, GPT-5.5) планирует, дешёвая Composer пишет код. Итог: все конфигурации дошли до 100% тестов, а стоимость упала с $10 565 у одиночного агента до $1339 — в 15 раз.
Traité par IA depuis The Decoder ; édité par Hamidun News
En juillet 2026, Cursor a mené une expérience : il a chargé un essaim d'agents IA de réécrire de zéro le SGBD SQLite en Rust, en ne disposant que de la documentation — sans code source, sans accès à internet et sans tests déjà prêts. La nouvelle version de « l'essaim » (agent swarm), qui sépare un modèle planificateur des modèles exécutants, a fini par réussir 100% du jeu de tests dans toutes les configurations, et la solution la moins chère est revenue 15 fois moins cher qu'un agent unique haut de gamme.
Ce que Cursor a exactement testé
Cursor a donné aux agents une seule tâche : recréer SQLite en Rust à partir de zéro, en se basant uniquement sur la documentation officielle. Le résultat final a été vérifié sur le benchmark sqllogictest, avec des millions de requêtes SQL ; selon Cursor, chaque configuration du nouveau système a fini par atteindre 100% de réussite aux tests, alors que l'ancien « essaim » restait bloqué dans une fourchette de 11 à 77%.
L'idée clé de la nouvelle architecture est de séparer les rôles. Le modèle frontier, coûteux, fait office de planificateur : il découpe la tâche et prend les décisions d'architecture. L'essentiel du code de routine est écrit par des modèles worker bon marché.
- Tâche : réécrire SQLite en Rust uniquement à partir de la documentation, sans code source ni internet
- Planificateurs : GPT-5.5, Grok 4.5, Opus 4.8, Fable 5
- Exécutant : Composer 2.5 (également testé comme agent unique à des fins de comparaison)
- Vérification : benchmark sqllogictest, millions de requêtes SQL
- Nouveau système au bout de 4 heures : 73–85% au départ, tous ont atteint 100% ; l'ancien : 11–77%
Pourquoi le planificateur supprime le chaos
La séparation des rôles libère l'essaim des conflits de fusion (merge) qu'il créait auparavant lui-même. Sur la configuration avec Grok 4.5, l'ancien système a généré 68 000 commits et plus de 70 000 conflits de fusion en deux heures — et s'y est noyé. Le nouvel essaim a tenu un rythme d'environ 1 000 commits par seconde tout en ne dépassant jamais 1 000 conflits simultanés.
La différence se voit aussi dans le volume de code, à qualité comparable. Le duo « Fable 5 planifie + Composer écrit » a tenu en 9 908 lignes contre 64 305 pour l'ancienne approche. Le duo « Opus 4.8 + Composer » — 4 645 lignes contre 19 013. Moins de code veut dire moins de bugs et une maintenance moins chère.
Combien a-t-on réussi à économiser
Le coût des exécutions variait de 15 fois pour un résultat comparable : de 1 339 $ pour le duo « Opus 4.8 + Composer » à 10 565 $ pour un GPT-5.5 seul. Selon Cursor, les modèles worker consommaient 69 à 90%+ de tous les tokens, mais, en raison de la différence de prix, leur part dans la facture finale était bien plus modeste — c'est surtout la planification qui coûte cher.
Le modèle frontier prend en charge la décomposition et les décisions
clés, tandis que les modèles worker moins chers exécutent le plan efficacement une fois l'ambiguïté levée — telle est la conclusion principale de l'équipe Cursor à l'issue de l'expérience.
Ce que cela signifie
L'économie du codage par IA est en train de changer : payer pour un modèle haut de gamme a du sens à l'étape de planification, tandis que la réalisation elle-même peut être confiée à des exécutants bon marché, presque sans perte de qualité. Pour les équipes, cela signifie une réduction multiple des dépenses liées à la génération de code autonome — à condition que quelqu'un d'avisé découpe correctement la tâche.
Questions fréquentes
Qu'est-ce qu'un agent swarm chez Cursor ?
Un agent swarm est un essaim composé de nombreux agents IA qui travaillent en parallèle sur une même tâche. Dans la nouvelle version, Cursor les a répartis entre un planificateur (un seul modèle coûteux) et des exécutants (de nombreux modèles bon marché), ce qui a supprimé les conflits de fusion massifs.
Quels modèles planifiaient, et lesquels écrivaient le code ?
Les planificateurs étaient GPT-5.5, Grok 4.5, Opus 4.8 et Fable 5. Le code était écrit par le modèle Composer 2.5 — également testé seul à des fins de comparaison.
De combien le code est-il revenu moins cher ?
L'écart était de 15 fois : de 1 339 $ pour le duo Opus 4.8 + Composer à 10 565 $ pour un GPT-5.5 seul, à qualité de résultat comparable.
Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?
Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).
L'essentiel de l'IA — une fois par semaine
Sept actus qui ont vraiment compté, choisies à la main. Sans bruit ni communiqués.
C'est fait ! Vérifiez votre boîte mail pour la confirmation.