The Decoder→ original

Cursor: дешёвые модели пишут код по плану frontier-моделей — стоимость упала в 15 раз

Cursor устроил экзамен рою из ИИ-агентов: перестроить СУБД SQLite на Rust по одной документации, без исходников и интернета. Новая система разделила роли — топовая модель (Opus 4.8, GPT-5.5) планирует, дешёвая Composer пишет код. Итог: все конфигурации дошли до 100% тестов, а стоимость упала с $10 565 у одиночного агента до $1339 — в 15 раз.

Traité par IA depuis The Decoder ; édité par Hamidun News
Cursor: дешёвые модели пишут код по плану frontier-моделей — стоимость упала в 15 раз
Source : The Decoder. Collage: Hamidun News.
◐ Écouter l'article

En juillet 2026, Cursor a mené une expérience : il a chargé un essaim d'agents IA de réécrire de zéro le SGBD SQLite en Rust, en ne disposant que de la documentation — sans code source, sans accès à internet et sans tests déjà prêts. La nouvelle version de « l'essaim » (agent swarm), qui sépare un modèle planificateur des modèles exécutants, a fini par réussir 100% du jeu de tests dans toutes les configurations, et la solution la moins chère est revenue 15 fois moins cher qu'un agent unique haut de gamme.

Ce que Cursor a exactement testé

Cursor a donné aux agents une seule tâche : recréer SQLite en Rust à partir de zéro, en se basant uniquement sur la documentation officielle. Le résultat final a été vérifié sur le benchmark sqllogictest, avec des millions de requêtes SQL ; selon Cursor, chaque configuration du nouveau système a fini par atteindre 100% de réussite aux tests, alors que l'ancien « essaim » restait bloqué dans une fourchette de 11 à 77%.

L'idée clé de la nouvelle architecture est de séparer les rôles. Le modèle frontier, coûteux, fait office de planificateur : il découpe la tâche et prend les décisions d'architecture. L'essentiel du code de routine est écrit par des modèles worker bon marché.

  • Tâche : réécrire SQLite en Rust uniquement à partir de la documentation, sans code source ni internet
  • Planificateurs : GPT-5.5, Grok 4.5, Opus 4.8, Fable 5
  • Exécutant : Composer 2.5 (également testé comme agent unique à des fins de comparaison)
  • Vérification : benchmark sqllogictest, millions de requêtes SQL
  • Nouveau système au bout de 4 heures : 73–85% au départ, tous ont atteint 100% ; l'ancien : 11–77%

Pourquoi le planificateur supprime le chaos

La séparation des rôles libère l'essaim des conflits de fusion (merge) qu'il créait auparavant lui-même. Sur la configuration avec Grok 4.5, l'ancien système a généré 68 000 commits et plus de 70 000 conflits de fusion en deux heures — et s'y est noyé. Le nouvel essaim a tenu un rythme d'environ 1 000 commits par seconde tout en ne dépassant jamais 1 000 conflits simultanés.

La différence se voit aussi dans le volume de code, à qualité comparable. Le duo « Fable 5 planifie + Composer écrit » a tenu en 9 908 lignes contre 64 305 pour l'ancienne approche. Le duo « Opus 4.8 + Composer » — 4 645 lignes contre 19 013. Moins de code veut dire moins de bugs et une maintenance moins chère.

Combien a-t-on réussi à économiser

Le coût des exécutions variait de 15 fois pour un résultat comparable : de 1 339 $ pour le duo « Opus 4.8 + Composer » à 10 565 $ pour un GPT-5.5 seul. Selon Cursor, les modèles worker consommaient 69 à 90%+ de tous les tokens, mais, en raison de la différence de prix, leur part dans la facture finale était bien plus modeste — c'est surtout la planification qui coûte cher.

Le modèle frontier prend en charge la décomposition et les décisions

clés, tandis que les modèles worker moins chers exécutent le plan efficacement une fois l'ambiguïté levée — telle est la conclusion principale de l'équipe Cursor à l'issue de l'expérience.

Ce que cela signifie

L'économie du codage par IA est en train de changer : payer pour un modèle haut de gamme a du sens à l'étape de planification, tandis que la réalisation elle-même peut être confiée à des exécutants bon marché, presque sans perte de qualité. Pour les équipes, cela signifie une réduction multiple des dépenses liées à la génération de code autonome — à condition que quelqu'un d'avisé découpe correctement la tâche.

Questions fréquentes

Qu'est-ce qu'un agent swarm chez Cursor ?

Un agent swarm est un essaim composé de nombreux agents IA qui travaillent en parallèle sur une même tâche. Dans la nouvelle version, Cursor les a répartis entre un planificateur (un seul modèle coûteux) et des exécutants (de nombreux modèles bon marché), ce qui a supprimé les conflits de fusion massifs.

Quels modèles planifiaient, et lesquels écrivaient le code ?

Les planificateurs étaient GPT-5.5, Grok 4.5, Opus 4.8 et Fable 5. Le code était écrit par le modèle Composer 2.5 — également testé seul à des fins de comparaison.

De combien le code est-il revenu moins cher ?

L'écart était de 15 fois : de 1 339 $ pour le duo Opus 4.8 + Composer à 10 565 $ pour un GPT-5.5 seul, à qualité de résultat comparable.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?

Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).

Qu'en pensez-vous ?
Chargement des commentaires…