The Decoder→ original

Cursor: дешёвые модели пишут код по плану frontier-моделей — стоимость упала в 15 раз

Cursor устроил экзамен рою из ИИ-агентов: перестроить СУБД SQLite на Rust по одной документации, без исходников и интернета. Новая система разделила роли — топовая модель (Opus 4.8, GPT-5.5) планирует, дешёвая Composer пишет код. Итог: все конфигурации дошли до 100% тестов, а стоимость упала с $10 565 у одиночного агента до $1339 — в 15 раз.

Procesado por IA desde The Decoder; editado por Hamidun News
Cursor: дешёвые модели пишут код по плану frontier-моделей — стоимость упала в 15 раз
Fuente: The Decoder. Collage: Hamidun News.
◐ Escuchar artículo

En julio de 2026, Cursor realizó un experimento: hizo que un enjambre de agentes de IA reescribiera desde cero el motor de base de datos SQLite en Rust, teniendo solo la documentación — sin código fuente, sin acceso a internet y sin pruebas ya preparadas. La nueva versión del "enjambre" (agent swarm), que separa un modelo planificador de los modelos ejecutores, terminó pasando el 100% del conjunto de pruebas en todas las configuraciones, y la solución más barata costó 15 veces menos que un único agente de primer nivel.

Qué probó exactamente Cursor

Cursor le dio a los agentes una sola tarea: recrear SQLite en Rust desde cero, basándose únicamente en la documentación oficial. El resultado final se verificó con el benchmark sqllogictest, con millones de consultas SQL; según Cursor, cada configuración del nuevo sistema terminó alcanzando el 100% de las pruebas superadas, mientras que el "enjambre" antiguo se quedaba atascado en un rango de 11–77%.

La idea clave de la nueva arquitectura es separar los roles. El modelo frontier, caro, actúa como planificador: divide la tarea y toma las decisiones arquitectónicas. El grueso del código rutinario lo escriben los modelos worker baratos.

  • Tarea: reescribir SQLite en Rust solo a partir de la documentación, sin código fuente ni internet
  • Planificadores: GPT-5.5, Grok 4.5, Opus 4.8, Fable 5
  • Ejecutor: Composer 2.5 (también se probó como agente único para comparar)
  • Verificación: benchmark sqllogictest, millones de consultas SQL
  • El nuevo sistema a las 4 horas: 73–85% al inicio, todos llegaron al 100%; el antiguo: 11–77%

Por qué el planificador elimina el caos

La separación de roles libra al enjambre de los conflictos de fusión que antes se creaba a sí mismo. En la configuración con Grok 4.5, el sistema antiguo generó 68.000 commits y más de 70.000 conflictos de fusión en dos horas, y se ahogó en ellos. El nuevo enjambre mantuvo un ritmo de alrededor de 1.000 commits por segundo y en ningún momento superó los 1.000 conflictos simultáneos.

La diferencia también se nota en el volumen de código con una calidad comparable. La combinación "Fable 5 planifica + Composer escribe" se quedó en 9.908 líneas frente a las 64.305 del enfoque antiguo. El par "Opus 4.8 + Composer" — 4.645 líneas frente a 19.013. Menos código significa menos errores y un mantenimiento más barato.

Cuánto se logró ahorrar

El costo de las ejecuciones varió 15 veces para un resultado comparable: desde $1.339 por la combinación "Opus 4.8 + Composer" hasta $10.565 por un GPT-5.5 en solitario. Según Cursor, los modelos worker consumían el 69–90%+ de todos los tokens, pero debido a la diferencia de precios su aporte a la factura final fue mucho más modesto: lo caro, en general, es sobre todo la planificación.

El modelo frontier asume la descomposición y las decisiones clave,

mientras que los modelos worker, más baratos, ejecutan el plan de forma eficiente una vez eliminada la ambigüedad — esa es la principal conclusión del equipo de Cursor tras el experimento.

Qué significa esto

La economía de la programación con IA está cambiando: pagar por el modelo de primer nivel tiene sentido en la etapa de planificación, mientras que la implementación en sí se puede confiar a ejecutores baratos casi sin pérdida de calidad. Para los equipos esto significa una reducción multiplicada de los costos de la generación autónoma de código, siempre que alguien inteligente divida bien la tarea.

Preguntas frecuentes

¿Qué es un agent swarm en Cursor?

Un agent swarm es un enjambre de múltiples agentes de IA que trabajan en paralelo sobre una misma tarea. En la nueva versión, Cursor los dividió en un planificador (un modelo caro) y ejecutores (muchos baratos), lo que eliminó los conflictos de fusión masivos.

¿Qué modelos planificaban y cuáles escribían el código?

Los planificadores fueron GPT-5.5, Grok 4.5, Opus 4.8 y Fable 5. El código lo escribió el modelo Composer 2.5, que también se probó en solitario para comparar.

¿Cuánto más barato resultó el código?

La diferencia fue de 15 veces: desde $1.339 por la combinación Opus 4.8 + Composer hasta $10.565 por un GPT-5.5 en solitario, con una calidad de resultado comparable.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?

Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).

¿Qué te parece?
Cargando comentarios…