Habr: Avito→ original

Агентская разработка vs вайб-кодинг: опыт Авито по контролю качества ИИ-кода

Авито поделилась подходом к качеству в агентской разработке: ИИ-агенты пишут код за секунды, но при слабых процессах лишь быстрее плодят дефекты. На бенчмарке SWE-bench модели выросли с 2% решённых задач в 2023 году до более 80% в 2026-м. Пилот на 100 инженерах не дал скачка метрик — это ожидаемая J-кривая обучения. Ключ — Spec-Driven Development: тесты до кода и 100% покрытие требований.

Procesado por IA desde Habr: Avito; editado por Hamidun News
Агентская разработка vs вайб-кодинг: опыт Авито по контролю качества ИИ-кода
Fuente: Habr: Avito. Collage: Hamidun News.
◐ Escuchar artículo

En 2026, Avito publicó en Habr un análisis sobre cómo mantener la calidad del código en el desarrollo con agentes de IA: Andrey Brovko, responsable de testing de Avito Auto, mostró que en el benchmark SWE-bench los modelos pasaron en tres años del 2% de tareas resueltas en 2023 a más del 80% en 2026, pero la velocidad de generación por sí sola no garantiza la calidad.

En qué se diferencia el desarrollo agéntico del vibe-coding

El desarrollo agéntico se diferencia del vibe-coding en el control sobre el proceso: en el vibe-coding, el usuario simplemente le pide al modelo "hacerlo" y obtiene un resultado impredecible, mientras que la ingeniería agéntica guía al agente a través de una metodología —especificación, pruebas, revisión— y hace que el resultado sea reproducible. Según Andrey Brovko, el vibe-coding sirve para tareas informales, pero en una empresa solo se puede escalar con un enfoque estructurado.

«Los agentes de IA generan código en segundos, pero la velocidad de generación de código no significa calidad de producto.

Si los procesos de desarrollo están mal estructurados, los agentes simplemente entregan defectos más rápido», — Andrey Brovko, responsable de testing de Avito Auto.

Qué mostró el piloto con 100 ingenieros

El piloto con 100 ingenieros de Avito no reveló un aumento estadísticamente significativo en las métricas objetivas de eficiencia, y las métricas de calidad se mantuvieron en el mismo nivel, pese a la alta satisfacción subjetiva del equipo. Avito interpreta esto como la fase inicial de la curva en J de DORA: primero las personas dominan la herramienta y aprenden a verificar el código generado, y solo después llega el efecto útil.

La economía del retorno de inversión es, en este caso, modesta. Según el cálculo del artículo:

  • SWE-bench: 2% de tareas resueltas en 2023 → más del 70% en 2025 → más del 80% en 2026
  • Piloto: 100 ingenieros, el crecimiento objetivo de las métricas no es estadísticamente significativo
  • Salario del desarrollador: $2500/mes, suscripción al asistente de IA: $100/mes
  • Para amortizar la inversión basta con una aceleración del 4%, es decir, 6,4 horas al mes
  • Ventana de contexto del modelo recomendada: al menos 32K tokens

Para respaldar esto, Avito desplegó en 2026 tres servicios internos: skills-hub (una tienda de habilidades con verificación de calidad y seguridad), mcp-hub (acceso de los agentes a la base de código, la documentación y el seguimiento de errores) y AVIDA (Avito Developer Assistant) para el lanzamiento autónomo y seguro de agentes según un cronograma o a demanda.

En qué enfocar las pruebas

El foco se desplaza hacia la izquierda: hacia la especificación, no hacia el código final. Avito construye su proceso en torno al Spec-Driven Development (SDD): primero se escribe una especificación estructurada con historias de usuario y criterios de aceptación, luego se escriben las pruebas siguiendo TDD (también revisadas por una persona), y solo después llega la implementación. Cada criterio de aceptación está vinculado a una prueba concreta, lo que da una cobertura del 100% de los requisitos mediante pruebas. Como marcos ya disponibles se mencionan SpecKit de GitHub, Superpowers y OpenSpec.

La prioridad de las actividades manuales se desplaza hacia lo que los modelos todavía hacen mal: revisión de la especificación, evaluación de riesgos de producto y de proyecto, revisión de pruebas y código, y testing exploratorio y de UX. Un riesgo aparte es que los modelos saben "mentir": informar de un éxito cuando solo pasaron stubs (simulaciones). Contra esto, Avito aplica pruebas de mutación y una combinación de human-in-the-loop/agent-in-the-loop, y hace seguimiento del progreso mediante las métricas de DORA: Deployment Frequency, Lead Time for Changes, MTTR y Change Failure Rate.

Qué significa esto

La conclusión de Avito es directa: con una arquitectura, un testing y unos procesos de release débiles, los agentes de IA simplemente aceleran la entrega de defectos, mientras que con procesos sólidos ofrecen velocidad sin pérdida de estabilidad. La empresa apuesta no por el modelo en sí, sino por los procesos que lo rodean.

Preguntas frecuentes

¿En qué se diferencia el desarrollo agéntico del vibe-coding?

El vibe-coding es una petición a un modelo sin control del proceso y con un resultado impredecible. El desarrollo agéntico guía al agente a través de una metodología (especificación → pruebas → implementación con revisión en cada paso), por lo que el resultado se vuelve reproducible y apto para escalar.

¿Cuándo se amortiza un asistente de IA para un equipo?

Según el cálculo de Avito, con un salario de desarrollador de $2500 al mes y una suscripción de $100 al mes, basta con acelerar el trabajo solo un 4% —unas 6,4 horas al mes— para que la herramienta se amortice.

¿Qué es el Spec-Driven Development?

Es un enfoque en el que primero se escribe una especificación estructurada y las pruebas (siguiendo TDD), y el código aparece al final. Cada criterio de aceptación está vinculado a una prueba, lo que garantiza una cobertura del 100% de los requisitos mediante pruebas.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?

Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).

¿Qué te parece?
Cargando comentarios…