Агентская разработка vs вайб-кодинг: опыт Авито по контролю качества ИИ-кода
Авито поделилась подходом к качеству в агентской разработке: ИИ-агенты пишут код за секунды, но при слабых процессах лишь быстрее плодят дефекты. На бенчмарке SWE-bench модели выросли с 2% решённых задач в 2023 году до более 80% в 2026-м. Пилот на 100 инженерах не дал скачка метрик — это ожидаемая J-кривая обучения. Ключ — Spec-Driven Development: тесты до кода и 100% покрытие требований.
Traité par IA depuis Habr: Avito ; édité par Hamidun News
En 2026, Avito a publié sur Habr une analyse sur la manière de préserver la qualité du code dans le développement avec des agents d'IA : Andrey Brovko, responsable des tests chez Avito Auto, a montré que sur le benchmark SWE-bench, les modèles sont passés en trois ans de 2% de tâches résolues en 2023 à plus de 80% en 2026, mais que la vitesse de génération en elle-même ne garantit pas la qualité.
En quoi le développement agentique se distingue du vibe coding
Le développement agentique se distingue du vibe coding par le contrôle exercé sur le processus : avec le vibe coding, l'utilisateur demande simplement au modèle de « faire » et obtient un résultat imprévisible, tandis que l'ingénierie agentique guide l'agent à travers une méthodologie — spécification, tests, revue — et rend le résultat reproductible. Selon Andrey Brovko, le vibe coding convient aux tâches informelles, mais seule une approche structurée peut être mise à l'échelle au sein d'une entreprise.
« Les agents d'IA génèrent du code en quelques secondes, mais la vitesse de génération du code ne signifie pas la qualité du produit.
Si les processus de développement sont mal structurés, les agents livrent simplement les défauts plus vite », — Andrey Brovko, responsable des tests chez Avito Auto.
Ce qu'a montré le pilote mené sur 100 ingénieurs
Le pilote mené sur 100 ingénieurs d'Avito n'a révélé aucune augmentation statistiquement significative des indicateurs objectifs d'efficacité, et les indicateurs de qualité sont restés au même niveau — malgré une forte satisfaction subjective de l'équipe. Avito interprète cela comme la phase initiale de la courbe en J de DORA : les personnes commencent par maîtriser l'outil et apprennent à vérifier le code généré, et ce n'est qu'ensuite que l'effet utile apparaît.
L'économie du retour sur investissement est, dans ce cas, modeste. Selon le calcul présenté dans l'article :
- SWE-bench : 2% de tâches résolues en 2023 → plus de 70% en 2025 → plus de 80% en 2026
- Pilote — 100 ingénieurs, croissance objective des indicateurs statistiquement non significative
- Salaire d'un développeur — 2500 $/mois, abonnement à l'assistant d'IA — 100 $/mois
- Pour être rentable, une accélération de 4% suffit — soit 6,4 heures par mois
- Fenêtre de contexte du modèle recommandée — au moins 32K tokens
Pour cela, Avito a déployé en 2026 trois services internes : skills-hub (une boutique de compétences avec vérification de la qualité et de la sécurité), mcp-hub (accès des agents à la base de code, à la documentation et au suivi des bugs) et AVIDA (Avito Developer Assistant) pour le lancement autonome et sécurisé des agents sur planning ou à la demande.
Sur quoi concentrer les tests
Le focus se déplace vers l'amont — vers la spécification, et non vers le code final. Avito construit son processus autour du Spec-Driven Development (SDD) : on rédige d'abord une spécification structurée avec des user stories et des critères d'acceptation, puis les tests sont écrits selon le TDD (également revus par un humain), et l'implémentation ne vient qu'ensuite. Chaque critère d'acceptation renvoie à un test précis, ce qui garantit une couverture des exigences par les tests de 100%. Sont cités comme frameworks déjà prêts SpecKit de GitHub, Superpowers et OpenSpec.
La priorité des activités manuelles se déplace vers ce que les modèles font encore mal : revue de la spécification, évaluation des risques produit et projet, revue des tests et du code, tests exploratoires et tests UX. Un risque à part : les modèles savent « mentir » — signaler un succès alors que seuls des stubs sont passés. Pour contrer cela, Avito applique des tests de mutation et une combinaison human-in-the-loop/agent-in-the-loop, et suit sa progression via les indicateurs DORA — Deployment Frequency, Lead Time for Changes, MTTR et Change Failure Rate.
Ce que cela signifie
La conclusion d'Avito est directe : avec une architecture, des tests et des processus de mise en production faibles, les agents d'IA ne font qu'accélérer la livraison de défauts, tandis qu'avec des processus solides, ils apportent de la vitesse sans perte de stabilité. L'entreprise ne mise pas sur le modèle lui-même, mais sur les processus qui l'entourent.
Questions fréquentes
En quoi le développement agentique se distingue-t-il du vibe coding ?
Le vibe coding est une requête adressée à un modèle sans contrôle du processus et avec un résultat imprévisible. Le développement agentique guide l'agent à travers une méthodologie (spécification → tests → implémentation avec revue à chaque étape), ce qui rend le résultat reproductible et adapté à la mise à l'échelle.
Quand un assistant d'IA devient-il rentable pour une équipe ?
Selon le calcul d'Avito, avec un salaire de développeur de 2500 $ par mois et un abonnement de 100 $ par mois, il suffit d'accélérer le travail de seulement 4% — environ 6,4 heures par mois — pour que l'outil soit rentabilisé.
Qu'est-ce que le Spec-Driven Development ?
C'est une approche où l'on rédige d'abord une spécification structurée et des tests (selon le TDD), le code n'arrivant qu'en dernier. Chaque critère d'acceptation est lié à un test, ce qui garantit une couverture des exigences par les tests de 100%.
Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?
Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).
L'essentiel de l'IA — une fois par semaine
Sept actus qui ont vraiment compté, choisies à la main. Sans bruit ni communiqués.
C'est fait ! Vérifiez votre boîte mail pour la confirmation.