Агентская разработка vs вайб-кодинг: опыт Авито по контролю качества ИИ-кода
Авито поделилась подходом к качеству в агентской разработке: ИИ-агенты пишут код за секунды, но при слабых процессах лишь быстрее плодят дефекты. На бенчмарке SWE-bench модели выросли с 2% решённых задач в 2023 году до более 80% в 2026-м. Пилот на 100 инженерах не дал скачка метрик — это ожидаемая J-кривая обучения. Ключ — Spec-Driven Development: тесты до кода и 100% покрытие требований.
AI-обработка оригинала Habr: Avito; редакция Hamidun News
Авито в 2026 году опубликовала на Хабре разбор о том, как удержать качество кода в разработке с ИИ-агентами: руководитель тестирования Авито Авто Андрей Бровко показал, что на бенчмарке SWE-bench модели за три года выросли с 2% решённых задач в 2023 году до более 80% в 2026-м, но скорость генерации сама по себе качество не гарантирует.
Чем агентская разработка отличается от вайб-кодинга
Агентская разработка отличается от вайб-кодинга контролем над процессом: при вайб-кодинге пользователь просто просит модель «сделать» и получает непредсказуемый результат, а агентская инженерия ведёт агента через методологию — спецификацию, тесты, ревью — и делает результат воспроизводимым. По формулировке Андрея Бровко, вайб-кодинг годится для неформальных задач, а масштабировать в компании можно только структурированный подход.
«ИИ-агенты генерируют код за секунды, но скорость генерации кода не означает качество продукта.
Если процессы разработки выстроены слабо, агенты просто быстрее доставляют дефекты», — Андрей Бровко, руководитель тестирования Авито Авто.
Что показал пилот на 100 инженерах
Пилот на 100 инженерах Авито не выявил статистически значимого прироста объективных метрик эффективности, а метрики качества остались на прежнем уровне — при высокой субъективной удовлетворённости команды. Авито трактует это как раннюю фазу DORA J-кривой обучения: сначала люди осваивают инструмент и учатся проверять сгенерированный код, и лишь потом приходит полезный эффект.
Экономика окупаемости при этом мягкая. По расчёту из статьи:
- SWE-bench: 2% решённых задач в 2023 году → более 70% в 2025-м → более 80% в 2026-м
- Пилот — 100 инженеров, объективный прирост метрик статистически незначим
- Зарплата разработчика — $2500/мес, подписка на ИИ-ассистента — $100/мес
- Для окупаемости достаточно ускорения на 4% — это 6,4 часа в месяц
- Рекомендованное контекстное окно модели — не менее 32K токенов
Под это Авито в 2026 году развернула три внутренних сервиса: skills-hub (магазин навыков с проверкой качества и безопасности), mcp-hub (доступ агентов к кодовой базе, документации и баг-трекингу) и AVIDA (Avito Developer Assistant) для безопасного автономного запуска агентов по расписанию или запросу.
На чём фокусировать тестирование
Фокус смещается влево — на спецификацию, а не на финальный код. Авито строит процесс вокруг Spec-Driven Development (SDD): сначала пишется структурированная спецификация с пользовательскими историями и критериями приёмки, затем по TDD пишутся тесты (тоже проходящие ревью человеком), и только потом — реализация. Каждый критерий приёмки ссылается на конкретный тест, что даёт 100% покрытие требований тестами. В качестве готовых каркасов упоминаются SpecKit от GitHub, Superpowers и OpenSpec.
Приоритет ручных активностей смещается к тому, что модели пока делают плохо: проверка спецификации, оценка продуктовых и проектных рисков, ревью тестов и кода, исследовательское и UX-тестирование. Отдельный риск — модели умеют «врать»: рапортовать об успехе, когда прошли лишь заглушки. Против этого Авито применяет мутационное тестирование и связку human-in-the-loop / agent-in-the-loop, а прогресс отслеживает по метрикам DORA — Deployment Frequency, Lead Time for Changes, MTTR и Change Failure Rate.
Что это значит
Вывод Авито прямой: при слабой архитектуре, тестировании и релизных процессах ИИ-агенты просто ускоряют поставку дефектов, а при сильных — дают скорость без потери устойчивости. Ставку компания делает не на саму модель, а на процессы вокруг неё.
Частые вопросы
Чем агентская разработка отличается от вайб-кодинга?
Вайб-кодинг — это запрос к модели без контроля процесса и с непредсказуемым результатом. Агентская разработка ведёт агента через методологию (спецификация → тесты → реализация с ревью на каждом шаге), поэтому результат становится воспроизводимым и пригодным для масштабирования.
Когда ИИ-ассистент окупается для команды?
По расчёту Авито, при зарплате разработчика $2500 в месяц и подписке $100 в месяц достаточно ускорить работу всего на 4% — примерно 6,4 часа в месяц, — чтобы инструмент окупился.
Что такое Spec-Driven Development?
Это подход, где сначала пишут структурированную спецификацию и тесты (по TDD), а код появляется последним. Каждый критерий приёмки привязан к тесту, что обеспечивает 100% покрытие требований тестами.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.