Агентская разработка vs вайб-кодинг: опыт Авито по контролю качества ИИ-кода
Авито поделилась подходом к качеству в агентской разработке: ИИ-агенты пишут код за секунды, но при слабых процессах лишь быстрее плодят дефекты. На бенчмарке SWE-bench модели выросли с 2% решённых задач в 2023 году до более 80% в 2026-м. Пилот на 100 инженерах не дал скачка метрик — это ожидаемая J-кривая обучения. Ключ — Spec-Driven Development: тесты до кода и 100% покрытие требований.
Processado por IA de Habr: Avito; editado por Hamidun News
Em 2026, a Avito publicou no Habr uma análise sobre como manter a qualidade do código no desenvolvimento com agentes de IA: Andrey Brovko, head de testes da Avito Auto, mostrou que, no benchmark SWE-bench, os modelos passaram em três anos de 2% de tarefas resolvidas em 2023 para mais de 80% em 2026, mas a velocidade de geração por si só não garante qualidade.
Em que o desenvolvimento agentic se diferencia do vibe coding
O desenvolvimento agentic se diferencia do vibe coding pelo controle sobre o processo: no vibe coding, o usuário simplesmente pede ao modelo para "fazer" e obtém um resultado imprevisível, enquanto a engenharia agentic conduz o agente por uma metodologia — especificação, testes, revisão — tornando o resultado reprodutível. Segundo Andrey Brovko, o vibe coding serve para tarefas informais, mas só uma abordagem estruturada pode ser escalada dentro de uma empresa.
«Agentes de IA geram código em segundos, mas a velocidade de geração de código não significa qualidade do produto.
Se os processos de desenvolvimento estão mal estruturados, os agentes simplesmente entregam defeitos mais rápido», — Andrey Brovko, head de testes da Avito Auto.
O que um piloto com 100 engenheiros mostrou
O piloto com 100 engenheiros da Avito não revelou um aumento estatisticamente significativo nas métricas objetivas de eficiência, e as métricas de qualidade permaneceram no mesmo nível — apesar da alta satisfação subjetiva da equipe. A Avito interpreta isso como a fase inicial da curva em J da DORA: primeiro as pessoas dominam a ferramenta e aprendem a verificar o código gerado, e só depois vem o efeito útil.
A economia do retorno, nesse caso, é modesta. Segundo o cálculo do artigo:
- SWE-bench: 2% de tarefas resolvidas em 2023 → mais de 70% em 2025 → mais de 80% em 2026
- Piloto — 100 engenheiros, o crescimento objetivo das métricas não é estatisticamente significativo
- Salário do desenvolvedor — $2500/mês, assinatura do assistente de IA — $100/mês
- Para o retorno, basta uma aceleração de 4% — isso equivale a 6,4 horas por mês
- Janela de contexto do modelo recomendada — pelo menos 32K tokens
Para viabilizar isso, a Avito implantou em 2026 três serviços internos: skills-hub (uma loja de habilidades com verificação de qualidade e segurança), mcp-hub (acesso dos agentes à base de código, à documentação e ao rastreamento de bugs) e AVIDA (Avito Developer Assistant) para o lançamento autônomo e seguro de agentes por agendamento ou sob demanda.
Onde focar os testes
O foco se desloca para a esquerda — para a especificação, não para o código final. A Avito constrói seu processo em torno do Spec-Driven Development (SDD): primeiro é escrita uma especificação estruturada com histórias de usuário e critérios de aceitação, depois os testes são escritos seguindo o TDD (também revisados por um humano), e só então vem a implementação. Cada critério de aceitação está vinculado a um teste específico, o que garante 100% de cobertura de testes dos requisitos. Como frameworks já prontos são mencionados o SpecKit do GitHub, o Superpowers e o OpenSpec.
A prioridade das atividades manuais se desloca para o que os modelos ainda fazem mal: revisão da especificação, avaliação de riscos de produto e de projeto, revisão de testes e código, e testes exploratórios e de UX. Um risco à parte é que os modelos sabem "mentir": relatar sucesso quando apenas stubs foram executados. Contra isso, a Avito aplica testes de mutação e uma combinação de human-in-the-loop/agent-in-the-loop, e acompanha o progresso pelas métricas do DORA — Deployment Frequency, Lead Time for Changes, MTTR e Change Failure Rate.
O que isso significa
A conclusão da Avito é direta: com arquitetura, testes e processos de release fracos, os agentes de IA simplesmente aceleram a entrega de defeitos, enquanto com processos fortes eles entregam velocidade sem perda de estabilidade. A empresa aposta não no modelo em si, mas nos processos ao redor dele.
Perguntas frequentes
Em que o desenvolvimento agentic se diferencia do vibe coding?
Vibe coding é um pedido a um modelo sem controle do processo e com resultado imprevisível. O desenvolvimento agentic conduz o agente por uma metodologia (especificação → testes → implementação com revisão em cada etapa), o que torna o resultado reprodutível e apto para escalar.
Quando um assistente de IA se paga para uma equipe?
Segundo o cálculo da Avito, com um salário de desenvolvedor de $2500 por mês e uma assinatura de $100 por mês, basta acelerar o trabalho em apenas 4% — cerca de 6,4 horas por mês — para que a ferramenta se pague.
O que é Spec-Driven Development?
É uma abordagem em que primeiro se escreve uma especificação estruturada e os testes (seguindo o TDD), e o código aparece por último. Cada critério de aceitação está vinculado a um teste, o que garante 100% de cobertura de testes dos requisitos.
Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?
Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.