Habr: Avito→ original

Агентская разработка vs вайб-кодинг: опыт Авито по контролю качества ИИ-кода

Авито поделилась подходом к качеству в агентской разработке: ИИ-агенты пишут код за секунды, но при слабых процессах лишь быстрее плодят дефекты. На бенчмарке SWE-bench модели выросли с 2% решённых задач в 2023 году до более 80% в 2026-м. Пилот на 100 инженерах не дал скачка метрик — это ожидаемая J-кривая обучения. Ключ — Spec-Driven Development: тесты до кода и 100% покрытие требований.

Processado por IA de Habr: Avito; editado por Hamidun News
Агентская разработка vs вайб-кодинг: опыт Авито по контролю качества ИИ-кода
Fonte: Habr: Avito. Colagem: Hamidun News.
◐ Ouvir artigo

Em 2026, a Avito publicou no Habr uma análise sobre como manter a qualidade do código no desenvolvimento com agentes de IA: Andrey Brovko, head de testes da Avito Auto, mostrou que, no benchmark SWE-bench, os modelos passaram em três anos de 2% de tarefas resolvidas em 2023 para mais de 80% em 2026, mas a velocidade de geração por si só não garante qualidade.

Em que o desenvolvimento agentic se diferencia do vibe coding

O desenvolvimento agentic se diferencia do vibe coding pelo controle sobre o processo: no vibe coding, o usuário simplesmente pede ao modelo para "fazer" e obtém um resultado imprevisível, enquanto a engenharia agentic conduz o agente por uma metodologia — especificação, testes, revisão — tornando o resultado reprodutível. Segundo Andrey Brovko, o vibe coding serve para tarefas informais, mas só uma abordagem estruturada pode ser escalada dentro de uma empresa.

«Agentes de IA geram código em segundos, mas a velocidade de geração de código não significa qualidade do produto.

Se os processos de desenvolvimento estão mal estruturados, os agentes simplesmente entregam defeitos mais rápido», — Andrey Brovko, head de testes da Avito Auto.

O que um piloto com 100 engenheiros mostrou

O piloto com 100 engenheiros da Avito não revelou um aumento estatisticamente significativo nas métricas objetivas de eficiência, e as métricas de qualidade permaneceram no mesmo nível — apesar da alta satisfação subjetiva da equipe. A Avito interpreta isso como a fase inicial da curva em J da DORA: primeiro as pessoas dominam a ferramenta e aprendem a verificar o código gerado, e só depois vem o efeito útil.

A economia do retorno, nesse caso, é modesta. Segundo o cálculo do artigo:

  • SWE-bench: 2% de tarefas resolvidas em 2023 → mais de 70% em 2025 → mais de 80% em 2026
  • Piloto — 100 engenheiros, o crescimento objetivo das métricas não é estatisticamente significativo
  • Salário do desenvolvedor — $2500/mês, assinatura do assistente de IA — $100/mês
  • Para o retorno, basta uma aceleração de 4% — isso equivale a 6,4 horas por mês
  • Janela de contexto do modelo recomendada — pelo menos 32K tokens

Para viabilizar isso, a Avito implantou em 2026 três serviços internos: skills-hub (uma loja de habilidades com verificação de qualidade e segurança), mcp-hub (acesso dos agentes à base de código, à documentação e ao rastreamento de bugs) e AVIDA (Avito Developer Assistant) para o lançamento autônomo e seguro de agentes por agendamento ou sob demanda.

Onde focar os testes

O foco se desloca para a esquerda — para a especificação, não para o código final. A Avito constrói seu processo em torno do Spec-Driven Development (SDD): primeiro é escrita uma especificação estruturada com histórias de usuário e critérios de aceitação, depois os testes são escritos seguindo o TDD (também revisados por um humano), e só então vem a implementação. Cada critério de aceitação está vinculado a um teste específico, o que garante 100% de cobertura de testes dos requisitos. Como frameworks já prontos são mencionados o SpecKit do GitHub, o Superpowers e o OpenSpec.

A prioridade das atividades manuais se desloca para o que os modelos ainda fazem mal: revisão da especificação, avaliação de riscos de produto e de projeto, revisão de testes e código, e testes exploratórios e de UX. Um risco à parte é que os modelos sabem "mentir": relatar sucesso quando apenas stubs foram executados. Contra isso, a Avito aplica testes de mutação e uma combinação de human-in-the-loop/agent-in-the-loop, e acompanha o progresso pelas métricas do DORA — Deployment Frequency, Lead Time for Changes, MTTR e Change Failure Rate.

O que isso significa

A conclusão da Avito é direta: com arquitetura, testes e processos de release fracos, os agentes de IA simplesmente aceleram a entrega de defeitos, enquanto com processos fortes eles entregam velocidade sem perda de estabilidade. A empresa aposta não no modelo em si, mas nos processos ao redor dele.

Perguntas frequentes

Em que o desenvolvimento agentic se diferencia do vibe coding?

Vibe coding é um pedido a um modelo sem controle do processo e com resultado imprevisível. O desenvolvimento agentic conduz o agente por uma metodologia (especificação → testes → implementação com revisão em cada etapa), o que torna o resultado reprodutível e apto para escalar.

Quando um assistente de IA se paga para uma equipe?

Segundo o cálculo da Avito, com um salário de desenvolvedor de $2500 por mês e uma assinatura de $100 por mês, basta acelerar o trabalho em apenas 4% — cerca de 6,4 horas por mês — para que a ferramenta se pague.

O que é Spec-Driven Development?

É uma abordagem em que primeiro se escreve uma especificação estruturada e os testes (seguindo o TDD), e o código aparece por último. Cada critério de aceitação está vinculado a um teste, o que garante 100% de cobertura de testes dos requisitos.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…