🛒
E-commerce e Fintech · Mercado Libre

Mercado Libre: a plataforma Verdi com tecnologia GPT-4o — uma expansão de catálogo de 100x e precisão de detecção de fraude de quase 99%

Segundo figuras publicadas pela OpenAI: GPT-4 Vision permitiu catalogar 100x mais produtos em dois anos; a precisão de detecção de fraude atingiu quase 99% para itens sinalizados; em alguns meses Verdi assumiu 10% da mediação de atendimento ao cliente em um dos principais sites da empresa; resumos de avaliações aumentam pedidos quando disponíveis (sem divulgação do tamanho do efeito). A empresa estima o potencial em apoiar as tarefas de 9,000 operadores e gerenciar autonomamente decisões de atendimento ao cliente no valor de $450 milhões anualmente. Um resultado separado e frequentemente ignorado é a economia da velocidade de desenvolvimento: a plataforma foi projetada 'com foco em reduzir a carga cognitiva' para que qualquer equipe possa montar, testar e implantar aplicações de AI em um ambiente unificado com testes de unidade integrados. A empresa não quantifica esse efeito, mas é precisamente o que explica construir uma plataforma em vez de contratar mais operadores. Contextualizar é obrigatório. Todas as figuras são auto-relato da empresa em um estudo de caso da OpenAI — a parte vendendo os modelos usados; não há verificação independente. O 100x é crescimento em produtos catalogados, não receita ou qualidade de listagem. 'Quase 99%' refere-se à precisão em itens sinalizados — a métrica não diz nada sobre recall (quanto fraude nunca é sinalizada). Os 10% de mediações se aplicam a um site, não ao grupo inteiro; e '9,000 operadores' e '$450 milhões' são potencial declarado, não resultados alcançados. Conflacionar essas categorias é o erro clássico ao ler estudos de caso de fornecedores. Em nossa visão, o significado chave do caso está na sequência de admitir AI ao dinheiro. Mercado Libre primeiro gastou anos executando modelos em tarefas com custo barato de erro (tags de catálogo, traduções, resumos), acumulando dados, infraestrutura e confiança organizacional — e apenas então admitiu AI a disputas com consequências monetárias, e em frações: 10% em um site, com escalação para humanos e caminho de reversão. Isso é o oposto do moderno 'agente autônomo em produção em um trimestre' — e provavelmente a única maneira de fazer essas coisas em uma empresa onde decisões de AI movem diretamente dinheiro de outras pessoas. Uma segunda observação: 'desenvolvedores nunca veem o código-fonte' é a decisão mais debatível e mais interessante do Verdi. Lemos isso como uma aposta em reduzir radicalmente a barreira de entrada (qualquer equipe monta uma app de AI a partir de nós e skills) em troca de dependência total da qualidade dos guardrails de plataforma. Com 17,000 desenvolvedores a aposta parece racional: segurança centralizada escala, revisar cada bot caseiro não. Mas não recomendaríamos portar o padrão em uma organização sem um time de plataforma maduro.

100x
mais produtos catalogados em 2 anos
~99%
precisão de detecção de fraude (itens sinalizados)
10%
de mediações tratadas por AI em um site principal
$450M
potencial em decisões autônomas anualmente
Fontes
Verificado: 2026-07-11

Contexto

O Mercado Libre é a maior empresa de e-commerce e fintech da América Latina, com 25 anos de história e o status de empresa mais valiosa da região. Sua escala de engenharia rivaliza com as grandes empresas de tecnologia: 17,000 desenvolvedores mantendo mais de 30,000 microserviços, além do braço fintech Mercado Pago com 50 milhões de usuários ativos por trimestre.

A empresa tem usado AI na OpenAI API por anos — e de forma bem 'comum', no melhor sentido. GPT-4 Vision marca e completa listagens de produtos: ao longo de dois anos isso permitiu catalogar 100x mais produtos do que antes. GPT-4 avalia dados de milhões de listagens diárias para fraude — a precisão em itens sinalizados foi elevada a quase 99%. GPT-3.5 e GPT-4 traduzem títulos e descrições de produtos com atenção às nuances dialetais do espanhol e português — para um mercado que se estende do México à Argentina, isso não é um detalhe mas uma precondição de confiança do comprador. Resumos automatizados de avaliações em GPT-4o mini ajudam usuários a compreender feedback de produtos rapidamente e aumentam pedidos onde o recurso está disponível; notificações push personalizadas aumentam o engajamento.

Nessa base, a empresa construiu Verdi — uma plataforma interna de desenvolvimento de aplicações AI em GPT-4o, GPT-4o mini e GPT-3.5 Turbo, apresentada em um estudo de caso OpenAI em setembro de 2024. A história do Verdi é interessante como um raro exemplo documentado de uma empresa migrando de 'AI como um conjunto de recursos pontuais' para 'AI como camada de plataforma' na qual qualquer um dos 17,000 desenvolvedores pode montar aplicações — até e incluindo mediação autônoma de disputas monetárias.

Problema

Aplicações de AI pontuais entregaram valor mas chegaram a um teto. O COO da empresa Daniel Rabinovich expõe esse teto sem diplomacia: 'Usar AI para catalogação e resumo de avaliações é interessante e útil, mas não transformacional. Precisávamos de uma solução que pudesse lidar com tarefas complexas e de alto risco autonomamente e mais eficientemente do que operadores humanos.'

A tarefa mais reveladora é a mediação de disputas entre compradores e vendedores. É um processo contencioso, caro e pouco escalável: um operador humano deve descobrir o que está quebrado, quem está certo, o que dizem as regras do marketplace, contactar as partes e tomar uma decisão com consequências monetárias. Tradicionalmente isso exige envolvimento humano prolongado, e o perímetro potencial é enorme — as tarefas de 9,000 operadores e decisões no valor de $450 milhões por ano.

O segundo problema é velocidade de desenvolvimento e segurança. A empresa avaliou plataformas de AI existentes e não encontrou uma combinação de iteração rápida, escalabilidade e segurança: 'Ao procurar uma plataforma de desenvolvimento, não vimos uma que resolvesse nossa necessidade de iteração rápida enquanto garantisse escalabilidade e segurança,' diz Sebastian Barrios, SVP de Tecnologia. Com 17,000 desenvolvedores, cada bot de AI caseiro com suas próprias credenciais e prompts é uma revisão de segurança separada; sem uma camada de plataforma, o desenvolvimento massivo de AI ou enfrenta burocracia ou se torna um risco ingerenciável.

Solução

A resposta foi Verdi — uma camada de plataforma em GPT-4o, GPT-4o mini e GPT-3.5 Turbo, projetada, nas palavras de Barrios, 'com foco em reduzir a carga cognitiva e permitir que toda a organização itere, desenvolva e implante novas soluções inovadoras.'

A principal diferença arquitetural do Verdi em relação aos análogos: linguagem natural permanece como modo central de interação ao longo do desenvolvimento — desenvolvedores nunca veem o código-fonte. Segurança, guardrails e lógica de roteamento são construídas na plataforma em si em vez de serem resolvidas novamente em cada aplicação. Uma aplicação é montada como uma estrutura se assemelhando a uma rede neural: nós e skills que se compõem mutuamente. Um nó 'proof of damage' chama GPT-4o Vision para determinar de uma foto o que está quebrado ou faltando do item de um cliente; uma skill 'return' fala com a skill 'shipping' por conta própria — sem envolvimento humano; os parâmetros dessas interações são definidos pelas equipes do Mercado Libre dentro da estrutura da plataforma. Além de modelos de linguagem, Verdi integra nós Python e APIs externas, opera dentro da plataforma de desenvolvimento interna (criar, implantar, testar e gerenciar aplicações em um ambiente), inclui testes de unidade integrados e é projetado para conectar novos modelos conforme ficam disponíveis.

A primeira aplicação principal foi mediação autônoma de atendimento ao cliente: a AI conduz interações com as partes, chama APIs externas e passa casos para funcionários humanos quando necessário. Significativamente, a tarefa de estreia da plataforma foi a mais inconveniente — onde multimodalidade (fotos de um item quebrado), dinheiro (reembolsos e compensações), as emoções de partes em conflito e regras do marketplace tudo converge. Dentro de alguns meses, Verdi começou a lidar com 10% da mediação em um dos principais sites da empresa. Rabinovich descreve a filosofia da plataforma: 'Com Verdi, humanos se tornam copilótos da AI em vez do contrário. Esta plataforma pode decidir autonomamente sobre casos, gerenciar interações complexas e até lidar com tarefas que exigem um toque humano, informadas por protocolos de segurança e guardrails incorporados na plataforma.'

Aproveitando o sucesso do atendimento ao cliente, a empresa começou a expandir Verdi para sua rede de logística — para envio mais rápido e menos entregas atrasadas — e planeja expansão adicional para assistentes de busca e recomendações de produtos, incluindo para os 50 milhões de usuários trimestrais do Mercado Pago. Rabinovich expõe a ambição maximamente: 'Verdi é projetado para resolver qualquer problema. É uma afirmação corajosa, mas confiamos em seu potencial.'

Resultado

Segundo figuras publicadas pela OpenAI: GPT-4 Vision permitiu catalogar 100x mais produtos em dois anos; a precisão de detecção de fraude atingiu quase 99% para itens sinalizados; em alguns meses Verdi assumiu 10% da mediação de atendimento ao cliente em um dos principais sites da empresa; resumos de avaliações aumentam pedidos quando disponíveis (sem divulgação do tamanho do efeito). A empresa estima o potencial em apoiar as tarefas de 9,000 operadores e gerenciar autonomamente decisões de atendimento ao cliente no valor de $450 milhões anualmente.

Um resultado separado e frequentemente ignorado é a economia da velocidade de desenvolvimento: a plataforma foi projetada 'com foco em reduzir a carga cognitiva' para que qualquer equipe possa montar, testar e implantar aplicações de AI em um ambiente unificado com testes de unidade integrados. A empresa não quantifica esse efeito, mas é precisamente o que explica construir uma plataforma em vez de contratar mais operadores.

Contextualizar é obrigatório. Todas as figuras são auto-relato da empresa em um estudo de caso da OpenAI — a parte vendendo os modelos usados; não há verificação independente. O 100x é crescimento em produtos catalogados, não receita ou qualidade de listagem. 'Quase 99%' refere-se à precisão em itens sinalizados — a métrica não diz nada sobre recall (quanto fraude nunca é sinalizada). Os 10% de mediações se aplicam a um site, não ao grupo inteiro; e '9,000 operadores' e '$450 milhões' são potencial declarado, não resultados alcançados. Conflacionar essas categorias é o erro clássico ao ler estudos de caso de fornecedores.

Em nossa visão, o significado chave do caso está na sequência de admitir AI ao dinheiro. Mercado Libre primeiro gastou anos executando modelos em tarefas com custo barato de erro (tags de catálogo, traduções, resumos), acumulando dados, infraestrutura e confiança organizacional — e apenas então admitiu AI a disputas com consequências monetárias, e em frações: 10% em um site, com escalação para humanos e caminho de reversão. Isso é o oposto do moderno 'agente autônomo em produção em um trimestre' — e provavelmente a única maneira de fazer essas coisas em uma empresa onde decisões de AI movem diretamente dinheiro de outras pessoas.

Uma segunda observação: 'desenvolvedores nunca veem o código-fonte' é a decisão mais debatível e mais interessante do Verdi. Lemos isso como uma aposta em reduzir radicalmente a barreira de entrada (qualquer equipe monta uma app de AI a partir de nós e skills) em troca de dependência total da qualidade dos guardrails de plataforma. Com 17,000 desenvolvedores a aposta parece racional: segurança centralizada escala, revisar cada bot caseiro não. Mas não recomendaríamos portar o padrão em uma organização sem um time de plataforma maduro.

Stack tecnológico
GPT-4o / GPT-4o mini / GPT-3.5 TurboGPT-4 VisionVerdi (внутренняя платформа: узлы, навыки, гардрейлы, маршрутизация)Python-узлы и внешние APIВстроенное юнит-тестированиеИнтеграция во внутреннюю платформу разработчика (17 000 разработчиков, 30 000+ микросервисов)
Cronologia
Anos antes de Verdi — aplicações 'comuns' da OpenAI API: catálogo (100x em dois anos), detecção de fraude (~99% em sinalizações), traduções conscientes de dialeto, resumos de avaliações, pushes personalizados; depois — projetando Verdi como camada de plataforma (iteração rápida + segurança); dentro de alguns meses do lançamento — 10% de mediações em um site principal; setembro de 2024 — o estudo de caso OpenAI é publicado; próximo estágio — extensão para logística, planos para assistentes de busca e recomendações para Mercado Pago (50 milhões de usuários ativos trimestrais).

Lições aprendidas

  1. O caminho maduro para agentes passa por anos de aplicações 'comuns': catálogo, fraude e tradução deram à empresa dados, infraestrutura e confiança antes que AI fosse permitida perto de disputas monetárias.
  2. Uma plataforma em vez de bots pontuais: quando 17,000 desenvolvedores compartilham uma camada com guardrails e roteamento integrados, cada novo app de AI deixa de ser sua própria revisão de segurança.
  3. Autonomia é introduzida em frações: 10% de mediações em um site é um experimento controlado com escalação humana e caminho de reversão, não 'mudar tudo para AI.'
  4. Separe resultados alcançados de potencial: o catálogo 100x é um fato, enquanto '9,000 operadores e $450 milhões' é uma estimativa de escala futura; conflacionar os dois é o erro clássico ao ler estudos de caso de fornecedores.
  5. Multimodalidade resolve disputas reais: um nó 'proof of damage' usando GPT-4o vision substitui o passo mais contencioso da mediação — revisar manualmente fotos de um item quebrado.
  6. Precisão em sinalizações (~99%) não é toda a verdade sobre detecção de fraude: a métrica é silenciosa sobre recall e deve ser lida junto com a pergunta 'quanto nunca é sinalizado?'
  7. 'Desenvolvedores nunca veem o código' troca barreira de entrada por dependência dos guardrails de plataforma; a aposta é racional com um time de plataforma maduro e perigosa sem um.

Perguntas frequentes

O que é Verdi no Mercado Libre?

Uma plataforma interna de desenvolvimento de AI em GPT-4o, GPT-4o mini e GPT-3.5 Turbo: desenvolvedores descrevem lógica em linguagem natural sem ver código-fonte; aplicações são montadas a partir de nós e skills (incluindo nós Python e APIs externas), enquanto segurança, guardrails e roteamento são integrados à plataforma. Testes de unidade são integrados; a plataforma vive dentro do ambiente de desenvolvimento unificado da empresa.

AI substituiu 9,000 operadores do Mercado Libre?

Não. Segundo o estudo de caso OpenAI, Verdi lida com 10% da mediação de atendimento ao cliente em um site principal; 'suportar as tarefas de 9,000 operadores' e '$450 milhões em decisões anualmente' descrevem o potencial declarado da plataforma, não um resultado alcançado. Casos são passados para funcionários humanos quando necessário.

Qual é a precisão da detecção de fraude AI do Mercado Libre?

Segundo as figuras da empresa no estudo de caso OpenAI, GPT-4 avalia dados de milhões de listagens diárias, com precisão de quase 99% para itens sinalizados. Isto é auto-relatado sem auditoria independente; uma métrica de precisão de sinalização não revela recall — a parcela de fraude nunca sinalizada.

Como AI lida com disputas de itens danificados?

Em Verdi é o nó 'proof of damage': ele chama GPT-4o Vision para determinar das fotos do cliente exatamente o que está quebrado ou faltando. Skills então interagem — por exemplo, 'return' fala com 'shipping' por conta própria — dentro de parâmetros definidos pelas equipes do Mercado Libre, escalando para humanos quando necessário.

Para onde o Mercado Libre está levando Verdi a seguir?

Segundo o estudo de caso OpenAI — para a rede de logística (envio mais rápido, menos entregas atrasadas), com planos para assistentes de busca e recomendações de produtos, incluindo para os 50 milhões de usuários trimestrais do Mercado Pago. Essas são direções declaradas; o caso não relata resultados para elas ainda.

← Casos