Mercado Libre: la plataforma Verdi impulsada por GPT-4o — una expansión de catálogo de 100x y precisión de detección de fraude de casi 99%
Según cifras publicadas por OpenAI: GPT-4 Vision permitió catalogar 100x más productos en dos años; la precisión de detección de fraude alcanzó casi 99% para artículos marcados; en pocos meses Verdi asumió 10% de la mediación de servicio al cliente en uno de los sitios principales de la empresa; los resúmenes de reseñas aumentan los pedidos donde están disponibles (sin tamaño de efecto divulgado). La empresa estima el potencial en apoyar las tareas de 9,000 operadores y gestionar autónomamente decisiones de servicio al cliente por valor de $450 millones anuales. Un resultado separado, frecuentemente ignorado, es la economía de la velocidad de desarrollo: la plataforma fue diseñada 'con enfoque en reducir la carga cognitiva' para que cualquier equipo pueda ensamblar, probar e implementar aplicaciones AI en un entorno unificado con pruebas unitarias integradas. La empresa no cuantifica este efecto, pero es precisamente lo que explica construir una plataforma en lugar de contratar más operadores. El encuadre es obligatorio. Todas las cifras son reportes de la propia empresa en un estudio de caso de OpenAI — la parte que vende los modelos utilizados; no hay verificación independiente. El 100x es crecimiento en productos catalogados, no en ingresos o calidad de listados. 'Casi 99%' se refiere a la precisión en artículos marcados — la métrica no dice nada sobre recall (cuánto fraude nunca es marcado en absoluto). El 10% de mediaciones aplica a un sitio, no a todo el grupo; y '9,000 operadores' y '$450M' son potencial declarado, no resultados logrados. Confundir estas categorías es el error clásico al leer estudios de caso de proveedores. En nuestra opinión, el significado clave del caso radica en la secuencia de admitir AI a dinero. Mercado Libre primero pasó años ejecutando modelos en tareas con un costo bajo de error (etiquetas de catálogo, traducciones, resúmenes), acumulando datos, infraestructura y confianza organizacional — y solo entonces admitió AI a disputas con consecuencias monetarias, y en fracciones: 10% en un sitio, con escalada a humanos y una ruta de retroceso. Esto es lo opuesto a la moda 'agente autónomo en producción en un trimestre' — y probablemente la única forma de hacer tales cosas en una empresa donde las decisiones de AI mueven directamente dinero de otras personas. Una segunda observación: 'los desarrolladores nunca ven el código fuente' es la decisión más debatable e interesante de Verdi. Lo leemos como una apuesta por reducir radicalmente la barrera de entrada (cualquier equipo ensambla una aplicación AI a partir de nodos y habilidades) a cambio de dependencia total de la calidad de los guardrails de la plataforma. Con 17,000 desarrolladores la apuesta parece racional: la seguridad centralizada escala, revisar cada bot casero no. Pero no aconsejaríamos portar el patrón a una organización sin un equipo de plataforma maduro.
- Mercado Libre introduces Verdi, an AI developer platform powered by GPT-4o — OpenAI (customer story), 2024-09
- Mercado Libre Unveils Verdi: An AI Developer Platform Powered by GPT-4o (независимый пересказ кейса, дата 25.09.2024) — AITech365, 2024-09-25
Contexto
Mercado Libre es la empresa de comercio electrónico y fintech más grande de América Latina, con un historial de 25 años y el estatus de empresa más valiosa de la región. Su escala de ingeniería rivaliza con las grandes tecnológicas: 17,000 desarrolladores manteniendo más de 30,000 microservicios, además de Mercado Pago, el brazo fintech con 50 millones de usuarios activos por trimestre.
La empresa ha utilizado AI en OpenAI API durante años — y bastante 'aburridamente', en el mejor sentido. GPT-4 Vision etiqueta y completa listados de productos: en dos años esto permitió catalogar 100x más productos que antes. GPT-4 evalúa datos de millones de listados diariamente para detectar fraude — la precisión en artículos marcados ha alcanzado casi 99%. GPT-3.5 y GPT-4 traducen títulos y descripciones de productos con atención a los matices dialectales del español y portugués — para un mercado que se extiende desde México hasta Argentina, eso no es un detalle sino una precondición de confianza del comprador. Los resúmenes automatizados de reseñas en GPT-4o mini ayudan a los usuarios a comprender rápidamente los comentarios de productos y aumentan los pedidos donde la función está disponible; las notificaciones push personalizadas aumentan el engagement.
También vale la pena considerar el contexto competitivo: el comercio electrónico latinoamericano es un mercado donde Mercado Libre resiste la presión de actores globales, y el margen se obtiene a través de la eficiencia operacional a volúmenes enormes — millones de listados, disputas, entregas y pagos diarios. En tal entorno, AI no es un proyecto de imagen sino una herramienta para mantener el liderazgo, y la empresa lo aplicó consistentemente donde el efecto es medible.
Sobre esta base, la empresa construyó Verdi — una plataforma interna de desarrollo de aplicaciones AI en GPT-4o, GPT-4o mini y GPT-3.5 Turbo, presentada en un estudio de caso de OpenAI en septiembre de 2024. La historia de Verdi es interesante como un raro ejemplo documentado de una empresa que pasa de 'AI como conjunto de funciones puntuales' a 'AI como una capa de plataforma' en la cual cualquiera de los 17,000 desarrolladores puede ensamblar aplicaciones — incluyendo la mediación autónoma de disputas de dinero.
Problema
Las aplicaciones de AI puntuales entregaron valor pero alcanzaron un límite. El COO de la empresa, Daniel Rabinovich, expresa ese límite sin diplomacia: 'Usar AI para catalogación y resumen de reseñas es interesante y útil, pero no transformacional. Necesitábamos una solución que pudiera manejar tareas complejas y de alto riesgo de forma autónoma y más eficientemente que los operadores humanos.'
La tarea más reveladora de esto es la mediación de disputas entre compradores y vendedores. Es un proceso contencioso, costoso y poco escalable: un operador humano debe determinar qué está roto, quién tiene razón, qué dicen las reglas del mercado, contactar a las partes y tomar una decisión con consecuencias monetarias. Tradicionalmente esto requiere una larga participación humana, y el perímetro potencial es enorme — las tareas de 9,000 operadores y decisiones por valor de $450 millones al año.
El segundo problema es la velocidad de desarrollo y la seguridad. La empresa evaluó plataformas AI existentes y no encontró una combinación de iteración rápida, escalabilidad y seguridad: 'Al buscar una plataforma de desarrollo, no vimos una que resolviera nuestra necesidad de iteración rápida mientras garantizaba escalabilidad y seguridad,' dice Sebastian Barrios, SVP de Tecnología. Con 17,000 desarrolladores, cada bot AI casero con sus propias credenciales y prompts es una revisión de seguridad separada; sin una capa de plataforma, el desarrollo masivo de AI o choca con la burocracia o se convierte en un riesgo inmanejable.
Solución
La respuesta fue Verdi — una capa de plataforma en GPT-4o, GPT-4o mini y GPT-3.5 Turbo, diseñada, en palabras de Barrios, 'con enfoque en reducir la carga cognitiva y permitir que toda la organización itere, desarrolle e implemente nuevas soluciones innovadoras.'
La principal diferencia arquitectónica de Verdi respecto a análogos: el lenguaje natural sigue siendo el modo central de interacción a lo largo del desarrollo — los desarrolladores nunca ven el código fuente. La seguridad, guardrails y lógica de enrutamiento están integrados en la plataforma misma en lugar de resolverse nuevamente en cada aplicación. Una aplicación se ensambla como una estructura que se asemeja a una red neuronal: nodos y habilidades que se componen entre sí. Un nodo 'comprobante de daño' llama a GPT-4o Vision para determinar de una foto qué está roto o falta en el artículo del cliente; una habilidad 'devolución' se comunica con la habilidad 'envío' por su cuenta — sin intervención humana; los parámetros de estas interacciones son establecidos por los equipos de Mercado Libre dentro del marco de la plataforma. Más allá de los modelos de lenguaje, Verdi integra nodos Python y APIs externas, opera dentro de la plataforma interna de desarrolladores (crear, implementar, probar y gestionar aplicaciones en un entorno), incluye pruebas unitarias integradas, y está diseñado para incorporar nuevos modelos a medida que estén disponibles.
La primera aplicación importante fue la mediación autónoma de servicio al cliente: la AI conduce interacciones con las partes, llama APIs externas y entrega casos a empleados humanos cuando es necesario. Significativamente, la tarea de debut de la plataforma fue la más incómoda — donde la multimodalidad (fotos de un artículo roto), dinero (reembolsos y compensaciones), las emociones de partes en conflicto y las reglas del mercado convergen. En pocos meses, Verdi comenzó a manejar 10% de la mediación en uno de los sitios principales de la empresa. Rabinovich describe la filosofía de la plataforma: 'Con Verdi, los humanos se convierten en copilots de la AI en lugar de lo contrario. Esta plataforma puede decidir autónomamente sobre casos, gestionar interacciones complejas e incluso manejar tareas que requieren un toque humano, informadas por protocolos de seguridad y guardrails integrados en la plataforma.'
Aprovechando el éxito del servicio al cliente, la empresa comenzó a extender Verdi a su red de logística — para envíos más rápidos y menos entregas atrasadas — y planea una mayor expansión hacia asistentes de búsqueda y recomendaciones de productos, incluyendo para los 50 millones de usuarios trimestrales de Mercado Pago. Rabinovich expresa la ambición al máximo: 'Verdi está diseñado para resolver cualquier problema. Es una declaración audaz, pero confiamos en su potencial.'
Resultado
Según cifras publicadas por OpenAI: GPT-4 Vision permitió catalogar 100x más productos en dos años; la precisión de detección de fraude alcanzó casi 99% para artículos marcados; en pocos meses Verdi asumió 10% de la mediación de servicio al cliente en uno de los sitios principales de la empresa; los resúmenes de reseñas aumentan los pedidos donde están disponibles (sin tamaño de efecto divulgado). La empresa estima el potencial en apoyar las tareas de 9,000 operadores y gestionar autónomamente decisiones de servicio al cliente por valor de $450 millones anuales.
Un resultado separado, frecuentemente ignorado, es la economía de la velocidad de desarrollo: la plataforma fue diseñada 'con enfoque en reducir la carga cognitiva' para que cualquier equipo pueda ensamblar, probar e implementar aplicaciones AI en un entorno unificado con pruebas unitarias integradas. La empresa no cuantifica este efecto, pero es precisamente lo que explica construir una plataforma en lugar de contratar más operadores.
El encuadre es obligatorio. Todas las cifras son reportes de la propia empresa en un estudio de caso de OpenAI — la parte que vende los modelos utilizados; no hay verificación independiente. El 100x es crecimiento en productos catalogados, no en ingresos o calidad de listados. 'Casi 99%' se refiere a la precisión en artículos marcados — la métrica no dice nada sobre recall (cuánto fraude nunca es marcado en absoluto). El 10% de mediaciones aplica a un sitio, no a todo el grupo; y '9,000 operadores' y '$450M' son potencial declarado, no resultados logrados. Confundir estas categorías es el error clásico al leer estudios de caso de proveedores.
En nuestra opinión, el significado clave del caso radica en la secuencia de admitir AI a dinero. Mercado Libre primero pasó años ejecutando modelos en tareas con un costo bajo de error (etiquetas de catálogo, traducciones, resúmenes), acumulando datos, infraestructura y confianza organizacional — y solo entonces admitió AI a disputas con consecuencias monetarias, y en fracciones: 10% en un sitio, con escalada a humanos y una ruta de retroceso. Esto es lo opuesto a la moda 'agente autónomo en producción en un trimestre' — y probablemente la única forma de hacer tales cosas en una empresa donde las decisiones de AI mueven directamente dinero de otras personas.
Una segunda observación: 'los desarrolladores nunca ven el código fuente' es la decisión más debatable e interesante de Verdi. Lo leemos como una apuesta por reducir radicalmente la barrera de entrada (cualquier equipo ensambla una aplicación AI a partir de nodos y habilidades) a cambio de dependencia total de la calidad de los guardrails de la plataforma. Con 17,000 desarrolladores la apuesta parece racional: la seguridad centralizada escala, revisar cada bot casero no. Pero no aconsejaríamos portar el patrón a una organización sin un equipo de plataforma maduro.
Lecciones aprendidas
- El camino maduro hacia agentes pasa por años de aplicaciones 'aburridas': catálogo, fraude y traducción dieron a la empresa datos, infraestructura y confianza antes de que se permitiera que AI se acercara a disputas de dinero.
- Una plataforma en lugar de bots puntuales: cuando 17,000 desarrolladores comparten una capa con guardrails y enrutamiento integrados, cada nueva aplicación AI deja de ser su propia revisión de seguridad.
- La autonomía se introduce en fracciones: 10% de mediaciones en un sitio es un experimento controlado con escalada humana y ruta de retroceso, no 'cambiar todo a AI.'
- Separa resultados logrados de potencial: el catálogo 100x es un hecho, mientras que '9,000 operadores y $450M' es una estimación de escala futura; confundir los dos es el error clásico al leer estudios de caso de proveedores.
- La multimodalidad resuelve disputas reales: un nodo 'comprobante de daño' usando GPT-4o vision reemplaza el paso más contencioso de la mediación — revisar manualmente fotos de un artículo roto.
- La precisión en marcas (~99%) no es toda la verdad sobre la detección de fraude: la métrica guarda silencio sobre recall y debe leerse junto a la pregunta '¿cuánto nunca es marcado en absoluto?'
- 'Los desarrolladores nunca ven el código' intercambia barrera de entrada por dependencia de guardrails de plataforma; la apuesta es racional con un equipo de plataforma maduro y peligrosa sin uno.
Preguntas frecuentes
¿Qué es Verdi en Mercado Libre?
Una plataforma interna de desarrollo de AI en GPT-4o, GPT-4o mini y GPT-3.5 Turbo: los desarrolladores describen lógica en lenguaje natural sin ver código fuente; las aplicaciones se ensamblan a partir de nodos y habilidades (incluyendo nodos Python y APIs externas), mientras que la seguridad, guardrails y enrutamiento están integrados en la plataforma. Las pruebas unitarias están integradas; la plataforma vive dentro del entorno de desarrollo unificado de la empresa.
¿La AI reemplazó a 9,000 operadores de Mercado Libre?
No. Según el estudio de caso de OpenAI, Verdi maneja 10% de la mediación de servicio al cliente en un sitio importante; 'apoyar las tareas de 9,000 operadores' y '$450M en decisiones anuales' describen el potencial declarado de la plataforma, no un resultado logrado. Los casos se entregan a empleados humanos cuando es necesario.
¿Cuán precisa es la detección de fraude AI de Mercado Libre?
Según las cifras de la empresa en el estudio de caso de OpenAI, GPT-4 evalúa datos de millones de listados diariamente, con precisión de casi 99% para artículos marcados. Esto es autoreferencial sin auditoría independiente; una métrica de precisión de marcas no revela recall — la proporción de fraude nunca marcado en absoluto.
¿Cómo maneja la AI las disputas de artículos dañados?
En Verdi es el nodo 'comprobante de daño': llama a GPT-4o Vision para determinar de las fotos del cliente exactamente qué está roto o falta. Las habilidades luego interactúan — por ejemplo, 'devolución' se comunica con 'envío' por su cuenta — dentro de parámetros establecidos por los equipos de Mercado Libre, escalando a humanos cuando es necesario.
¿Hacia dónde está llevando Mercado Libre Verdi a continuación?
Según el estudio de caso de OpenAI — a la red de logística (envíos más rápidos, menos entregas atrasadas), con planes para asistentes de búsqueda y recomendaciones de productos, incluyendo para los 50 millones de usuarios trimestrales de Mercado Pago. Estas son direcciones declaradas; el caso aún no reporta resultados para ellas.