🛵
Entrega · DoorDash

DoorDash: una IA de voz impulsada por Claude gestiona cientos de miles de llamadas de Dasher al día

Después de pruebas exitosas a principios de 2024, DoorDash implementó las nuevas opciones de autoservicio a todos los Dashers. La IA de voz gestiona cientos de miles de llamadas de Dasher diarias con una latencia de respuesta de 2.5 segundos o menos. En la redacción del caso de estudio, la solución ha impulsado 'reducciones grandes y materiales' en volúmenes de llamadas para consultas de soporte relacionadas con Dasher, redujo escaladas a agentes en vivo en miles por día y redujo el número de tareas que los agentes realizan para resolver consultas. La IA cierra las preguntas rutinarias, liberando agentes para casos complejos que necesitan un humano. Es importante mantener el marco de atribución — y corregir una retransmisión generalizada de este caso (incluyendo nuestra propia versión anterior): las cifras '−49% derivaciones, +12% resolución en primer contacto, 3 millones de dólares en ahorros anuales' pertenecen a la generación de automatización anterior de DoorDash en Amazon Connect y Amazon Lex — la línea base sobre la que se construyó la capa generativa. Para la solución Claude en sí, AWS y DoorDash publican métricas de velocidad y escala (2.5s; cientos de miles de llamadas al día; capacidad de pruebas 50x; −50% tiempo de desarrollo) y declaraciones de impacto cualitativo ('miles de escaladas al día'), pero no porcentajes o dólares. Esta es la práctica típica y honesta para un despliegue reciente — los efectos financieros precisos requieren un año de observación. El equipo ya ha anunciado el siguiente paso: expandir las bases de conocimiento e integrar el servicio de flujo de trabajo de logística impulsado por eventos de DoorDash para que el asistente no solo responda preguntas sino que también tome medidas en nombre del usuario. 'Usando AWS y Claude de Anthropic, hemos construido una solución que proporciona a los Dashers acceso confiable y fácil de entender a la información que necesitan, cuando la necesitan. Esto tiene impactos positivos en cascada en nuestros usuarios y la plataforma en general,' dice Chaitanya Hari, Contact Center Product Lead en DoorDash. En nuestra opinión hay tres lecciones transferibles. Primero: para IA de voz, la velocidad es el requisito del producto número uno, y elegir un modelo ligero (Claude 3 Haiku) en lugar del buque insignia es una sólida economía de ingeniería aplicable a cualquier escenario en tiempo real. Segundo: la infraestructura de pruebas importa más que la 'inteligencia' del modelo — el aumento de capacidad de pruebas de 50x es la razón por la que el proyecto alcanzó producción en 8 semanas. Tercero: construye la capa generativa sobre automatización funcionando, no en lugar de ella — DoorDash aumentó una línea base de IVR sólida, que es exactamente por qué pudo medir honestamente el valor agregado a través de pruebas A/B.

100K+
llamadas por día gestionadas por la IA de voz
2.5с
latencia de respuesta (Claude 3 Haiku)
50×
aumento de capacidad de pruebas (SageMaker)
8 недель
de diseño a prueba A/B en producción
Fuentes
Verificado: 2026-07-11

Contexto

DoorDash es la plataforma más grande de comercio local y entrega en EE.UU., fundada en 2013. A finales de 2023, el servicio contaba con más de 37 millones de consumidores activos mensuales y más de 2 millones de Dashers activos mensuales — los mensajeros que realizan las entregas. Los Dashers son los principales clientes del centro de contacto: necesitan ayuda durante la entrega, cuando surge una pregunta sobre un pedido, una dirección, registro o pago.

Esta audiencia tiene una restricción difícil que determinó todo el proyecto: los Dashers están detrás del volante. Prefieren llamar a chatear — y no pueden esperar. Cada segundo de demora en la respuesta es un mensajero de pie en la puerta de un restaurante o estacionado en una acera. La latencia de respuesta en el canal de voz aquí no es una 'métrica de calidad' sino tiempo físico restado de los ingresos de una persona.

El centro de contacto de DoorDash funciona en Amazon Connect — la plataforma en la nube de AWS — y gestiona un volumen colectivo de cientos de miles de llamadas al día. Un matiz importante de este caso que muchos relatos pierden: para cuando se lanzó la IA generativa, DoorDash ya tenía automatización de voz avanzada en Amazon Connect y Amazon Lex, y estaba entregando resultados medibles. La tarea no era 'reemplazar un menú de tonos' sino romper el techo de lo que un bot NLU clásico puede hacer — sin degradar la velocidad a la que estaban acostumbrados los Dashers.

Problema

La línea base de DoorDash era sólida — lo que hace este caso más honesto que la mayoría. El IVR de autoservicio existente en Amazon Connect y Amazon Lex ya había reducido las derivaciones a agentes en un 49%, impulsó un aumento del 12% en la resolución en el primer contacto y estaba ahorrando 3 millones de dólares en costos operativos año tras año. Estos son resultados de la automatización clásica anterior a la IA generativa — atribuirlos correctamente importa.

El problema era el techo: a pesar de esos resultados, la mayoría de las llamadas aún se derivaban a agentes en vivo. Un bot NLU clásico guía con confianza a los usuarios a través de flujos prediseñados pero no puede responder preguntas variadas 'con sus propias palabras' desde una base de conocimiento: cualquier cosa fuera del flujo va a un humano. Con cientos de miles de llamadas al día, cada punto porcentual de escaladas significa docenas de agentes en la línea.

La IA generativa prometía cerrar exactamente esa brecha, pero imponía tres requisitos difíciles. Primero, latencia: un diálogo de voz se cae si el modelo piensa durante cinco segundos — doblemente inaceptable para conductores en la carretera. Segundo, confiabilidad: un modelo que responde a los mensajeros sobre pago no debe alucinar, debe resistir inyección de prompts y debe detectar contenido abusivo. Tercero, pruebas a escala: antes del proyecto el equipo tenía que sacar agentes en vivo de las colas de ayuda para ejecutar un puñado de casos de prueba manuales por hora — no hay forma de validar una IA de voz que enfrenta cientos de miles de llamadas.

Solución

DoorDash construyó la solución con el Centro de Innovación de IA Generativa de AWS (GenAIIC) — un programa que empareja expertos de AWS con el equipo del cliente. En 8 semanas, los equipos diseñaron, construyeron e implementaron la solución con capacidad de prueba A/B en producción; según el caso de estudio, Bedrock como plataforma gestionada redujo el tiempo de desarrollo de aplicaciones de IA generativa a la mitad.

La base son los modelos Claude de Anthropic en Amazon Bedrock. El caso explica la elección de Claude por tres propiedades críticas para el soporte de voz: la capacidad de mitigar alucinaciones, resistencia a inyección de prompts y detección de lenguaje abusivo. Y con el lanzamiento de Claude 3 Haiku — el modelo más ligero y rápido de la familia — DoorDash obtuvo la combinación de precisión y velocidad que necesitaba: una latencia de respuesta de 2.5 segundos o menos. La elección en sí es reveladora: para el canal de voz, la empresa eligió no el modelo más poderoso sino el más rápido suficientemente preciso.

El conocimiento del sistema sigue un esquema RAG: el centro de ayuda de Dasher disponible públicamente de DoorDash sirve como fuente, mientras que Knowledge Bases para Amazon Bedrock — un servicio gestionado que ahorró al equipo integraciones personalizadas — maneja indexación y todo el pipeline 'recuperación → aumento de prompts'. Una restricción de seguridad clave: no se transmite información de identificación personal (PII) al loop generativo; los datos se cifran y aíslan dentro de la aplicación de DoorDash. 'Emplear respuestas generadas por IA para soporte telefónico presentó desafíos únicos que exigieron estrategias innovadoras para mejorar tiempos de respuesta y calidad de respuestas. Amazon Bedrock resultó ser un ajuste perfecto para nuestros requisitos, permitiéndonos concentrarnos en refinar los detalles más finos de la solución,' dice Vraj Shah, Ingeniero Líder de Proyecto en DoorDash.

La parte invisible pero decisiva del proyecto es el loop de pruebas. En Amazon SageMaker el equipo construyó un framework automatizado de prueba y evaluación: miles de pruebas automatizadas por hora — un aumento de 50x en capacidad de pruebas versus ejecuciones manuales — con evaluación semántica de respuestas contra datos ground-truth. Ese loop hizo posible ejecutar pruebas A/B en tráfico en vivo y probar calidad antes del despliegue completo. Sin él, llevar una IA de voz desde diseño a producción en 8 semanas habría sido imposible.

Arquitectónicamente, la solución se incrusta en la stack existente de Amazon Connect: la capa generativa aumenta el IVR existente en lugar de reemplazar el canal — casos complejos y no rutinarios aún van a agentes en vivo.

Resultado

Después de pruebas exitosas a principios de 2024, DoorDash implementó las nuevas opciones de autoservicio a todos los Dashers. La IA de voz gestiona cientos de miles de llamadas de Dasher diarias con una latencia de respuesta de 2.5 segundos o menos. En la redacción del caso de estudio, la solución ha impulsado 'reducciones grandes y materiales' en volúmenes de llamadas para consultas de soporte relacionadas con Dasher, redujo escaladas a agentes en vivo en miles por día y redujo el número de tareas que los agentes realizan para resolver consultas. La IA cierra las preguntas rutinarias, liberando agentes para casos complejos que necesitan un humano.

Es importante mantener el marco de atribución — y corregir una retransmisión generalizada de este caso (incluyendo nuestra propia versión anterior): las cifras '−49% derivaciones, +12% resolución en primer contacto, 3 millones de dólares en ahorros anuales' pertenecen a la generación de automatización anterior de DoorDash en Amazon Connect y Amazon Lex — la línea base sobre la que se construyó la capa generativa. Para la solución Claude en sí, AWS y DoorDash publican métricas de velocidad y escala (2.5s; cientos de miles de llamadas al día; capacidad de pruebas 50x; −50% tiempo de desarrollo) y declaraciones de impacto cualitativo ('miles de escaladas al día'), pero no porcentajes o dólares. Esta es la práctica típica y honesta para un despliegue reciente — los efectos financieros precisos requieren un año de observación.

El equipo ya ha anunciado el siguiente paso: expandir las bases de conocimiento e integrar el servicio de flujo de trabajo de logística impulsado por eventos de DoorDash para que el asistente no solo responda preguntas sino que también tome medidas en nombre del usuario. 'Usando AWS y Claude de Anthropic, hemos construido una solución que proporciona a los Dashers acceso confiable y fácil de entender a la información que necesitan, cuando la necesitan. Esto tiene impactos positivos en cascada en nuestros usuarios y la plataforma en general,' dice Chaitanya Hari, Contact Center Product Lead en DoorDash.

En nuestra opinión hay tres lecciones transferibles. Primero: para IA de voz, la velocidad es el requisito del producto número uno, y elegir un modelo ligero (Claude 3 Haiku) en lugar del buque insignia es una sólida economía de ingeniería aplicable a cualquier escenario en tiempo real. Segundo: la infraestructura de pruebas importa más que la 'inteligencia' del modelo — el aumento de capacidad de pruebas de 50x es la razón por la que el proyecto alcanzó producción en 8 semanas. Tercero: construye la capa generativa sobre automatización funcionando, no en lugar de ella — DoorDash aumentó una línea base de IVR sólida, que es exactamente por qué pudo medir honestamente el valor agregado a través de pruebas A/B.

Stack tecnológico
Claude 3 Haiku (Anthropic)Amazon Bedrock + Knowledge Bases (RAG)Amazon Connect + Amazon Lex (IVR-контур)Amazon SageMaker (тестовый фреймворк, 50× ёмкость)AWS Generative AI Innovation Center
Cronología
Anterior a 2024 — línea base: IVR de autoservicio en Amazon Connect/Lex (−49% derivaciones, +12% resolución en primer contacto, 3 millones de dólares en ahorros anuales); 8 semanas con GenAIIC de AWS — diseño, construcción e implementación con capacidad de prueba A/B en producción para la solución generativa; principios de 2024 — pruebas exitosas; luego despliegue completo a todos los Dashers; siguiente etapa — bases de conocimiento más amplias e integración de acciones vía el servicio de flujo de trabajo de logística.

Lecciones aprendidas

  1. Para escenarios de voz, la velocidad es un requisito del producto: DoorDash eligió un modelo ligero (Claude 3 Haiku) para latencia ≤2.5s en lugar del más poderoso de la línea.
  2. Atribuye métricas honestamente: el famoso '−49% derivaciones y 3 millones de dólares en ahorros' son el resultado del IVR anterior de Connect/Lex; el valor de la capa Claude se mide por separado, encima de esa línea base.
  3. Un loop de pruebas automatizado es la pieza invisible pero crítica: capacidad de pruebas 50x (miles de ejecuciones por hora con evaluación semántica) es lo que hizo posible producción en 8 semanas.
  4. La capa generativa aumenta la automatización funcionando en lugar de reemplazar el canal: casos complejos aún van a humanos, y el valor agregado puede medirse honestamente vía pruebas A/B.
  5. La seguridad está diseñada en la arquitectura: no ingresa PII al loop generativo, y el modelo fue elegido en parte por resistencia a inyección de prompts y detección de lenguaje abusivo.
  6. La primera audiencia son los Dashers, no los clientes: una audiencia interna proporciona un ciclo de retroalimentación rápido con menor riesgo reputacional.
  7. Una plataforma gestionada (Bedrock + Knowledge Bases) redujo el tiempo de desarrollo a la mitad — al inicio, la velocidad de iteración importa más que ajustar tu propia infraestructura.

Preguntas frecuentes

¿Cómo DoorDash usa IA en soporte?

Un asistente de autoservicio de voz en Claude en Amazon Bedrock responde preguntas telefónicas rutinarias de Dashers — desde solución de problemas de aplicaciones hasta registro y pago — gestionando cientos de miles de llamadas al día; casos complejos van a agentes en vivo.

¿Qué modelo de IA ejecuta el centro de contacto de DoorDash?

Claude 3 Haiku de Anthropic vía Amazon Bedrock — un modelo ligero elegido por latencia de respuesta de 2.5 segundos o menos, más mitigación de alucinaciones, resistencia a inyección de prompts y detección de lenguaje abusivo.

¿Qué impacto entregó la IA de voz de DoorDash?

Según el caso de estudio de AWS: cientos de miles de llamadas al día gestionadas automáticamente, escaladas a agentes bajaron en miles por día, y 'reducciones grandes y materiales' en volúmenes de llamadas de soporte de Dasher. No se publicaron porcentajes o dólares para la capa generativa; las −49% derivaciones y 3 millones de dólares en ahorros pertenecen al IVR anterior de Connect/Lex.

¿DoorDash transmite datos personales a la IA?

No. Según el caso de estudio de AWS, no hay información de identificación personal accesible a la solución generativa; los datos se cifran y el acceso se aísla dentro de la aplicación de DoorDash.

¿Cuánto tiempo tomó construir la IA de voz de DoorDash?

8 semanas desde diseño hasta capacidad de prueba A/B en producción, junto con el Centro de Innovación de IA Generativa de AWS. Según el caso de estudio, la plataforma Bedrock gestionada redujo el tiempo de desarrollo a la mitad, y el framework de pruebas SageMaker entregó un aumento de capacidad de pruebas de 50x.

← Casos