🛵
Entrega · DoorDash

DoorDash: uma IA de voz com suporte de Claude atende centenas de milhares de chamadas de Dasher por dia

Após testes bem-sucedidos no início de 2024, DoorDash lançou as novas opções de autoatendimento para todos os Dashers. A IA de voz atende centenas de milhares de chamadas de Dasher diariamente com uma latência de resposta de 2,5 segundos ou menos. Na linguagem do caso de estudo, a solução produziu 'reduções grandes e materiais' em volumes de chamadas para solicitações de suporte relacionadas a Dasher, cortou escalações para agentes humanos por milhares por dia, e reduziu o número de tarefas que agentes precisam resolver em uma solicitação. A IA fecha as questões rotineiras, liberando agentes para casos complexos que precisam de um humano. É importante manter o enquadramento de atribuição — e corrigir uma retellings generalizada deste caso (incluindo nossa própria versão anterior): as figuras '−49% transferências, +12% resolução no primeiro contato, US$ 3M economia anual' pertencem à geração anterior de automação da DoorDash no Amazon Connect e Amazon Lex — a linha de base sobre a qual a camada generativa foi construída. Para a própria solução de Claude, AWS e DoorDash publicam métricas de velocidade e escala (2,5s; centenas de milhares de chamadas por dia; 50x capacidade de testes; −50% tempo de desenvolvimento) e declarações de impacto qualitativas ('milhares de escalações por dia'), mas não percentuais ou dólares. Essa é prática típica e honesta para um deployment fresco — efeitos financeiros precisos levam um ano de observação. A equipe já anunciou o próximo passo: expandir as bases de conhecimento e integrar o serviço de workflow de logística orientado por eventos da DoorDash para que o assistente não apenas responda perguntas, mas tome ações em nome do usuário. 'Usando AWS e Claude da Anthropic, construímos uma solução que dá aos Dashers acesso confiável e fácil de entender às informações que precisam, quando precisam. Isso tem impactos positivos em cascata em nossos usuários e na plataforma como um todo', diz Chaitanya Hari, Contact Center Product Lead na DoorDash. Em nossa visão, há três lições transferíveis. Primeira: para cenários de voz, velocidade é um requisito de produto número um, e escolher um modelo leve (Haiku) em vez do flagship é economia de engenharia sólida aplicável a qualquer cenário em tempo real. Segunda: infraestrutura de teste importa mais que a 'inteligência' do modelo — o aumento de 50x na capacidade de testes é o motivo pelo qual o projeto atingiu produção em 8 semanas. Terceira: construa a camada generativa sobre automação que funciona, não em seu lugar — DoorDash ampliou uma linha de base IVR forte, que é exatamente por que conseguiu medir honestamente o valor adicionado via testes A/B.

100K+
chamadas por dia atendidas pela IA de voz
2.5с
latência de resposta (Claude 3 Haiku)
50×
aumento de capacidade de testes (SageMaker)
8 недель
do design ao A/B em produção
Fontes
Verificado: 2026-07-11

Contexto

DoorDash é a maior plataforma de comércio local e entrega dos EUA, fundada em 2013. Até o final de 2023, o serviço tinha mais de 37 milhões de consumidores ativos mensalmente e mais de 2 milhões de Dashers ativos mensalmente — os entregadores que realizam as entregas. Os Dashers são os principais clientes do centro de contato: precisam de ajuda durante a entrega, quando surge uma dúvida sobre um pedido, um endereço, cadastro ou pagamento.

Este público tem uma restrição crítica que moldou todo o projeto: os Dashers estão dirigindo. Eles preferem ligar a usar chat — e não podem esperar. Cada segundo de atraso na resposta é um entregador esperando na porta do restaurante ou parado na calçada. A latência de resposta no canal de voz não é apenas uma 'métrica de qualidade', mas tempo literal tirado dos ganhos de uma pessoa.

O centro de contato da DoorDash funciona no Amazon Connect — plataforma em nuvem da AWS — e processa um volume coletivo de centenas de milhares de chamadas por dia. Uma nuance importante que muitas retellings perdem: quando a IA generativa foi lançada, a DoorDash já tinha automação de voz avançada no Amazon Connect e Amazon Lex, e estava entregando resultados mensuráveis. A tarefa não era 'substituir um menu de tom', mas quebrar o teto do que um bot NLU clássico consegue fazer — sem degradar a velocidade a que os Dashers estavam acostumados.

Problema

A linha de base da DoorDash era forte — o que torna este caso mais honesto que a maioria. O IVR de autoatendimento existente no Amazon Connect e Amazon Lex já havia reduzido transferências para agentes em 49%, impulsionado um aumento de 12% na resolução no primeiro contato, e estava economizando US$ 3 milhões em custos operacionais anuais. Esses são resultados da automação clássica pré-generativa — atribuí-los corretamente é importante.

O problema era o teto: apesar desses resultados, a maioria das chamadas ainda era redirecionada para agentes humanos. Um bot NLU clássico guia com segurança usuários por fluxos pré-projetados, mas não consegue responder perguntas variadas 'com suas próprias palavras' de uma base de conhecimento: qualquer coisa fora do fluxo vai para um humano. Com centenas de milhares de chamadas por dia, cada ponto percentual de escalações significa dezenas de agentes na linha.

A IA generativa prometia fechar exatamente essa lacuna, mas impôs três requisitos rigorosos. Primeiro, latência: um diálogo de voz desaba se o modelo demora cinco segundos — duplamente inaceitável para motoristas na estrada. Segundo, confiabilidade: um modelo respondendo entregadores sobre salário não deve alucinar, deve resistir a injeção de prompts, e deve detectar conteúdo abusivo. Terceiro, testes em escala: antes do projeto, a equipe precisava tirar agentes das filas de atendimento para executar alguns testes manuais por hora — sem forma de validar uma IA de voz que enfrenta centenas de milhares de chamadas.

Solução

DoorDash construiu a solução com o AWS Generative AI Innovation Center (GenAIIC) — um programa que emparelha especialistas AWS com a equipe do cliente. Em 8 semanas, as equipes projetaram, construíram, e levaram a solução para prontidão de testes A/B em produção; de acordo com o caso de estudo, Bedrock como plataforma gerenciada cortou o tempo de desenvolvimento de aplicações de IA generativa pela metade.

A base são os modelos Claude da Anthropic no Amazon Bedrock. O caso explica a escolha de Claude por três propriedades críticas para suporte de voz: a capacidade de mitigar alucinações, resistência a injeção de prompts, e detecção de linguagem abusiva. E com o lançamento de Claude 3 Haiku — o modelo mais leve e rápido da família — DoorDash conseguiu o mix de precisão e velocidade que precisava: uma latência de resposta de 2,5 segundos ou menos. A escolha em si é reveladora: para o canal de voz a empresa escolheu não o modelo mais poderoso, mas o mais rápido que fosse suficientemente preciso.

O conhecimento do sistema segue um esquema RAG: o centro de ajuda Dasher publicamente disponível da DoorDash serve como fonte, enquanto Knowledge Bases para Amazon Bedrock — um serviço gerenciado que poupou a equipe de integrações customizadas — gerencia indexação e todo o pipeline 'retrieval → augmentação de prompt'. Uma restrição de segurança crítica: nenhuma informação de identificação pessoal é passada para o loop generativo; dados são criptografados e isolados dentro da aplicação DoorDash. 'Empregar respostas geradas por IA para suporte telefônico apresentou desafios únicos que exigiram estratégias inovadoras para aprimorar tempos de resposta e qualidade das respostas. Amazon Bedrock provou ser um ajuste perfeito para nossos requisitos, permitindo-nos concentrar em refinar os detalhes mais finos da solução', diz Vraj Shah, Lead Project Engineer na DoorDash.

A parte invisível mas decisiva do projeto é o loop de testes. No Amazon SageMaker, a equipe construiu um framework automatizado de teste e avaliação: milhares de testes automatizados por hora — um aumento de 50x na capacidade de testes versus execuções manuais — com avaliação semântica de respostas contra dados verdade. Esse loop possibilitou executar testes A/B no tráfego ao vivo e provar qualidade antes do rollout completo. Sem ele, levar uma IA de voz do design para produção em 8 semanas teria sido impossível.

Arquiteturalmente, a solução é incorporada na stack Amazon Connect existente: a camada generativa amplia o IVR de funcionamento ao invés de substituir o canal — casos complexos e não-rotineiros ainda vão para agentes humanos.

Resultado

Após testes bem-sucedidos no início de 2024, DoorDash lançou as novas opções de autoatendimento para todos os Dashers. A IA de voz atende centenas de milhares de chamadas de Dasher diariamente com uma latência de resposta de 2,5 segundos ou menos. Na linguagem do caso de estudo, a solução produziu 'reduções grandes e materiais' em volumes de chamadas para solicitações de suporte relacionadas a Dasher, cortou escalações para agentes humanos por milhares por dia, e reduziu o número de tarefas que agentes precisam resolver em uma solicitação. A IA fecha as questões rotineiras, liberando agentes para casos complexos que precisam de um humano.

É importante manter o enquadramento de atribuição — e corrigir uma retellings generalizada deste caso (incluindo nossa própria versão anterior): as figuras '−49% transferências, +12% resolução no primeiro contato, US$ 3M economia anual' pertencem à geração anterior de automação da DoorDash no Amazon Connect e Amazon Lex — a linha de base sobre a qual a camada generativa foi construída. Para a própria solução de Claude, AWS e DoorDash publicam métricas de velocidade e escala (2,5s; centenas de milhares de chamadas por dia; 50x capacidade de testes; −50% tempo de desenvolvimento) e declarações de impacto qualitativas ('milhares de escalações por dia'), mas não percentuais ou dólares. Essa é prática típica e honesta para um deployment fresco — efeitos financeiros precisos levam um ano de observação.

A equipe já anunciou o próximo passo: expandir as bases de conhecimento e integrar o serviço de workflow de logística orientado por eventos da DoorDash para que o assistente não apenas responda perguntas, mas tome ações em nome do usuário. 'Usando AWS e Claude da Anthropic, construímos uma solução que dá aos Dashers acesso confiável e fácil de entender às informações que precisam, quando precisam. Isso tem impactos positivos em cascata em nossos usuários e na plataforma como um todo', diz Chaitanya Hari, Contact Center Product Lead na DoorDash.

Em nossa visão, há três lições transferíveis. Primeira: para cenários de voz, velocidade é um requisito de produto número um, e escolher um modelo leve (Haiku) em vez do flagship é economia de engenharia sólida aplicável a qualquer cenário em tempo real. Segunda: infraestrutura de teste importa mais que a 'inteligência' do modelo — o aumento de 50x na capacidade de testes é o motivo pelo qual o projeto atingiu produção em 8 semanas. Terceira: construa a camada generativa sobre automação que funciona, não em seu lugar — DoorDash ampliou uma linha de base IVR forte, que é exatamente por que conseguiu medir honestamente o valor adicionado via testes A/B.

Stack tecnológico
Claude 3 Haiku (Anthropic)Amazon Bedrock + Knowledge Bases (RAG)Amazon Connect + Amazon Lex (IVR-контур)Amazon SageMaker (тестовый фреймворк, 50× ёмкость)AWS Generative AI Innovation Center
Cronologia
Pré-2024 — linha de base: IVR de autoatendimento no Amazon Connect/Lex (−49% transferências, +12% resolução no primeiro contato, US$ 3M economia anual); 8 semanas com AWS GenAIIC — design, construção, e prontidão de testes A/B em produção para a solução generativa; início de 2024 — testes bem-sucedidos; então rollout completo para todos os Dashers; próximo estágio — bases de conhecimento mais amplas e ações via serviço de workflow de logística.

Lições aprendidas

  1. Para cenários de voz, velocidade é um requisito de produto: DoorDash escolheu um modelo leve (Claude 3 Haiku) para latência ≤2,5s em vez do mais poderoso do lineup.
  2. Atribua métricas honestamente: as famosas '−49% transferências e US$ 3M economia' são o resultado do IVR Connect/Lex pré-generativo; o valor da camada Claude é medido separadamente, sobre essa linha de base.
  3. Um loop de testes automatizados é a peça invisível mas crítica: 50x capacidade de testes (milhares de execuções por hora com avaliação semântica) é o que tornou possível a produção em 8 semanas.
  4. A camada generativa amplia automação que funciona em vez de substituir o canal: casos complexos ainda vão para humanos, e o valor adicionado pode ser honestamente medido via testes A/B.
  5. Segurança é projetada na arquitetura: nenhuma PII entra no loop generativo, e o modelo foi escolhido em parte por resistência a injeção de prompts e detecção de linguagem abusiva.
  6. O primeiro público são entregadores, não clientes: um público interno dá um ciclo de feedback rápido com menor risco reputacional.
  7. Uma plataforma gerenciada (Bedrock + Knowledge Bases) cortou o tempo de desenvolvimento pela metade — no início, velocidade de iteração importa mais que ajustar fino sua própria infraestrutura.

Perguntas frequentes

Como DoorDash usa IA em suporte?

Um assistente de autoatendimento de voz no Claude em Amazon Bedrock responde perguntas telefônicas rotineiras dos Dashers — de resolução de problemas de app a cadastros e pagamentos — atendendo centenas de milhares de chamadas por dia; casos complexos vão para agentes humanos.

Qual modelo de IA executa o centro de contato da DoorDash?

Claude 3 Haiku da Anthropic via Amazon Bedrock — um modelo leve escolhido por uma latência de resposta de 2,5 segundos ou menos, além de mitigação de alucinação, resistência a injeção de prompts, e detecção de linguagem abusiva.

Qual impacto a IA de voz da DoorDash entregou?

De acordo com o caso de estudo da AWS: centenas de milhares de chamadas por dia manipuladas automaticamente, escalações para agentes reduzidas por milhares por dia, e 'reduções grandes e materiais' em volumes de chamadas de suporte Dasher. Nenhum percentual ou dólar foi publicado para a camada generativa; as −49% transferências e US$ 3M economia pertencem ao IVR Connect/Lex anterior.

DoorDash passa dados pessoais para a IA?

Não. De acordo com o caso de estudo da AWS, nenhuma informação de identificação pessoal é acessível à solução generativa; dados são criptografados e o acesso é isolado dentro da aplicação DoorDash.

Quanto tempo levou para DoorDash construir sua IA de voz?

8 semanas do design à prontidão de testes A/B em produção, junto com o AWS Generative AI Innovation Center. De acordo com o caso de estudo, a plataforma Bedrock gerenciada cortou o tempo de desenvolvimento pela metade, e o framework de testes do SageMaker entregou um aumento de 50x na capacidade de testes.

← Casos