SK Telecom: um LLM telco em Claude fine-tuned — 68% menos respostas de suporte de baixa qualidade
Os ratings de qualidade de resposta do LLM de agentes ao vivo subiram 34% (assistência em chamada). A participação de respostas de baixa qualidade caiu 68% — o modelo telco fine-tuned versus o modelo base. No processamento pós-chamada, a qualidade atingiu ~89% do nível de agente humano, e a pontuação geral do LLM telco melhorou de 3,3 para mais de 4,3. Conforme o blog técnico da AWS, o fine-tuning de Claude 3 Sonnet combinado com otimização de prompt melhorou ROUGE-3 em 58,1%, ROUGE-L em 26,8% e precisão de citação em 70,59% em relação ao baseline. Enquadramento. Todos os percentuais são melhorias relativas nos benchmarks internos da SKT; valores de qualidade absoluta não são divulgados. ROUGE mede sobreposição textual, não correção semântica, e não garante nada por si só (o que as avaliações humanas cegas compensam). Ambas as fontes primárias são partes do acordo: Anthropic (na qual SKT investiu $100M) e AWS (cuja plataforma hospeda tudo). Nenhum dado sobre métricas de negócios do centro de contato — tempo de manuseio, satisfação, economia — foi publicado. Análise editorial. Primeiro: o caso efetivamente publica uma "escada de maturidade" do LLM de indústria com o preço de cada degrau — prompts entregam os primeiros 35–40% quase de graça, fine-tuning adiciona o próximo salto, dados sintéticos removem a escassez de dados. A conclusão prática para qualquer equipe: não comece com o estágio caro — a maioria do efeito vai para trabalho de prompt disciplinado, e fine-tuning faz sentido uma vez que o teto de prompt é genuinamente atingido e medido. Segundo: a figura de "89% do nível humano" no processamento pós-chamada é um modelo de métricas honestas: mostra tanto prontidão (os preenchimentos de rotina podem ser entregues ao modelo sob supervisão) quanto a fronteira (o deficit de 10%+ é por que o humano permanece no loop). Terceiro: o link investidor SKT–Anthropic torna o caso simultaneamente mais forte e mais fraco: mais forte porque SKT arrisca seu próprio dinheiro e constrói uma aliança de operadores (GTAA) nessa aposta; mais fraco porque toda métrica publicada passa por duas partes financeiramente interessadas. O resultado não tem replicação externa ainda — embora o design muito da Aliança Global de IA para Telecom implique que a abordagem será replicada entre os outros operadores da aliança, e esse será o teste real de se um LLM telco se transfere além do mercado coreano.
- SK Telecom transforms customer service with Claude (customer story) — Anthropic / Claude (кейс-стади)
- SK Telecom improves telco-specific Q&A by fine-tuning Anthropic's Claude models in Amazon Bedrock — AWS Machine Learning Blog, 2024-10-10
- SKT Partnership Announcement — Anthropic (news), 2023-08
- SKT Invests USD 100 Million in Anthropic and Joins Forces with the Company to Promote AI Innovation — SK Telecom Newsroom, 2023-08
Contexto
SK Telecom é a maior operadora móvel da Coreia do Sul, classificada em #1 no Índice Nacional de Satisfação do Cliente (NCSI) por 27 anos consecutivos. O mercado coreano não perdoa lentidão: "A Coreia é uma sociedade muito urgente. Se você está um minuto atrasado, está dez minutos atrasado," diz Eric Davis, Chefe do Grupo de Colaboração em Tecnologia de IA da SKT. O atendimento ao cliente aqui não é um centro de custo, mas parte de uma competição de marca nacional onde velocidade, personalização e nuances culturais importam.
O relacionamento da SKT com a Anthropic vai além de um simples relacionamento comercial. Em agosto de 2023, a operadora anunciou um investimento de $100 milhões na Anthropic (além de um investimento anterior de seu braço de venture capital SKTVC) e desenvolvimento conjunto de um LLM multilíngue para a indústria de telecomunicações — suportando coreano, inglês, alemão, japonês, árabe e espanhol. O contexto do acordo é a Aliança Global de IA para Telecom — SKT, Deutsche Telekom, e&, e Singtel — criada para acelerar a transformação de IA dos operadores: a ideia é que as telecom obtenham capacidades de IA personalizadas sem construir seus próprios modelos do zero.
O caso documentado pela Anthropic e pelo blog técnico da AWS é a primeira manifestação prática importante dessa aposta: um LLM telco de indústria baseado em Claude fine-tuned para os centros de contato da SKT. Davis descreve a filosofia do projeto com o termo "IA" — augmentação de inteligência: "Isso não se destina a substituir empregos, mas a augmentar a experiência."
Para o mercado, o caso é valioso por sua rara transparência técnica: além dos percentuais de marketing, os detalhes da metodologia são publicados — desde composição de dados de treinamento e experimentos com dados sintéticos até metodologia de avaliação humana cega. É um dos poucos casos em que você pode realmente aprender a reproduzir resultados.
Problema
Os agentes do centro de contato estão sobrecarregados. Durante uma ligação, devem encontrar rapidamente respostas precisas em documentação específica de telecom — com o cliente na linha e o padrão de velocidade coreano não permitindo pausas. Depois da ligação, eles escrevem manualmente os resultados: resumo, classificação de tópico, itens de ação. A rotina consome recursos cognitivos que deveriam ir para o cliente.
LLMs genéricos sem adaptação tropeçaram em duas coisas. Primeiro — terminologia de indústria: respostas precisas sobre tarifas, dispositivos e procedimentos exigem conhecimento do corpus de documentação da SKT, não "conhecimento geral de telecom." Segundo — especificidade cultural e linguística: atendimento ao cliente coreano exige empatia e polidez calibradas, e o serviço abrange canais (telefone, chat), dialetos regionais e dados demográficos de idade. Um modelo que fala coreano "razoavelmente bem" não passa por esse padrão.
Requisitos de marca adicionaram rigor: "Para nós, a segurança da marca é crucial — qualquer coisa que danifique a marca é simplesmente inaceitável. O grande foco da Anthropic em segurança realmente se destacou," diz Davis. E não é apenas sobre ética de resposta: "O desempenho não era apenas sobre precisão do modelo — a taxa de transferência e a latência tiveram que atender aos nossos padrões." Finalmente, havia uma restrição organizacional: o serviço tradicional funciona de segunda a sexta, de 9h às 18h, portanto, qualquer coisa que descarregue agentes ao vivo estende diretamente a disponibilidade do serviço. A tarefa cristalizou-se como: não substituir agentes por um bot, mas construir um modelo de indústria que alivie as pessoas em tempo real e após a ligação — em um nível de qualidade digno de um líder NCSI de 27 anos.
Solução
SKT fine-tuned Claude 3 Sonnet no Amazon Bedrock em sua documentação e integrou o modelo ao seu sistema RAG em um único loop ponta a ponta: conforme o blog técnico da AWS, a arquitetura usa Amazon Bedrock Knowledge Bases para recuperação de domínio, Bedrock Agents para cenários estendidos e Bedrock Guardrails para trilhos de segurança.
Dois produtos foram implantados nesta base. In-Call Assist ajuda o agente durante a ligação: busca documentação em tempo real e sugere respostas, aliviando a carga cognitiva do funcionário sobrecarregado. Post-Call Processing automatiza o preenchimento: resumo de conversa, classificação de tópico, geração de lista de tarefas, análise de sentimento — com supervisão humana dos resultados mantida.
A parte mais instrutiva do caso é a pilha de melhoria de qualidade, documentada com números. A primeira camada é otimização de prompt: sozinha entregou melhorias de 35–40%; conforme as métricas do blog da AWS, a atualização de prompt melhorou ROUGE-3 em 38,3% e precisão de citação em 52,94% em relação ao modelo base. A segunda camada é fine-tuning: a combinação "prompt + fine-tuning" elevou a melhoria de ROUGE-3 para 58,1%, ROUGE-L para 26,8% e precisão de citação para 70,59%; em métricas selecionadas, os ganhos combinados chegaram a 50–60%. A terceira camada é augmentação de dados sintéticos para combater a escassez de exemplos de treinamento.
O experimento de dados sintéticos merece ser recontado porque responde à pergunta que toda equipe com um pequeno conjunto de dados faz. Em avaliação humana cega (classificando quatro variantes, de 4 pontos para melhor a 1 para pior), o modelo treinado em 2.000 amostras originais marcou 114 de 160; o modelo em 500 original + 1.500 sintético — 112; o modelo em apenas 500 original — 85; o modelo base sem fine-tuning — 84. Conclusão da SKT: dados augmentados sinteticamente funcionam quase como um volume equivalente de dados originais — significando que a escassez de anotação deixa de ser um bloqueador.
O foco de aplicação registrado no blog da AWS é Q&A fundamentado: respostas fundamentadas em fonte sobre documentos técnicos de telecom, em coreano. Isso explica por que a precisão de citação se tornou uma das métricas principais do projeto: uma sugestão para um agente é útil apenas quando pode ser verificada instantaneamente contra o documento.
A avaliação de qualidade também é construída como um sistema: rankings cegos por avaliadores humanos com uma escala de preferência — uma metodologia que mede utilidade para humanos, não apenas métricas automatizadas. Davis adiciona um argumento subjetivo de seleção de modelo: "Claude é mais relável e criativo" — para um serviço onde empatia faz parte do padrão, isso é um requisito, não cosmética.
Resultado
Os ratings de qualidade de resposta do LLM de agentes ao vivo subiram 34% (assistência em chamada). A participação de respostas de baixa qualidade caiu 68% — o modelo telco fine-tuned versus o modelo base. No processamento pós-chamada, a qualidade atingiu ~89% do nível de agente humano, e a pontuação geral do LLM telco melhorou de 3,3 para mais de 4,3. Conforme o blog técnico da AWS, o fine-tuning de Claude 3 Sonnet combinado com otimização de prompt melhorou ROUGE-3 em 58,1%, ROUGE-L em 26,8% e precisão de citação em 70,59% em relação ao baseline.
Enquadramento. Todos os percentuais são melhorias relativas nos benchmarks internos da SKT; valores de qualidade absoluta não são divulgados. ROUGE mede sobreposição textual, não correção semântica, e não garante nada por si só (o que as avaliações humanas cegas compensam). Ambas as fontes primárias são partes do acordo: Anthropic (na qual SKT investiu $100M) e AWS (cuja plataforma hospeda tudo). Nenhum dado sobre métricas de negócios do centro de contato — tempo de manuseio, satisfação, economia — foi publicado.
Análise editorial. Primeiro: o caso efetivamente publica uma "escada de maturidade" do LLM de indústria com o preço de cada degrau — prompts entregam os primeiros 35–40% quase de graça, fine-tuning adiciona o próximo salto, dados sintéticos removem a escassez de dados. A conclusão prática para qualquer equipe: não comece com o estágio caro — a maioria do efeito vai para trabalho de prompt disciplinado, e fine-tuning faz sentido uma vez que o teto de prompt é genuinamente atingido e medido. Segundo: a figura de "89% do nível humano" no processamento pós-chamada é um modelo de métricas honestas: mostra tanto prontidão (os preenchimentos de rotina podem ser entregues ao modelo sob supervisão) quanto a fronteira (o deficit de 10%+ é por que o humano permanece no loop). Terceiro: o link investidor SKT–Anthropic torna o caso simultaneamente mais forte e mais fraco: mais forte porque SKT arrisca seu próprio dinheiro e constrói uma aliança de operadores (GTAA) nessa aposta; mais fraco porque toda métrica publicada passa por duas partes financeiramente interessadas. O resultado não tem replicação externa ainda — embora o design muito da Aliança Global de IA para Telecom implique que a abordagem será replicada entre os outros operadores da aliança, e esse será o teste real de se um LLM telco se transfere além do mercado coreano.
Lições aprendidas
- Um LLM de indústria é uma pilha de técnicas, não um fine-tune único: otimização de prompt (ganhos de 35–40% sozinho) → fine-tuning → dados sintéticos; apenas juntos cortaram respostas ruins em 68%.
- Comece com o degrau barato: a atualização de prompt melhorou a precisão de citação em 52,94% sozinha — antes de pagar por fine-tuning, atinja e meça o teto de prompt.
- Dados sintéticos genuinamente funcionam quando exemplos de treinamento são escassos: o modelo da SKT em 500 original + 1.500 amostras sintéticas (112/160) quase correspondia ao modelo em 2.000 originais (114/160).
- A métrica '% do nível humano' (89% no processamento pós-chamada) é mais honesta que benchmarks abstratos — mostra exatamente onde a IA está pronta para assumir o trabalho de rotina e por que o humano permanece no loop.
- Avalie cegamente, com humanos: ranking de preferência por avaliadores ao vivo captura o que ROUGE perde — polidez, empatia, aplicabilidade de resposta.
- Posicionar como 'augmentação, não substituição' (IA — augmentação de inteligência) reduz a resistência do pessoal: o objetivo é aliviar agentes sobrecarregados, não cortá-los.
- Contexto cultural faz parte da qualidade: para serviço coreano, empatia, polidez, dialetos e dados demográficos de idade provaram ser tão decisivos na seleção de modelo quanto precisão, taxa de transferência e latência.
Perguntas frequentes
O que exatamente SK Telecom construiu em Claude?
Um LLM específico de telecom: Claude 3 Sonnet fine-tuned no Amazon Bedrock na documentação da SKT e conectado a um loop RAG (Bedrock Knowledge Bases, Agents, Guardrails). Alimenta In-Call Assist (busca de documentação e orientação de agente em tempo real durante chamadas) e Post-Call Processing (resumo, classificação de tópico, listas de tarefas, análise de sentimento).
Que números respaldam o impacto?
Respostas de baixa qualidade caíram 68%, ratings de qualidade do agente subiram 34%, processamento pós-chamada atingiu ~89% do nível humano, e a pontuação geral do modelo melhorou de 3,3 para 4,3+. Conforme o blog da AWS: ROUGE-3 +58,1%, ROUGE-L +26,8%, precisão de citação +70,59% em relação ao baseline (prompt + fine-tuning).
Por que SKT usou dados sintéticos, e funciona?
Exemplos de treinamento original eram escassos. Em um teste humano cego, o modelo em 500 original + 1.500 amostras sintéticas marcou 112/160 — quase igualando o modelo treinado em 2.000 originais (114/160) e claramente batendo o modelo de apenas 500 originais (85/160). Conclusão: dados sintéticos são quase equivalentes ao mesmo volume de dados originais.
A IA substituiu os agentes do centro de contato da SKT?
Não. A filosofia do projeto é IA (augmentação de inteligência): segundo Eric Davis, "Isso não se destina a substituir empregos, mas a augmentar a experiência." In-Call Assist alivia agentes durante chamadas; Post-Call Processing automatiza preenchimentos com supervisão humana mantida.
Qual é o relacionamento da SKT com a Anthropic além deste projeto?
SKT é um investidor da Anthropic: em agosto de 2023, a operadora investiu $100M (além de um investimento anterior do SKTVC) e concordou em co-desenvolver um LLM telco multilíngue (coreano, inglês, alemão, japonês, árabe, espanhol) no contexto da Aliança Global de IA para Telecom (SKT, Deutsche Telekom, e&, Singtel). Vale a pena ter em mente ao avaliar as métricas publicadas.