📡
Telecomunicaciones · SK Telecom

SK Telecom: un LLM de telco con Claude ajustado — 68% menos respuestas de soporte de baja calidad

Las calificaciones de calidad de respuesta de LLM de agentes activos aumentaron 34% (asistencia en llamada). La participación de respuestas de baja calidad cayó 68% — el modelo telco ajustado versus el modelo base. En el procesamiento posterior a la llamada, la calidad alcanzó ~89% del nivel de agente humano, y la puntuación general del LLM telco mejoró de 3.3 a más de 4.3. Según el blog técnico de AWS, el ajuste fino de Claude 3 Sonnet combinado con optimización de prompts mejoró ROUGE-3 en 58.1%, ROUGE-L en 26.8%, y precisión de citación en 70.59% sobre la línea base. Encuadre. Todos los porcentajes son mejoras relativas en los puntos de referencia internos de SKT; los valores de calidad absoluta no se divulgan. ROUGE mide la superposición textual, no la corrección semántica, y no garantiza nada por sí mismo (lo que las evaluaciones ciegas por humanos compensan). Ambas fuentes primarias son partes del acuerdo: Anthropic (en la cual SKT invirtió $100M) y AWS (cuya plataforma lo aloja todo). No se han publicado datos sobre métricas comerciales del centro de contacto — tiempo de manejo, satisfacción, ahorros. Análisis editorial. Primero: el caso publica efectivamente una "escalera de madurez" de LLM de industria con el precio de cada peldaño — los prompts entregan el primer 35–40% casi gratis, el ajuste fino agrega el siguiente salto, los datos sintéticos eliminan la escasez de datos. La conclusión práctica para cualquier equipo: no comiences con la etapa costosa — la mayoría del efecto va al trabajo de prompt disciplinado, y el ajuste fino tiene sentido una vez que se alcanza genuinamente el techo de prompt y se mide. Segundo: la cifra de "89% del nivel humano" en el procesamiento posterior a la llamada es un modelo de métricas honestas: muestra tanto la preparación (las redacciones rutinarias pueden entregarse al modelo bajo supervisión) como el límite (el déficit de 10+ por ciento es por qué el humano permanece en el bucle). Tercero: el vínculo inversor SKT–Anthropic hace que el caso sea simultáneamente más fuerte y más débil: más fuerte porque SKT arriesga su propio dinero y construye una alianza de operadores (GTAA) en esta apuesta; más débil porque cada métrica publicada pasa a través de dos partes financieramente interesadas. El resultado aún no tiene replicación externa — aunque el mismo diseño de la Global Telco AI Alliance implica que el enfoque se replicará en otros operadores de la alianza, y esa será la verdadera prueba de si un LLM telco se transfiere más allá del mercado coreano.

−68%
respuestas de modelo de baja calidad
+34%
calificaciones de calidad de respuesta
89%
de calidad de agente humano (posterior a la llamada)
3,3→4,3+
puntuación general de LLM telco
Fuentes
Verificado: 2026-07-11

Contexto

SK Telecom es el operador móvil más grande de Corea del Sur, clasificado #1 en el Índice Nacional de Satisfacción del Cliente (NCSI) durante 27 años consecutivos. El mercado coreano no perdona la lentitud: "Corea es una sociedad muy urgida. Si llegas un minuto tarde, llegas diez minutos tarde", dice Eric Davis, Jefe del Grupo de Colaboración Tecnológica de IA en SKT. El servicio al cliente aquí no es un centro de costos sino parte de una competencia de marca nacional donde la velocidad, la personalización y el matiz cultural importan.

La relación de SKT con Anthropic va más allá de una relación de proveedor ordinaria. En agosto de 2023, el operador anunció una inversión de $100 millones en Anthropic (además de una inversión anterior de su brazo de capital de riesgo SKTVC) y el desarrollo conjunto de un LLM multilingüe para la industria de telecomunicaciones — que admite coreano, inglés, alemán, japonés, árabe y español. El contexto del acuerdo es la Global Telco AI Alliance — SKT, Deutsche Telekom, e&, y Singtel — creada para acelerar la transformación de IA de los operadores: la idea es que los operadores de telecomunicaciones obtengan capacidades de IA personalizadas sin construir sus propios modelos desde cero.

El caso documentado por Anthropic y el blog técnico de AWS es la primera encarnación práctica importante de esa apuesta: un LLM telco de industria basado en Claude ajustado para los centros de contacto de SKT. Davis describe la filosofía del proyecto con el término "IA" — aumento de inteligencia: "Esto no está diseñado para reemplazar empleos, está diseñado para mejorar la experiencia".

Para el mercado, el caso es valioso por su rara transparencia técnica: más allá de los porcentajes de marketing, se publican los detalles de la metodología — desde la composición de datos de entrenamiento y experimentos de datos sintéticos hasta la metodología de evaluación ciega por humanos. Es uno de los pocos casos de los que realmente puedes aprender a reproducir resultados.

Problema

Los agentes del centro de contacto están abrumados. Durante una llamada deben encontrar rápidamente respuestas precisas en la documentación específica de telecomunicaciones — con el cliente en la línea y el estándar de velocidad coreano sin permitir pausas. Después de la llamada, redactan manualmente sus resultados: resumen, clasificación de temas, elementos de acción. La rutina consume recursos cognitivos que deberían destinarse al cliente.

Los LLM genéricos sin adaptación tropezaron en dos cosas. Primero — terminología de la industria: las respuestas precisas sobre tarifas, dispositivos y procedimientos requieren conocimiento del corpus de documentación de SKT, no "conocimiento general de telecomunicaciones". Segundo — especificidad cultural y lingüística: el servicio al cliente coreano exige empatía y cortesía calibradas, y el servicio abarca canales (teléfono, chat), dialectos regionales y demografías de edad. Un modelo que hable coreano "razonablemente bien" no supera ese nivel.

Los requisitos de marca agregaron rigor: "Para nosotros, la seguridad de marca es crucial—cualquier cosa que manche la marca es simplemente inaceptable. El gran enfoque de Anthropic en la seguridad realmente se destacó", dice Davis. Y no es solo sobre ética de respuestas: "El rendimiento no era solo sobre la precisión del modelo—el rendimiento y la latencia tenían que cumplir con nuestros estándares". Finalmente, había una restricción organizacional: el servicio tradicional funciona de lunes a viernes de 9 AM a 6 PM, así que cualquier cosa que descargue agentes activos directamente extiende la disponibilidad del servicio. La tarea se cristalizó como: no reemplazar agentes con un bot, sino construir un modelo de industria que alivie a las personas en tiempo real y después de la llamada — a un nivel de calidad digno de un líder de NCSI de 27 años.

Solución

SKT ajustó Claude 3 Sonnet en Amazon Bedrock en su documentación e integró el modelo a su sistema RAG en un único ciclo de extremo a extremo: según el blog técnico de AWS, la arquitectura utiliza Amazon Bedrock Knowledge Bases para recuperación de dominio, Bedrock Agents para escenarios extendidos, y Bedrock Guardrails para rieles de seguridad.

Dos productos se implementaron en esta base. In-Call Assist ayuda al agente durante la llamada: busca documentación en tiempo real y sugiere respuestas, aliviando la carga cognitiva del empleado abrumado. Post-Call Processing automatiza la redacción: resumen de conversación, clasificación de temas, generación de lista de tareas, análisis de sentimientos — con supervisión humana de los resultados retenida.

La parte más instructiva del caso es el stack de mejora de calidad, documentado con números. La primera capa es la optimización de prompts: por sí sola entregó mejoras de 35–40%; según las métricas del blog de AWS, la actualización de prompt por sí misma mejoró ROUGE-3 en 38.3% y la precisión de citación en 52.94% sobre el modelo base. La segunda capa es el ajuste fino: la combinación "prompt + fine-tuning" empujó la mejora de ROUGE-3 a 58.1%, ROUGE-L a 26.8%, y precisión de citación a 70.59%; en métricas seleccionadas, las ganancias combinadas alcanzaron 50–60%. La tercera capa es el aumento de datos sintéticos para combatir la escasez de ejemplos de entrenamiento.

El experimento de datos sintéticos merece ser recontado porque responde la pregunta que todo equipo con un pequeño conjunto de datos se hace. En evaluación ciega por humanos (clasificando cuatro variantes, de 4 puntos para el mejor a 1 para el peor), el modelo entrenado en 2,000 muestras originales puntuó 114 de 160; el modelo en 500 original + 1,500 sintético — 112; el modelo en solo 500 original — 85; el modelo base sin ajuste fino — 84. Conclusión de SKT: los datos aumentados sintéticamente funcionan casi como un volumen equivalente de datos originales — lo que significa que la escasez de anotaciones deja de ser un bloqueador.

El enfoque de aplicación registrado en el blog de AWS es Q&A con base: respuestas con base de fuente sobre documentos técnicos de telecomunicaciones, en coreano. Eso explica por qué la precisión de citación se convirtió en una de las métricas principales del proyecto: una sugerencia a un agente es útil solo cuando puede ser verificada instantáneamente contra el documento.

La evaluación de calidad también se construye como un sistema: clasificaciones ciegas por evaluadores humanos con una escala de preferencia — una metodología que mide la utilidad para los humanos, no solo métricas automatizadas. Davis agrega un argumento subjetivo de selección de modelo: "Claude es más relacionable y creativo" — para un servicio donde la empatía es parte del estándar, eso es un requisito, no cosméticos.

Resultado

Las calificaciones de calidad de respuesta de LLM de agentes activos aumentaron 34% (asistencia en llamada). La participación de respuestas de baja calidad cayó 68% — el modelo telco ajustado versus el modelo base. En el procesamiento posterior a la llamada, la calidad alcanzó ~89% del nivel de agente humano, y la puntuación general del LLM telco mejoró de 3.3 a más de 4.3. Según el blog técnico de AWS, el ajuste fino de Claude 3 Sonnet combinado con optimización de prompts mejoró ROUGE-3 en 58.1%, ROUGE-L en 26.8%, y precisión de citación en 70.59% sobre la línea base.

Encuadre. Todos los porcentajes son mejoras relativas en los puntos de referencia internos de SKT; los valores de calidad absoluta no se divulgan. ROUGE mide la superposición textual, no la corrección semántica, y no garantiza nada por sí mismo (lo que las evaluaciones ciegas por humanos compensan). Ambas fuentes primarias son partes del acuerdo: Anthropic (en la cual SKT invirtió $100M) y AWS (cuya plataforma lo aloja todo). No se han publicado datos sobre métricas comerciales del centro de contacto — tiempo de manejo, satisfacción, ahorros.

Análisis editorial. Primero: el caso publica efectivamente una "escalera de madurez" de LLM de industria con el precio de cada peldaño — los prompts entregan el primer 35–40% casi gratis, el ajuste fino agrega el siguiente salto, los datos sintéticos eliminan la escasez de datos. La conclusión práctica para cualquier equipo: no comiences con la etapa costosa — la mayoría del efecto va al trabajo de prompt disciplinado, y el ajuste fino tiene sentido una vez que se alcanza genuinamente el techo de prompt y se mide. Segundo: la cifra de "89% del nivel humano" en el procesamiento posterior a la llamada es un modelo de métricas honestas: muestra tanto la preparación (las redacciones rutinarias pueden entregarse al modelo bajo supervisión) como el límite (el déficit de 10+ por ciento es por qué el humano permanece en el bucle). Tercero: el vínculo inversor SKT–Anthropic hace que el caso sea simultáneamente más fuerte y más débil: más fuerte porque SKT arriesga su propio dinero y construye una alianza de operadores (GTAA) en esta apuesta; más débil porque cada métrica publicada pasa a través de dos partes financieramente interesadas. El resultado aún no tiene replicación externa — aunque el mismo diseño de la Global Telco AI Alliance implica que el enfoque se replicará en otros operadores de la alianza, y esa será la verdadera prueba de si un LLM telco se transfiere más allá del mercado coreano.

Stack tecnológico
Claude 3 Sonnet (fine-tuning в Amazon Bedrock)Bedrock Knowledge Bases / Agents / Guardrails + in-house RAGIn-Call Assist + Post-Call ProcessingСинтетические данные для обученияСлепая человеческая оценка (preference ranking)
Cronología
Agosto de 2023 — inversión de $100M de SKT en Anthropic y el plan para un LLM telco multilingüe conjunto (contexto: la Global Telco AI Alliance — SKT, Deutsche Telekom, e&, Singtel); luego — ajuste fino de Claude 3 Sonnet en Amazon Bedrock y lanzamiento de In-Call Assist y Post-Call Processing en los centros de contacto de SKT; 10 de octubre de 2024 — resultados técnicos de ajuste fino publicados en el blog de AWS.

Lecciones aprendidas

  1. Un LLM de industria es un stack de técnicas, no un único ajuste fino: optimización de prompts (ganancias de 35–40% por sí sola) → ajuste fino → datos sintéticos; solo juntos redujeron las respuestas malas en 68%.
  2. Comienza con el peldaño barato: la actualización de prompt por sí sola mejoró la precisión de citación en 52.94% — antes de pagar por ajuste fino, alcanza y mide el techo de prompt.
  3. Los datos sintéticos genuinamente funcionan cuando los ejemplos de entrenamiento son escasos: el modelo de SKT en 500 original + 1,500 muestras sintéticas (112/160) casi coincidió con el modelo en 2,000 originales (114/160).
  4. La métrica '% del nivel humano' (89% en procesamiento posterior a la llamada) es más honesta que los puntos de referencia abstractos — muestra exactamente dónde la IA está lista para asumir el trabajo rutinario y por qué el humano permanece en el bucle.
  5. Evalúa a ciegas, con humanos: la clasificación de preferencia por evaluadores activos detecta lo que ROUGE pierde — cortesía, empatía, aplicabilidad de respuestas.
  6. Posicionarse como 'aumento, no reemplazo' (IA — aumento de inteligencia) reduce la resistencia del personal: el objetivo es aliviar a los agentes abrumados, no cortarlos.
  7. El contexto cultural es parte de la calidad: para el servicio coreano, la empatía, la cortesía, los dialectos y las demografías de edad resultaron tan decisivas en la selección del modelo como la precisión, el rendimiento y la latencia.

Preguntas frecuentes

¿Qué exactamente construyó SK Telecom sobre Claude?

Un LLM específico de telco: Claude 3 Sonnet ajustado en Amazon Bedrock en documentación de SKT y conectado a un bucle RAG (Bedrock Knowledge Bases, Agents, Guardrails). Alimenta In-Call Assist (búsqueda de documentación y guía de agente en tiempo real durante llamadas) y Post-Call Processing (resumen, clasificación de temas, listas de tareas, análisis de sentimientos).

¿Qué números respaldan el impacto?

Las respuestas de baja calidad cayeron 68%, las calificaciones de calidad del agente subieron 34%, el procesamiento posterior a la llamada alcanzó ~89% del nivel humano, y la puntuación general del modelo mejoró de 3.3 a 4.3+. Según el blog de AWS: ROUGE-3 +58.1%, ROUGE-L +26.8%, precisión de citación +70.59% sobre la línea base (prompt + ajuste fino).

¿Por qué SKT usó datos sintéticos, y funcionan?

Los ejemplos de entrenamiento original eran escasos. En una prueba ciega con humanos, el modelo en 500 original + 1,500 muestras sintéticas puntuó 112/160 — casi coincidiendo con el modelo entrenado en 2,000 originales (114/160) y claramente superando el modelo de solo 500 originales (85/160). Conclusión: los datos sintéticos son casi equivalentes a datos originales de igual volumen.

¿La IA reemplazó a los agentes del centro de contacto de SKT?

No. La filosofía del proyecto es IA (aumento de inteligencia): según Eric Davis, "Esto no está diseñado para reemplazar empleos, está diseñado para mejorar la experiencia". In-Call Assist alivia a los agentes durante las llamadas; Post-Call Processing automatiza las redacciones con supervisión humana retenida.

¿Cuál es la relación de SKT con Anthropic más allá de este proyecto?

SKT es un inversor de Anthropic: en agosto de 2023, el operador invirtió $100M (además de una inversión anterior de SKTVC) y acordó co-desarrollar un LLM telco multilingüe (coreano, inglés, alemán, japonés, árabe, español) en el contexto de la Global Telco AI Alliance (SKT, Deutsche Telekom, e&, Singtel). Vale la pena tener en cuenta al evaluar las métricas publicadas.

← Casos