📡
Telecom · SK Telecom

SK Telecom : un LLM telco sur Claude affiné — 68 % de réponses support de faible qualité en moins

Les évaluations de qualité des réponses LLM des agents en direct ont augmenté de 34 % (assistance en appel). La part des réponses de faible qualité a baissé de 68 % — le modèle telco affiné par rapport au modèle de base. En traitement post-appel, la qualité a atteint environ 89 % du niveau des agents humains, et le score global du LLM telco a augmenté de 3,3 à plus de 4,3. Selon le blog technique AWS, l'affinage de Claude 3 Sonnet combiné à l'optimisation du prompt a amélioré ROUGE-3 de 58,1 %, ROUGE-L de 26,8 % et la précision des citations de 70,59 % par rapport à la ligne de base. Cadre. Tous les pourcentages sont des améliorations relatives selon les repères internes de SKT ; les valeurs de qualité absolue ne sont pas divulguées. ROUGE mesure le chevauchement textuel, pas l'exactitude sémantique, et ne garantit rien par elle-même (ce que les évaluations humaines en aveugle compensent). Les deux sources principales sont parties à l'accord : Anthropic (dans laquelle SKT a investi 100 millions de dollars) et AWS (dont la plateforme héberge tout). Aucune donnée sur les métriques commerciales du centre de contact — temps de traitement, satisfaction, économies — n'a été publiée. Analyse éditoriale. D'abord : le cas publie effectivement une « échelle de maturité » LLM industriel avec le prix de chaque échelon — les prompts livrent les premiers 35–40 % presque gratuitement, l'affinage ajoute le prochain saut, les données synthétiques éliminent la pénurie de données. L'enseignement pratique pour toute équipe : ne commencez pas par l'étape coûteuse — la plupart de l'effet va au travail discipliné du prompt, et l'affinage a du sens une fois que le plafond du prompt est vraiment atteint et mesuré. Deuxièmement : le chiffre « 89 % du niveau humain » en traitement post-appel est un modèle de métriques honnêtes : il montre à la fois la préparation (les rédactions de routine peuvent être confiées au modèle sous supervision) et la limite (le manque de 10+ pour cent explique pourquoi l'humain reste dans la boucle). Troisièmement : le lien d'investisseur SKT–Anthropic rend l'affaire simultanément plus forte et plus faible : plus forte parce que SKT risque son propre argent et construit une alliance d'opérateurs (GTAA) sur ce pari ; plus faible parce que chaque métrique publiée passe par deux parties financièrement intéressées. Le résultat n'a pas encore de réplication externe — bien que la conception même de l'Alliance mondiale de l'IA pour les télécoms implique que l'approche sera répliquée par les autres opérateurs de l'alliance, et ce sera le vrai test pour savoir si un LLM telco se transfère au-delà du marché coréen.

−68%
réponses de modèle de faible qualité
+34%
évaluations de qualité des réponses
89%
de qualité d'agent humain (post-appel)
3,3→4,3+
score global du LLM telco
Sources
Vérifié: 2026-07-11

Contexte

SK Telecom est le plus grand opérateur mobile de Corée du Sud, classé #1 dans l'Indice national de satisfaction des clients (NCSI) pendant 27 années consécutives. Le marché coréen ne tolère pas la lenteur : « La Corée est une société très pressée. Si vous êtes en retard d'une minute, vous êtes en retard de dix minutes », déclare Eric Davis, responsable du groupe de collaboration en technologie IA chez SKT. Le service client ici n'est pas un centre de coûts mais une partie d'une compétition nationale de marque où la vitesse, la personnalisation et la nuance culturelle comptent.

La relation de SKT avec Anthropic est plus profonde qu'un simple partenariat commercial. En août 2023, l'opérateur a annoncé un investissement de 100 millions de dollars dans Anthropic (en plus d'un investissement antérieur de sa branche de capital-risque SKTVC) et le développement conjoint d'un LLM multilingue pour l'industrie des télécommunications — prenant en charge le coréen, l'anglais, l'allemand, le japonais, l'arabe et l'espagnol. Le contexte de cet accord est l'Alliance mondiale de l'IA pour les télécoms — SKT, Deutsche Telekom, e&, et Singtel — créée pour accélérer la transformation par l'IA des opérateurs : l'idée est que les télécoms obtiennent des capacités d'IA personnalisées sans construire leurs propres modèles à partir de zéro.

Le cas documenté par Anthropic et le blog technique AWS est la première grande incarnation pratique de ce pari : un LLM telco industriel basé sur Claude affiné pour les centres de contact de SKT. Davis décrit la philosophie du projet par le terme « IA » — augmentation de l'intelligence : « Cela n'est pas destiné à remplacer les emplois — c'est destiné à augmenter l'expérience. »

Pour le marché, le cas est précieux pour sa transparence technique rare : au-delà des pourcentages marketing, les détails méthodologiques sont publiés — de la composition des données d'entraînement et des expériences de données synthétiques à la méthodologie d'évaluation humaine en aveugle. C'est l'un des rares cas à partir duquel vous pouvez réellement apprendre à reproduire les résultats.

Problème

Les agents des centres de contact sont submergés. Pendant un appel, ils doivent rapidement trouver des réponses précises dans la documentation spécifique aux télécoms — avec le client en ligne et la norme de vitesse coréenne ne tolérant aucune pause. Après l'appel, ils rédigent manuellement ses résultats : résumé, classification des sujets, éléments d'action. La routine consomme des ressources cognitives qui devraient aller au client.

Les LLM génériques sans adaptation ont buté sur deux choses. D'abord — la terminologie du secteur : les réponses précises sur les tarifs, les appareils et les procédures nécessitent la connaissance du corpus de documentation de SKT, pas seulement la « connaissance générale des télécoms ». Deuxièmement — la spécificité culturelle et linguistique : le service client coréen exige une empathie et une politesse calibrées, et le service s'étend sur les canaux (téléphone, chat), les dialectes régionaux et les groupes d'âge. Un modèle qui parle le coréen « raisonnablement bien » ne franchit pas cette barre.

Les exigences de marque ont ajouté de la rigueur : « Pour nous, la sécurité de la marque est cruciale — tout ce qui ternit la marque est inacceptable. L'énorme focus d'Anthropic sur la sécurité s'est vraiment démarqué », dit Davis. Et il ne s'agit pas seulement d'éthique des réponses : « La performance n'était pas seulement une question de précision du modèle — le débit et la latence devaient répondre à nos normes. » Enfin, il y avait une contrainte organisationnelle : le service traditionnel fonctionne en semaine de 9 h à 18 h, donc tout ce qui décharge les agents en direct étend directement la disponibilité du service. La tâche s'est cristallisée comme suit : non pas remplacer les agents par un bot, mais construire un modèle industriel qui soulage les gens en temps réel et après l'appel — à un niveau de qualité digne d'un leader NCSI de 27 ans.

Solution

SKT a affiné Claude 3 Sonnet dans Amazon Bedrock sur sa documentation et a connecté le modèle à son système RAG dans une seule boucle de bout en bout : selon le blog technique AWS, l'architecture utilise Amazon Bedrock Knowledge Bases pour la récupération de domaine, Bedrock Agents pour les scénarios étendus et Bedrock Guardrails pour les garde-fous de sécurité.

Deux produits ont été déployés sur cette base. In-Call Assist aide l'agent pendant l'appel : il recherche la documentation en temps réel et suggère des réponses, soulevant la charge cognitive de l'employé submergé. Post-Call Processing automatise la rédaction : résumé de conversation, classification des sujets, génération de listes de tâches, analyse des sentiments — avec conservation de la supervision humaine des résultats.

La partie la plus instructive du cas est la pile d'amélioration de la qualité, documentée avec des chiffres. La première couche est l'optimisation des prompts : seule, elle a livré des améliorations de 35–40 % ; selon les métriques du blog AWS, la mise à jour du prompt a amélioré à elle seule ROUGE-3 de 38,3 % et la précision des citations de 52,94 % par rapport au modèle de base. La deuxième couche est l'affinage : la combinaison « prompt + affinage » a poussé l'amélioration ROUGE-3 à 58,1 %, ROUGE-L à 26,8 % et la précision des citations à 70,59 % ; dans certaines métriques, les gains combinés ont atteint 50–60 %. La troisième couche est l'augmentation des données synthétiques pour lutter contre la pénurie d'exemples d'entraînement.

L'expérience des données synthétiques mérite une relecture car elle répond à la question que se pose chaque équipe ayant un petit ensemble de données. En évaluation humaine en aveugle (classement de quatre variantes, de 4 points pour le meilleur à 1 pour le pire), le modèle entraîné sur 2,000 échantillons originaux a obtenu 114 sur 160 ; le modèle sur 500 originaux + 1,500 synthétiques — 112 ; le modèle sur seulement 500 originaux — 85 ; le modèle de base sans affinage — 84. La conclusion de SKT : les données augmentées synthétiquement fonctionnent presque comme un volume équivalent de données originales — ce qui signifie que la rareté des annotations cesse d'être un obstacle.

L'orientation applicative enregistrée dans le blog AWS est Q&A ancrée : réponses ancrées sur les sources sur des documents techniques de télécoms, en coréen. Cela explique pourquoi la précision des citations est devenue l'une des métriques phares du projet : une suggestion à un agent n'est utile que si elle peut être instantanément vérifiée par rapport au document.

L'évaluation de la qualité est également construite en tant que système : classements en aveugle par des évaluateurs humains avec une échelle de préférence — une méthodologie qui mesure l'utilité pour les humains, pas seulement les métriques automatisées. Davis ajoute un argument de sélection de modèle subjectif : « Claude est plus accessible et créatif » — pour un service où l'empathie fait partie de la norme, c'est une exigence, pas un cosmétique.

Résultat

Les évaluations de qualité des réponses LLM des agents en direct ont augmenté de 34 % (assistance en appel). La part des réponses de faible qualité a baissé de 68 % — le modèle telco affiné par rapport au modèle de base. En traitement post-appel, la qualité a atteint environ 89 % du niveau des agents humains, et le score global du LLM telco a augmenté de 3,3 à plus de 4,3. Selon le blog technique AWS, l'affinage de Claude 3 Sonnet combiné à l'optimisation du prompt a amélioré ROUGE-3 de 58,1 %, ROUGE-L de 26,8 % et la précision des citations de 70,59 % par rapport à la ligne de base.

Cadre. Tous les pourcentages sont des améliorations relatives selon les repères internes de SKT ; les valeurs de qualité absolue ne sont pas divulguées. ROUGE mesure le chevauchement textuel, pas l'exactitude sémantique, et ne garantit rien par elle-même (ce que les évaluations humaines en aveugle compensent). Les deux sources principales sont parties à l'accord : Anthropic (dans laquelle SKT a investi 100 millions de dollars) et AWS (dont la plateforme héberge tout). Aucune donnée sur les métriques commerciales du centre de contact — temps de traitement, satisfaction, économies — n'a été publiée.

Analyse éditoriale. D'abord : le cas publie effectivement une « échelle de maturité » LLM industriel avec le prix de chaque échelon — les prompts livrent les premiers 35–40 % presque gratuitement, l'affinage ajoute le prochain saut, les données synthétiques éliminent la pénurie de données. L'enseignement pratique pour toute équipe : ne commencez pas par l'étape coûteuse — la plupart de l'effet va au travail discipliné du prompt, et l'affinage a du sens une fois que le plafond du prompt est vraiment atteint et mesuré. Deuxièmement : le chiffre « 89 % du niveau humain » en traitement post-appel est un modèle de métriques honnêtes : il montre à la fois la préparation (les rédactions de routine peuvent être confiées au modèle sous supervision) et la limite (le manque de 10+ pour cent explique pourquoi l'humain reste dans la boucle). Troisièmement : le lien d'investisseur SKT–Anthropic rend l'affaire simultanément plus forte et plus faible : plus forte parce que SKT risque son propre argent et construit une alliance d'opérateurs (GTAA) sur ce pari ; plus faible parce que chaque métrique publiée passe par deux parties financièrement intéressées. Le résultat n'a pas encore de réplication externe — bien que la conception même de l'Alliance mondiale de l'IA pour les télécoms implique que l'approche sera répliquée par les autres opérateurs de l'alliance, et ce sera le vrai test pour savoir si un LLM telco se transfère au-delà du marché coréen.

Stack technique
Claude 3 Sonnet (fine-tuning в Amazon Bedrock)Bedrock Knowledge Bases / Agents / Guardrails + in-house RAGIn-Call Assist + Post-Call ProcessingСинтетические данные для обученияСлепая человеческая оценка (preference ranking)
Chronologie
Août 2023 — investissement de 100 millions de dollars de SKT dans Anthropic et le plan pour un LLM telco multilingue conjoint (contexte : l'Alliance mondiale de l'IA pour les télécoms — SKT, Deutsche Telekom, e&, Singtel) ; ensuite — affinage de Claude 3 Sonnet dans Amazon Bedrock et lancement d'In-Call Assist et Post-Call Processing dans les centres de contact de SKT ; 10 octobre 2024 — résultats techniques d'affinage publiés sur le blog AWS.

Leçons

  1. Un LLM industriel est une pile de techniques, pas un seul affinage : optimisation du prompt (gains de 35–40 % seuls) → affinage → données synthétiques ; ce n'est qu'ensemble qu'ils ont réduit les mauvaises réponses de 68 %.
  2. Commencez par l'échelon bon marché : la mise à jour du prompt a amélioré seule la précision des citations de 52,94 % — avant de payer pour l'affinage, atteignez et mesurez le plafond du prompt.
  3. Les données synthétiques fonctionnent vraiment lorsque les exemples d'entraînement sont rares : le modèle de SKT sur 500 originaux + 1,500 échantillons synthétiques (112/160) a presque égalé le modèle sur 2,000 originaux (114/160).
  4. La métrique « % du niveau humain » (89 % en traitement post-appel) est plus honnête que les repères abstraits — elle montre exactement où l'IA est prête à reprendre le travail de routine et pourquoi l'humain reste dans la boucle.
  5. Évaluez en aveugle, avec des humains : le classement des préférences par les évaluateurs en direct capture ce que ROUGE manque — politesse, empathie, applicabilité des réponses.
  6. Se positionner comme « augmentation, pas remplacement » (IA — augmentation de l'intelligence) réduit la résistance du personnel : l'objectif est de soulager les agents submergés, pas de les réduire.
  7. Le contexte culturel fait partie de la qualité : pour le service coréen, l'empathie, la politesse, les dialectes et les groupes d'âge se sont avérés aussi décisifs dans la sélection du modèle que la précision, le débit et la latence.

Questions fréquentes

Qu'exactement SK Telecom a-t-il construit sur Claude ?

Un LLM spécifique aux télécoms : Claude 3 Sonnet affiné dans Amazon Bedrock sur la documentation SKT et connecté à une boucle RAG (Bedrock Knowledge Bases, Agents, Guardrails). Il alimente In-Call Assist (recherche de documentation et orientation en temps réel de l'agent pendant les appels) et Post-Call Processing (résumé, classification des sujets, listes de tâches, analyse des sentiments).

Quels chiffres soutiennent l'impact ?

Les réponses de faible qualité ont baissé de 68 %, les évaluations de qualité des agents ont augmenté de 34 %, le traitement post-appel a atteint environ 89 % du niveau humain, et le score global du modèle s'est amélioré de 3,3 à 4,3+. Selon le blog AWS : ROUGE-3 +58,1 %, ROUGE-L +26,8 %, précision des citations +70,59 % par rapport à la ligne de base (prompt + affinage).

Pourquoi SKT a-t-il utilisé des données synthétiques, et cela fonctionne-t-il ?

Les exemples d'entraînement originaux étaient rares. Dans un test humain en aveugle, le modèle sur 500 originaux + 1,500 échantillons synthétiques a obtenu 112/160 — presque égalant le modèle entraîné sur 2,000 originaux (114/160) et battant clairement le modèle à 500 originaux uniquement (85/160). Conclusion : les données synthétiques sont presque équivalentes aux données originales de même volume.

L'IA a-t-elle remplacé les agents des centres de contact de SKT ?

Non. La philosophie du projet est l'IA (augmentation de l'intelligence) : selon Eric Davis, « Cela n'est pas destiné à remplacer les emplois — c'est destiné à augmenter l'expérience. » In-Call Assist soulage les agents pendant les appels ; Post-Call Processing automatise les rédactions avec la supervision humaine conservée.

Quelle est la relation de SKT avec Anthropic au-delà de ce projet ?

SKT est un investisseur d'Anthropic : en août 2023, l'opérateur a investi 100 millions de dollars (en plus d'un investissement antérieur de SKTVC) et a accepté de co-développer un LLM telco multilingue (coréen, anglais, allemand, japonais, arabe, espagnol) dans le contexte de l'Alliance mondiale de l'IA pour les télécoms (SKT, Deutsche Telekom, e&, Singtel). À retenir lors de l'évaluation des métriques publiées.

← Cas