SK Telecom: телеком-LLM на дообученном Claude — минус 68% некачественных ответов в поддержке
Оценки качества ответов LLM от живых операторов выросли на 34% (in-call assistance). Доля некачественных ответов упала на 68% — дообученная телеком-модель против базовой. В постобработке звонков качество достигло ~89% от уровня живых операторов, а интегральная оценка телеком-LLM выросла с 3,3 до более чем 4,3. По данным технического блога AWS, дообучение Claude 3 Sonnet в паре с оптимизацией промптов улучшило ROUGE-3 на 58,1%, ROUGE-L на 26,8%, а точность цитирования источников — на 70,59% относительно базовой модели. Рамки. Все проценты — относительные улучшения на внутренних бенчмарках SKT, абсолютные значения качества не раскрыты; ROUGE — метрика пересечения текстов, а не смысловой корректности, и сама по себе гарантий не даёт (что компенсируется слепыми человеческими оценками). Оба первоисточника — стороны сделки: Anthropic (в которую SKT инвестировала $100 млн) и AWS (на чьей платформе всё развёрнуто). Данных о влиянии на бизнес-метрики контакт-центров — время обработки, satisfaction, экономию — компании не публиковали. Редакционный анализ. Первое: кейс фактически публикует «лестницу зрелости» отраслевой LLM с ценником каждой ступени — промпты дают первые 35–40% почти бесплатно, дообучение добавляет следующий скачок, синтетика снимает дефицит данных. Практический вывод для любой команды: не начинайте с дорогого этапа — большая часть эффекта достаётся дисциплинированной работе с промптами, а дообучение имеет смысл, когда потолок промптов реально достигнут и измерен. Второе: цифра «89% от уровня человека» в постобработке — образец честной метрики: она прямо показывает и готовность (рутинное оформление можно отдавать модели под присмотром), и границу (10+ процентов недотягивания — причина, почему человек остаётся в контуре). Третье: инвесторская связка SKT—Anthropic делает кейс одновременно и сильнее, и слабее: сильнее — потому что SKT рискует собственными деньгами и строит на этой ставке альянс операторов (GTAA), слабее — потому что все опубликованные метрики проходят через двух финансово заинтересованных участников. Внешней репликации у результата пока нет — хотя сама конструкция Global Telco AI Alliance предполагает, что подход будет тиражироваться на других операторов альянса, и именно это станет настоящей проверкой переносимости телеком-LLM за пределы корейского рынка.
- SK Telecom transforms customer service with Claude (customer story) — Anthropic / Claude (кейс-стади)
- SK Telecom improves telco-specific Q&A by fine-tuning Anthropic's Claude models in Amazon Bedrock — AWS Machine Learning Blog, 2024-10-10
- SKT Partnership Announcement — Anthropic (news), 2023-08
- SKT Invests USD 100 Million in Anthropic and Joins Forces with the Company to Promote AI Innovation — SK Telecom Newsroom, 2023-08
Контекст
SK Telecom — крупнейший мобильный оператор Южной Кореи, 27 лет подряд удерживающий первое место в национальном индексе удовлетворённости клиентов (NCSI). Корейский рынок не прощает медлительности: «Корея — очень срочное общество. Опоздал на минуту — считай, опоздал на десять», — говорит Эрик Дэвис, глава группы AI Tech Collaboration в SKT. Клиентский сервис здесь — не кост-центр, а часть национальной конкуренции брендов, где важны скорость, персонализация и культурные нюансы общения.
Отношения SKT с Anthropic глубже обычного клиентства. В августе 2023 года оператор объявил об инвестиции $100 млн в Anthropic (в дополнение к более раннему вложению венчурного крыла SKTVC) и о совместной разработке многоязычной LLM для телеком-отрасли — с поддержкой корейского, английского, немецкого, японского, арабского и испанского. Контекст сделки — Global Telco AI Alliance, альянс SKT, Deutsche Telekom, e& и Singtel, созданный для ускорения ИИ-трансформации операторов: идея в том, чтобы телекомы получали кастомизированные ИИ-возможности, не строя собственные модели с нуля.
Кейс, задокументированный Anthropic и техническим блогом AWS, — первое крупное практическое воплощение этой ставки: отраслевая телеком-LLM на базе дообученного Claude для контакт-центров SKT. Философию проекта Дэвис описывает термином «IA» — intelligence augmentation, усиление интеллекта: «Это не про замену рабочих мест — это про усиление опыта».
Для рынка кейс ценен редкой технической прозрачностью: помимо маркетинговых процентов, опубликованы детали методики — от структуры обучающих данных и экспериментов с синтетикой до методологии слепой оценки людьми. Это один из немногих кейсов, по которому можно реально учиться воспроизводить результат.
Проблема
Операторы контакт-центров перегружены. Во время звонка нужно быстро находить точные ответы в специфичной телеком-документации — при том что клиент на линии, а корейский стандарт скорости не даёт права на паузу. После звонка — вручную оформлять его результаты: резюме, классификация темы, список действий. Рутина съедает когнитивный ресурс, который должен доставаться клиенту.
Универсальные LLM без адаптации спотыкались на двух вещах. Первая — отраслевая терминология: точные ответы по тарифам, устройствам и процедурам требуют знания корпуса документации SKT, а не «общих знаний о телекоме». Вторая — культурная и языковая специфика: корейский клиентский сервис требует выверенной эмпатии и вежливости, а обслуживание охватывает разные каналы (телефон, чат), региональные диалекты и возрастные группы. Модель, «в целом неплохо» говорящая по-корейски, этот стандарт не проходит.
Требования бренда добавляли жёсткости: «Для нас безопасность бренда критична — всё, что может его запятнать, сразу нет. Огромный фокус Anthropic на безопасности действительно выделялся», — говорит Дэвис. И это не только про этику ответов: «Дело было не только в точности модели — пропускная способность и задержки должны были соответствовать нашим стандартам». Наконец, существовало и организационное ограничение: классический сервис работает по будням с 9 до 18, и всё, что снимает нагрузку с живых операторов, напрямую расширяет доступность сервиса. Задача сформулировалась так: не заменить операторов ботом, а построить отраслевую модель, которая разгружает людей в реальном времени и после звонка — на уровне качества, достойном 27-летнего лидера NCSI.
Решение
SKT дообучила (fine-tuning) Claude 3 Sonnet в Amazon Bedrock на своей документации и связала модель со своей RAG-системой в единый end-to-end контур: по техническому блогу AWS, в архитектуре задействованы Amazon Bedrock Knowledge Bases для отраслевого поиска, Bedrock Agents для расширенных сценариев и Bedrock Guardrails для ограждений.
На этой основе развёрнуты два продукта. In-Call Assist помогает оператору во время звонка: в реальном времени ищет по документации и подсказывает ответы, снимая когнитивную нагрузку с перегруженного сотрудника. Post-Call Processing автоматизирует оформление итогов: суммаризация разговора, классификация темы, генерация списка задач, анализ тональности — с сохранением человеческого контроля над результатом.
Самое поучительное в кейсе — стек приёмов повышения качества, задокументированный с цифрами. Первый слой — оптимизация промптов: одна она дала 35–40% улучшения; по метрикам AWS-блога, только обновление промпта улучшило ROUGE-3 на 38,3% и точность цитирования на 52,94% к базовой модели. Второй слой — дообучение: комбинация «промпт + fine-tuning» довела улучшение ROUGE-3 до 58,1%, ROUGE-L до 26,8%, а точности цитирования — до 70,59%; в отдельных метриках суммарный выигрыш достигал 50–60%. Третий слой — аугментация синтетическими данными для борьбы с дефицитом обучающих примеров.
Эксперимент с синтетикой заслуживает пересказа, потому что отвечает на вопрос, который задаёт себе каждая команда с маленьким датасетом. В слепой оценке людьми (ранжирование четырёх вариантов, от 4 баллов за лучший до 1 за худший) модель, обученная на 2 000 оригинальных примеров, набрала 114 из 160; модель на 500 оригинальных + 1 500 синтетических — 112; модель только на 500 оригинальных — 85; базовая модель без дообучения — 84. Вывод SKT: синтетически расширенные данные работают почти как эквивалентный объём оригинальных — то есть дефицит разметки перестаёт быть блокером.
Фокус применения, зафиксированный в AWS-блоге, — grounded Q&A: ответы по техническим телеком-документам с опорой на источники, на корейском языке. Это объясняет, почему точность цитирования стала одной из главных метрик проекта: подсказка оператору полезна только тогда, когда её можно мгновенно проверить по документу.
Оценка качества тоже выстроена как система: слепые ранжирования живыми оценщиками с балльной шкалой предпочтений — методика, которая меряет полезность для человека, а не только автоматические метрики. Дэвис добавляет и субъективный аргумент выбора модели: «Claude более человечен и креативен» — для сервиса, где эмпатия является частью стандарта, это не косметика, а требование.
Результат
Оценки качества ответов LLM от живых операторов выросли на 34% (in-call assistance). Доля некачественных ответов упала на 68% — дообученная телеком-модель против базовой. В постобработке звонков качество достигло ~89% от уровня живых операторов, а интегральная оценка телеком-LLM выросла с 3,3 до более чем 4,3. По данным технического блога AWS, дообучение Claude 3 Sonnet в паре с оптимизацией промптов улучшило ROUGE-3 на 58,1%, ROUGE-L на 26,8%, а точность цитирования источников — на 70,59% относительно базовой модели.
Рамки. Все проценты — относительные улучшения на внутренних бенчмарках SKT, абсолютные значения качества не раскрыты; ROUGE — метрика пересечения текстов, а не смысловой корректности, и сама по себе гарантий не даёт (что компенсируется слепыми человеческими оценками). Оба первоисточника — стороны сделки: Anthropic (в которую SKT инвестировала $100 млн) и AWS (на чьей платформе всё развёрнуто). Данных о влиянии на бизнес-метрики контакт-центров — время обработки, satisfaction, экономию — компании не публиковали.
Редакционный анализ. Первое: кейс фактически публикует «лестницу зрелости» отраслевой LLM с ценником каждой ступени — промпты дают первые 35–40% почти бесплатно, дообучение добавляет следующий скачок, синтетика снимает дефицит данных. Практический вывод для любой команды: не начинайте с дорогого этапа — большая часть эффекта достаётся дисциплинированной работе с промптами, а дообучение имеет смысл, когда потолок промптов реально достигнут и измерен. Второе: цифра «89% от уровня человека» в постобработке — образец честной метрики: она прямо показывает и готовность (рутинное оформление можно отдавать модели под присмотром), и границу (10+ процентов недотягивания — причина, почему человек остаётся в контуре). Третье: инвесторская связка SKT—Anthropic делает кейс одновременно и сильнее, и слабее: сильнее — потому что SKT рискует собственными деньгами и строит на этой ставке альянс операторов (GTAA), слабее — потому что все опубликованные метрики проходят через двух финансово заинтересованных участников. Внешней репликации у результата пока нет — хотя сама конструкция Global Telco AI Alliance предполагает, что подход будет тиражироваться на других операторов альянса, и именно это станет настоящей проверкой переносимости телеком-LLM за пределы корейского рынка.
Уроки для индустрии
- Отраслевая LLM — это стек приёмов, а не один файн-тюнинг: промпт-оптимизация (уже 35–40% эффекта) → дообучение → синтетические данные, и только вместе они дали −68% плохих ответов.
- Начинайте с дешёвой ступени: только обновление промптов улучшило точность цитирования на 52,94% — прежде чем платить за дообучение, добейтесь измеренного потолка промптов.
- Синтетические данные реально работают при дефиците обучающих примеров: у SKT модель на 500 оригинальных + 1 500 синтетических (112/160) почти догнала модель на 2 000 оригинальных (114/160).
- Метрика «% от уровня человека» (89% в постобработке) честнее абстрактных бенчмарков — она сразу показывает, где ИИ уже готов заменить рутину и почему человек остаётся в контуре.
- Оценивайте людьми вслепую: балльное ранжирование живыми оценщиками ловит то, что ROUGE не видит, — вежливость, эмпатию, применимость ответа.
- Позиционирование «аугментация, а не замена» (IA — intelligence augmentation) снижает сопротивление персонала: цель — разгрузить перегруженных операторов, а не сократить их.
- Культурный контекст — часть качества: для корейского сервиса эмпатия, вежливость, диалекты и возрастные группы оказались такими же критериями выбора модели, как точность, пропускная способность и латентность.
Частые вопросы
Что именно SK Telecom построила на Claude?
Отраслевую телеком-LLM: Claude 3 Sonnet, дообученный в Amazon Bedrock на документации SKT и связанный с RAG-контуром (Bedrock Knowledge Bases, Agents, Guardrails). На её основе работают In-Call Assist (поиск по документации и подсказки оператору во время звонка) и Post-Call Processing (суммаризация, классификация темы, списки задач, анализ тональности).
Какие цифры подтверждают эффект?
Доля некачественных ответов снизилась на 68%, оценки качества от операторов выросли на 34%, постобработка звонков достигла ~89% от уровня человека, интегральная оценка модели выросла с 3,3 до 4,3+. По блогу AWS: ROUGE-3 +58,1%, ROUGE-L +26,8%, точность цитирования +70,59% к базовой модели (промпт + дообучение).
Зачем SKT синтетические данные и работают ли они?
Оригинальных обучающих примеров не хватало. В слепом человеческом тесте модель на 500 оригинальных + 1 500 синтетических примеров набрала 112/160 — почти столько же, сколько модель на 2 000 оригинальных (114/160), и заметно больше, чем модель на 500 оригинальных (85/160). Вывод: синтетика почти эквивалентна оригинальным данным того же объёма.
Заменил ли ИИ операторов контакт-центра SKT?
Нет. Философия проекта — IA (intelligence augmentation): по словам Эрика Дэвиса, «это не про замену рабочих мест, а про усиление опыта». In-Call Assist разгружает операторов во время звонка, Post-Call Processing автоматизирует оформление итогов с сохранением человеческого контроля.
Какое отношение SKT имеет к Anthropic помимо этого проекта?
SKT — инвестор Anthropic: в августе 2023 года оператор вложил $100 млн (в дополнение к более раннему вложению SKTVC) и договорился о совместной разработке многоязычной телеком-LLM (корейский, английский, немецкий, японский, арабский, испанский) в контексте Global Telco AI Alliance (SKT, Deutsche Telekom, e&, Singtel). Это стоит учитывать при оценке опубликованных метрик.