Oscar Health: документация быстрее почти на 40%, эскалации по claims — на 50%, и первый BAA-контракт с OpenAI
По кейсу OpenAI (апрель 2024): время на документирование разговоров и разбор лабораторных результатов сократилось почти на 40% (по блогу компании — с 20+ до менее чем 12 минут на разговор); ассистент по claims сократил время решения эскалаций на 50% при точности на уровне или выше живых агентов; ожидание — автоматизация расследования минимум 4 000 тикетов в месяц (48 000 к концу года). R&D-эксперименты показывали прирост производительности до 90% в отдельных случаях. Инженерный разбор добавляет гранулярность, которой обычно не хватает вендорским кейсам: на простых сценариях машина сравнялась с человеком сразу, на сложных — сначала уступала, а после внедрения Skeleton Trace несколько категорий вопросов вышли на 100% точности, самые трудные — на 80%. Рамки: все цифры — самоотчёт Oscar в кейсе OpenAI (заинтересованной стороны); «до 90%» — результат R&D, а не продакшена; 4 000 тикетов/мес — ожидание на момент публикации, а не подтверждённый факт; решения по выплатам остаются за людьми — ИИ ускоряет поиск и подготовку информации. Амбиция «удешевить визит к врачу в десять раз за три-пять лет» — декларация Шлоссера о направлении, а не обязательство с метрикой. На наш взгляд, у кейса два системных урока, выходящих за пределы страхования. Первый: последовательность «сначала BAA, потом модели» — правильный порядок для любой регулируемой отрасли; Oscar получила фору не потому, что у неё был доступ к другим моделям, а потому, что первой построила юридическую конструкцию, в которой эти модели можно законно применять к реальным данным. Второй: разница между 40% (продакшен) и 90% (R&D) — это честная цена перехода от демо к эксплуатации, и компании, публикующие обе цифры с явной маркировкой, заслуживают большего доверия, чем те, у кого «всё по 90%». Третье наблюдение — инженерное: история claims-ассистента показывает, что главная работа при внедрении LLM в legacy-системы — не промптинг, а проектирование представления данных. GPT-4 не справлялся, пока трейсы не переупаковали в Skeleton Trace с итеративным запросом деталей; по сути, команда изобрела для своей задачи то, что позже станет общим паттерном агентного RAG. Мы бы читали этот кейс именно как учебник по «подготовке данных под модель», а не как рекламу конкретного API.
- Oscar brings AI to health insurance, reducing costs and improving patient care — OpenAI (customer story), 2024-04-01
- Oscar Claim Assistant Built On GPT-4 (Skeleton Trace, итеративные запросы, 100%/80% точности по категориям) — Oscar Tech (Medium, инженерный блог), 2023-10-19
- Harnessing OpenAI to Enhance the Healthcare Experience (документация <12 минут против 20+) — Oscar Health (корпоративный блог), n/a
Контекст
Oscar Health — американская страховая технологическая компания, которая строит медицинское страхование вокруг данных и технологий. Сооснователь и CTO Марио Шлоссер объясняет, почему именно языковые модели стали для компании переломом: «С языковыми моделями мы впервые подумали: можно перевести хаос реального мира в ясный оцифрованный план». Для страховщика это не метафора — весь его бизнес состоит из неструктурированных текстов: медкарт, контрактов, логов обработки заявок и переписки с врачами.
Два институциональных решения отличают Oscar от большинства игроков. Первое — дисциплина выбора моделей: «Мы регулярно бенчмаркаем все основные модели на проприетарных датасетах под медицинские юзкейсы, — говорит старший продакт-менеджер и AI R&D Lead компании Никита Лутра. — Модели OpenAI стабильно показывают лучший результат». Второе — юридическая конструкция: Oscar стала первой страховой компанией, подписавшей с OpenAI соглашение Business Associate Agreement (BAA) — обязательный по HIPAA договор, позволяющий обрабатывать защищённые медицинские данные сторонним сервисом. «OpenAI был отличным партнёром в том, чтобы данные использовались действительно ответственно и в соответствии с требованиями», — отмечает Лутра.
Компания необычно открыта для своей отрасли: инженерная команда публикует технические разборы своих ИИ-систем в блоге Oscar Tech на Medium (включая детальный пост об архитектуре claims-ассистента, октябрь 2023), а результаты — в корпоративном блоге. Этот кейс собран из трёх таких первоисточников: кейса OpenAI (апрель 2024), инженерного разбора и блога компании — редкая для healthcare-ИИ возможность сверить маркетинговый и технический слои одной истории.
Проблема
Административная рутина — один из главных драйверов стоимости медицины в США. Документирование одного разговора пациента с медицинской командой занимает у человека больше 20 минут; на масштабе страховщика это тысячи часов клинического времени, потраченных на печать текста, и прямой вклад в выгорание медсестёр и врачей.
Разбор «жизненной истории» страхового требования (claim) ещё сложнее. В обработке заявки участвуют миллионы контрактных переменных, и каждая заявка оставляет за собой Claim Trace — детальный лог всех решений, принятых системой на её пути. Когда врач задаёт вопрос по claim («почему отказано?», «почему такая сумма?»), командам Oscar приходится вручную проходить эти логи — работа медленная, дорогая и требующая редкой экспертизы одновременно в медицине, контрактах и внутренних системах.
Третий пласт — медицинские карты. Они написаны неструктурированным «живым» языком, а у пациентов с самыми сложными состояниями достигают 500 страниц: найти нужный факт — как иголку в стоге сена. Здесь же скрыта системная несправедливость, о которой говорит Лутра: чем тяжелее болеет человек, тем длиннее и неподъёмнее его карта — и тем хуже система справляется именно с теми, кому помощь нужнее всего.
Над всем этим — регуляторная рамка: HIPAA. Любое решение, где медицинские данные уходят в стороннюю модель, без юридической конструкции BAA просто незаконно — и это первый фильтр, который отсекает большинство «быстрых пилотов» в американском healthcare.
Решение
На OpenAI API компания автоматизировала три контура, и по каждому есть первоисточник.
Контур первый — клиническая документация: черновики документации разговоров о медицинской помощи и разбор лабораторных результатов. Время сократилось почти на 40% — по данным блога компании, документирование одного разговора уложилось менее чем в 12 минут против 20+ у человека; медсёстры и клиницисты переключаются на задачи более высокого порядка.
Контур второй — claims-ассистент, и его инженерная история поучительна (Oscar Tech, октябрь 2023; авторы — Бенджамин Бейкер, Эван По, Назем Алдруби). Наивный подход — «скормить GPT-4 весь Claim Trace» — упёрся в лимиты контекста; выкидывание промежуточных данных помогло, но модель терялась в сложных кейсах. Рабочим решением стала структура Skeleton Trace — «оглавление» трейса, показывающее только иерархию исполнения модулей без значений: модель смотрит на скелет, сама решает, какой фрагмент трейса запросить, и итеративно докапывается до ответа; система оценивает уверенность модели и при сомнениях подтягивает дополнительные данные. Результат по категориям задач: от 100% точности на нескольких классах вопросов до 80% на самых трудных. В эксплуатации ассистент сократил время решения эскалаций командой обработки на 50% при точности на уровне или выше живых агентов; компания ожидала автоматизировать расследование минимум 4 000 тикетов в месяц (48 000 к концу года).
Контур третий — медкарты: поиск релевантной информации для ускорения ревью claims, саммари прошлых записей перед приёмом пациента, извлечение данных из множества карт для вопросов вида «кому из этих пациентов с диабетом подойдёт непрерывный мониторинг глюкозы».
Есть и четвёртый, культурный контур — «маховик знаний»: Oscar сознательно публикует свои генеративные наработки в блоге и соцсетях. Логика Шлоссера прагматична: «Все бьются над одними и теми же проблемами в healthcare. Если мы решили проблему первыми — надо рассказать другим: они расскажут, что решили сами, и маховик закрутится». Амбиция при этом заявлена куда дальше административной рутины: «Мы не хотим просто подгрызать края административного упрощения. В ближайшие три-пять лет нужно снизить стоимость визита к врачу и пребывания в больнице в десять раз — единственный путь к этому: модель в центре взаимодействия пациента и врача, а не просто расшифровка».
Организационно всё это ведёт выделенный AI Pod — центральная команда с мандатом проводить продуктовые, аналитические и операционные команды через применение ИИ. Философия — от бизнес-проблемы, а не от технологии: «Самые успешные применения случаются, когда мы умеем разложить очень сложную проблему на маленькие задачи», — говорит Лутра, добавляя деталь о составе команды: пять из шести участников Pod — женщины, всем — двадцать-тридцать с небольшим. Наконец, компания играет вдолгую с регулятором: вместе с Белым домом Oscar возглавила коалицию из 37 крупнейших плательщиков и провайдеров по принципам ответственного ИИ в здравоохранении. «Главный вывод — регуляторы в healthcare хотят, чтобы ИИ получился, и невероятно воодушевлены. Наша задача — поддерживать прозрачный поток информации к государству», — говорит Шлоссер.
Результат
По кейсу OpenAI (апрель 2024): время на документирование разговоров и разбор лабораторных результатов сократилось почти на 40% (по блогу компании — с 20+ до менее чем 12 минут на разговор); ассистент по claims сократил время решения эскалаций на 50% при точности на уровне или выше живых агентов; ожидание — автоматизация расследования минимум 4 000 тикетов в месяц (48 000 к концу года). R&D-эксперименты показывали прирост производительности до 90% в отдельных случаях. Инженерный разбор добавляет гранулярность, которой обычно не хватает вендорским кейсам: на простых сценариях машина сравнялась с человеком сразу, на сложных — сначала уступала, а после внедрения Skeleton Trace несколько категорий вопросов вышли на 100% точности, самые трудные — на 80%.
Рамки: все цифры — самоотчёт Oscar в кейсе OpenAI (заинтересованной стороны); «до 90%» — результат R&D, а не продакшена; 4 000 тикетов/мес — ожидание на момент публикации, а не подтверждённый факт; решения по выплатам остаются за людьми — ИИ ускоряет поиск и подготовку информации. Амбиция «удешевить визит к врачу в десять раз за три-пять лет» — декларация Шлоссера о направлении, а не обязательство с метрикой.
На наш взгляд, у кейса два системных урока, выходящих за пределы страхования. Первый: последовательность «сначала BAA, потом модели» — правильный порядок для любой регулируемой отрасли; Oscar получила фору не потому, что у неё был доступ к другим моделям, а потому, что первой построила юридическую конструкцию, в которой эти модели можно законно применять к реальным данным. Второй: разница между 40% (продакшен) и 90% (R&D) — это честная цена перехода от демо к эксплуатации, и компании, публикующие обе цифры с явной маркировкой, заслуживают большего доверия, чем те, у кого «всё по 90%».
Третье наблюдение — инженерное: история claims-ассистента показывает, что главная работа при внедрении LLM в legacy-системы — не промптинг, а проектирование представления данных. GPT-4 не справлялся, пока трейсы не переупаковали в Skeleton Trace с итеративным запросом деталей; по сути, команда изобрела для своей задачи то, что позже станет общим паттерном агентного RAG. Мы бы читали этот кейс именно как учебник по «подготовке данных под модель», а не как рекламу конкретного API.
Уроки для индустрии
- В healthcare юридическая конструкция первична: BAA с OpenAI — то, что отделяет рабочий проект от неприемлемого риска; Oscar сделала это раньше всех страховщиков и получила фору.
- Регулярный бенчмаркинг моделей на собственных датасетах («мы бенчмаркаем все основные модели на проприетарных данных») — правильная замена выбору модели по маркетингу.
- Разделяйте R&D и продакшен в отчётности: Oscar честно маркирует 90% как исследовательский потолок, а ~40% — как рабочий результат; это редкая и правильная дисциплина.
- Главная работа с LLM в legacy-системах — представление данных, а не промпты: GPT-4 не справлялся с полными трейсами заявок, пока их не переупаковали в Skeleton Trace с итеративным запросом деталей.
- Централизованный AI Pod с мандатом «проводить другие команды через ИИ» масштабирует экспертизу без найма ML-инженеров в каждый отдел, а декомпозиция сложных проблем на «маленькие задачи» — его основной метод.
- Самый большой выигрыш — там, где данные самые неудобные: 500-страничные медкарты сложных пациентов из барьера превращаются в источник преимущества, включая аргумент справедливости.
- Публичное саморегулирование (коалиция 37 игроков с Белым домом) — способ формировать будущие правила, а не ждать их.
Частые вопросы
Что такое BAA и почему это важно в кейсе Oscar?
Business Associate Agreement — соглашение, необходимое по HIPAA для обработки защищённых медицинских данных сторонним сервисом. Oscar стала первой страховой компанией, подписавшей BAA с OpenAI, что позволило легально использовать модели на реальных медицинских данных — и быстро запуститься там, где конкуренты ещё согласовывали юридическую рамку.
Насколько ИИ ускорил работу Oscar Health?
По кейсу OpenAI: документирование медицинских разговоров и разбор лабораторных результатов — почти на 40% быстрее (по блогу компании — менее 12 минут против 20+), решение эскалаций по страховым требованиям — на 50% быстрее при точности на уровне или выше живых агентов. В R&D отдельные задачи ускорялись до 90% — но это исследовательский потолок, а не продакшен.
Как устроен claims-ассистент технически?
Каждая заявка оставляет Claim Trace — лог всех решений системы. Полный трейс не влезает в контекст модели, поэтому инженеры Oscar придумали Skeleton Trace — «оглавление» с иерархией модулей без значений: GPT-4 смотрит на скелет, сам запрашивает нужные фрагменты и итеративно доуточняет ответ; при низкой уверенности система подтягивает дополнительные данные. Итог — 100% точности на нескольких категориях вопросов и 80% на самых сложных (Oscar Tech).
Принимает ли ИИ в Oscar решения о страховых выплатах?
В опубликованных материалах речь идёт об ассистирующих задачах: документация, навигация по трейсу заявки, саммари медкарт, ответы на вопросы. Решения по выплатам остаются за людьми; ИИ сокращает время на поиск и подготовку информации.
Что такое AI Pod в Oscar?
Центральная команда с мандатом проводить продуктовые, аналитические и операционные команды через применение ИИ к их задачам. Метод — декомпозиция сложных проблем на «маленькие задачи»; в найме ценятся упорство, скромность и любопытство, а не академические регалии. Пять из шести участников Pod — женщины в возрасте 20–30+ лет.