🏥
Assurance maladie · Oscar Health

Oscar Health : documentation 40% plus rapide, escalades de réclamations résolues 50% plus rapidement, et le premier BAA avec OpenAI

Selon l'étude de cas OpenAI (avril 2024) : le temps consacré à la documentation des conversations de soins et à l'examen des résultats de laboratoire a diminué de près de 40% (selon le blog de l'entreprise — de 20+ minutes à moins de 12 par conversation) ; l'assistant de réclamations a réduit le temps de résolution des escalades de 50% avec une précision égale ou supérieure aux agents humains ; l'attente — automatiser l'investigation d'au moins 4 000 tickets par mois (48 000 d'ici la fin de l'année). Les expériences de R&D ont montré des gains de productivité allant jusqu'à 90% dans certains cas. Le document technique d'ingénierie ajoute la granularité que les cas de fournisseurs manquent généralement : dans les scénarios simples, la machine correspondait immédiatement aux humains, dans les cas complexes, elle était initialement en retard, et après l'introduction de la trace de squelette, plusieurs catégories de questions ont atteint 100% de précision, la plus difficile — 80%. Cadre : tous les chiffres sont l'auto-rapport d'Oscar dans une étude de cas OpenAI (une partie intéressée) ; « jusqu'à 90% » est un résultat de R&D, pas une production ; 4 000 tickets/mois était une attente au moment de la publication, pas un fait confirmé ; les décisions de paiement restent aux mains des humains — l'IA accélère la recherche et la préparation des informations. L'ambition de « réduire le coût de voir les médecins d'un facteur 10 en trois à cinq ans » est la déclaration de direction de Schlosser, pas un engagement assorti d'une métrique. À notre avis, le cas contient deux leçons systémiques au-delà de l'assurance. Premièrement : la séquence « BAA d'abord, modèles ensuite » est le bon ordre pour toute industrie réglementée ; Oscar a obtenu son avance non pas parce qu'elle avait accès à des modèles différents, mais parce qu'elle a été la première à construire la structure juridique dans laquelle ces modèles pouvaient légalement toucher des données réelles. Deuxièmement : l'écart entre 40% (production) et 90% (R&D) est le prix honnête du passage de la démo aux opérations, et les entreprises qui publient les deux chiffres avec des étiquettes explicites méritent plus de confiance que celles qui rapportent « 90% partout ». Une troisième observation, d'ingénierie : l'histoire de l'assistant de réclamations montre que le travail principal de l'intégration des LLM dans les systèmes hérités ne consiste pas à faire de la prompting mais à concevoir la représentation des données. GPT-4 a échoué jusqu'à ce que les traces soient repackagées dans une trace de squelette avec récupération itérative des détails — en effet, l'équipe a inventé pour sa tâche ce qui deviendrait plus tard le modèle agentic-RAG courant. Nous lirions cette étude de cas précisément comme un manuel sur « la préparation des données pour le modèle », pas comme une publicité pour une API particulière.

~40%
documentation clinique plus rapide (20+ min → <12 min)
50%
résolution des escalades de réclamations plus rapide
100% / 80%
précision de l'assistant par catégorie de question (simple / plus difficile)
№1
premier BAA d'assureur avec OpenAI
Sources
Vérifié: 2026-07-11

Contexte

Oscar Health est une entreprise américaine de technologie d'assurance maladie qui construit la couverture autour des données et de la technologie. Le cofondateur et CTO Mario Schlosser explique pourquoi les modèles de langage sont devenus le point d'inflexion de l'entreprise : « Les modèles de langage ont été la première fois que nous avons pensé, vous pouvez traduire le désordre du monde réel en un plan numérisé clair. » Pour un assureur, ce n'est pas une métaphore — l'ensemble de son activité se compose de texte non structuré : dossiers médicaux, contrats, journaux de traitement des réclamations et correspondance avec les médecins.

Deux décisions institutionnelles distinguent Oscar de la plupart des acteurs. Premièrement — la discipline de sélection des modèles : « Nous comparons tous les modèles majeurs régulièrement, avec des ensembles de données propriétaires pour les cas d'usage spécifiques à la santé », déclare Nikhita Luthra, directrice de produit senior et responsable de la R&D IA. « Les modèles OpenAI fonctionnent systématiquement le mieux. » Deuxièmement — la structure juridique : Oscar est devenue la première compagnie d'assurance à signer un accord de partenaire commercial (BAA) avec OpenAI — le contrat mandaté par HIPAA qui permet à un service tiers de traiter les informations de santé protégées. « OpenAI a été un excellent partenaire pour s'assurer que les données sont utilisées de manière vraiment responsable et conforme », note Luthra.

L'entreprise est inhabituellement ouverte pour son secteur : l'équipe d'ingénierie publie des analyses approfondies techniques de ses systèmes IA sur le blog Oscar Tech sur Medium (y compris un article détaillé sur l'architecture de l'assistant de réclamations, octobre 2023), et les résultats sur le blog d'entreprise. Cette étude de cas est assemblée à partir de trois sources primaires : l'étude de cas OpenAI (avril 2024), le document technique d'ingénierie et le blog d'entreprise — une opportunité rare dans l'IA en santé de vérifier les couches marketing et techniques d'une même histoire.

Problème

Les frais généraux administratifs sont l'un des principaux moteurs de coûts de la santé aux États-Unis. Documenter une seule conversation entre un patient et l'équipe médicale prend plus de 20 minutes à un humain ; à l'échelle d'un assureur, cela représente des milliers d'heures cliniques passées à taper du texte, et contribue directement à l'épuisement professionnel des infirmières et des médecins.

Comprendre l'« histoire de vie » d'une réclamation d'assurance est encore plus difficile. Des millions de variables contractuelles participent au traitement, et chaque réclamation laisse derrière elle une trace de réclamation — un journal détaillé de toutes les décisions que le système a prises au cours de son parcours. Quand un médecin pose des questions sur une réclamation (« pourquoi a-t-elle été rejetée ? », « pourquoi ce montant ? »), les équipes d'Oscar doivent parcourir ces journaux manuellement — un travail lent et coûteux nécessitant une expertise rare et simultanée en médecine, contrats et systèmes internes.

La troisième couche concerne les dossiers médicaux. Ils sont rédigés en langage naturel non structuré, et pour les patients atteints des conditions les plus complexes, ils atteignent 500 pages : trouver le fait pertinent est un problème de chercher une aiguille dans une meule de foin. C'est là que se cache le biais systémique dont parle Luthra : plus la personne est malade, plus son dossier est long et difficile à manier — et plus le système fonctionne mal précisément pour ceux qui ont le plus besoin d'aide.

Au-dessus de tout se trouve le cadre réglementaire : HIPAA. Toute solution qui envoie des données médicales à un modèle tiers est simplement illégale sans la construction de BAA — le premier filtre qui tue la plupart des « pilotes rapides » dans la santé aux États-Unis.

Solution

Sur l'API OpenAI, l'entreprise a automatisé trois boucles, chacune avec une source primaire derrière elle.

Boucle un — documentation clinique : brouillons de documentation de conversations de soins et d'examens de résultats de laboratoire. Le temps a diminué de près de 40% — selon le blog de l'entreprise, documenter une conversation s'inscrit maintenant en moins de 12 minutes par rapport à 20+ pour un humain ; les infirmières et cliniciens se tournent vers des tâches d'ordre supérieur.

Boucle deux — l'assistant de réclamations, dont l'histoire d'ingénierie est instructive (Oscar Tech, octobre 2023 ; auteurs Benjamin Baker, Evan Poe, Nazem Aldroubi). L'approche naïve — « alimenter GPT-4 avec l'ensemble de la trace de réclamation » — a atteint les limites du contexte ; l'élimination des données intermédiaires a aidé, mais le modèle s'est perdu dans les cas complexes. La solution de travail était la structure de la trace de squelette — une « table des matières » de la trace montrant uniquement la hiérarchie d'exécution du module sans valeurs : le modèle regarde le squelette, décide quel segment de trace demander, et creuse itérativement vers la réponse ; le système évalue la confiance du modèle et tire des données supplémentaires en cas de doute. Résultats par catégorie de tâche : de 100% de précision sur plusieurs classes de questions à 80% sur la plus difficile. En fonctionnement, l'assistant a réduit le temps de résolution des escalades de l'équipe des réclamations de 50%, avec une précision égale ou supérieure aux agents humains ; l'entreprise s'attendait à automatiser l'investigation d'au moins 4 000 tickets par mois (48 000 d'ici la fin de l'année).

Boucle trois — dossiers médicaux : trouver les informations pertinentes pour accélérer l'examen des réclamations, résumer les dossiers antérieurs pour préparer un fournisseur à une consultation, et extraire des données à travers de nombreux dossiers pour des questions comme « lequel de ces patients diabétiques serait un bon candidat pour la surveillance continue du glucose ».

Il y a aussi une quatrième boucle, culturelle — le « volant de connaissance » : Oscar publie délibérément ses découvertes en IA générative sur son blog et ses réseaux sociaux. La logique de Schlosser est pragmatique : « Les gens grapillent tous avec les mêmes problèmes en santé. Si nous résolvons d'abord un problème, nous devrions en parler à d'autres — ils nous diront ce qu'ils ont aussi résolu, et c'est une façon fantastique de faire tourner le volant. » Et l'ambition déclarée va bien au-delà de la routine administrative : « Nous ne voulons pas juste grignoter les bords de la simplification des cas d'usage administratifs. Au cours des trois à cinq prochaines années, nous devons réduire le coût de voir les médecins et d'être à l'hôpital d'un facteur 10. La seule façon de le faire est d'avoir un modèle au cœur des opérations — non seulement la transcription, mais l'intégration dans les interactions membres-fournisseurs. »

Sur le plan organisationnel, tout cela est géré par un Pod IA dédié — une équipe centrale mandatée pour guider les équipes de produit, de data science et d'exploitation dans l'application de l'IA. La philosophie part du problème commercial, pas de la technologie : « Les applications les plus réussies se produisent lorsque nous pouvons décomposer un problème très compliqué en tâches gérables », déclare Luthra, en ajoutant un détail d'équipe : cinq des six membres du Pod sont des femmes, toutes âgées de vingt et trente ans. Enfin, l'entreprise joue le jeu long avec le régulateur : en collaboration avec la Maison-Blanche, Oscar a dirigé une coalition de 37 des plus grands payeurs et fournisseurs de services de santé sur les principes de l'IA responsable en santé. « Le plus grand enseignement a été que les régulateurs en santé veulent que l'IA réussisse, et ils sont incroyablement enthousiastes. C'est à nous de maintenir le flux transparent d'informations au gouvernement », déclare Schlosser.

Résultat

Selon l'étude de cas OpenAI (avril 2024) : le temps consacré à la documentation des conversations de soins et à l'examen des résultats de laboratoire a diminué de près de 40% (selon le blog de l'entreprise — de 20+ minutes à moins de 12 par conversation) ; l'assistant de réclamations a réduit le temps de résolution des escalades de 50% avec une précision égale ou supérieure aux agents humains ; l'attente — automatiser l'investigation d'au moins 4 000 tickets par mois (48 000 d'ici la fin de l'année). Les expériences de R&D ont montré des gains de productivité allant jusqu'à 90% dans certains cas. Le document technique d'ingénierie ajoute la granularité que les cas de fournisseurs manquent généralement : dans les scénarios simples, la machine correspondait immédiatement aux humains, dans les cas complexes, elle était initialement en retard, et après l'introduction de la trace de squelette, plusieurs catégories de questions ont atteint 100% de précision, la plus difficile — 80%.

Cadre : tous les chiffres sont l'auto-rapport d'Oscar dans une étude de cas OpenAI (une partie intéressée) ; « jusqu'à 90% » est un résultat de R&D, pas une production ; 4 000 tickets/mois était une attente au moment de la publication, pas un fait confirmé ; les décisions de paiement restent aux mains des humains — l'IA accélère la recherche et la préparation des informations. L'ambition de « réduire le coût de voir les médecins d'un facteur 10 en trois à cinq ans » est la déclaration de direction de Schlosser, pas un engagement assorti d'une métrique.

À notre avis, le cas contient deux leçons systémiques au-delà de l'assurance. Premièrement : la séquence « BAA d'abord, modèles ensuite » est le bon ordre pour toute industrie réglementée ; Oscar a obtenu son avance non pas parce qu'elle avait accès à des modèles différents, mais parce qu'elle a été la première à construire la structure juridique dans laquelle ces modèles pouvaient légalement toucher des données réelles. Deuxièmement : l'écart entre 40% (production) et 90% (R&D) est le prix honnête du passage de la démo aux opérations, et les entreprises qui publient les deux chiffres avec des étiquettes explicites méritent plus de confiance que celles qui rapportent « 90% partout ».

Une troisième observation, d'ingénierie : l'histoire de l'assistant de réclamations montre que le travail principal de l'intégration des LLM dans les systèmes hérités ne consiste pas à faire de la prompting mais à concevoir la représentation des données. GPT-4 a échoué jusqu'à ce que les traces soient repackagées dans une trace de squelette avec récupération itérative des détails — en effet, l'équipe a inventé pour sa tâche ce qui deviendrait plus tard le modèle agentic-RAG courant. Nous lirions cette étude de cas précisément comme un manuel sur « la préparation des données pour le modèle », pas comme une publicité pour une API particulière.

Stack technique
OpenAI APIGPT-4BAA / HIPAA-контурClaim Trace + Skeleton Trace (итеративный запрос деталей)Внутренний AI PodБенчмаркинг моделей на проприетарных датасетах
Chronologie
Octobre 2023 — le document technique d'ingénierie de l'assistant de réclamations sur le blog Oscar Tech (évolution : approche naïve → trace de squelette → récupérations itératives ; 100%/80% de précision par catégorie) ; avant — le premier BAA d'assureur avec OpenAI ; 1er avril 2024 — l'étude de cas OpenAI avec les métriques de production (documentation −40%, escalades −50%, 4 000 tickets/mois prévus) ; en parallèle — la coalition de 37 payeurs-fournisseurs avec la Maison-Blanche sur les principes de l'IA responsable.

Leçons

  1. En santé, la structure juridique vient d'abord : le BAA avec OpenAI sépare un projet viable d'un risque inacceptable ; Oscar l'a fait avant tout autre assureur et a obtenu une avance.
  2. L'évaluation comparative régulière des modèles sur des ensembles de données propriétaires (« nous comparons tous les modèles majeurs sur les données propriétaires ») est le bon substitut au choix d'un modèle par le marketing.
  3. Séparez la R&D de la production dans les rapports : Oscar étiquette honnêtement 90% comme un plafond de recherche et ~40% comme le résultat de travail — une discipline rare et correcte.
  4. Le travail principal des LLM dans les systèmes hérités est la représentation des données, pas les prompts : GPT-4 a échoué sur les traces de réclamation complètes jusqu'à ce qu'elles soient repackagées dans une trace de squelette avec récupération itérative des détails.
  5. Un Pod IA centralisé chargé de guider d'autres équipes met à l'échelle l'expertise sans embaucher d'ingénieurs ML dans chaque département, et la décomposition de problèmes difficiles en « tâches gérables » est sa méthode fondamentale.
  6. Les plus grandes victoires se cachent dans les données les plus gênantes : les dossiers de 500 pages de patients complexes se transforment d'un obstacle en un avantage — y compris l'argument d'équité.
  7. L'auto-régulation publique (une coalition de 37 acteurs avec la Maison-Blanche) est un moyen de façonner les règles futures plutôt que de les attendre.

Questions fréquentes

Qu'est-ce qu'un BAA et pourquoi cela importe-t-il dans le cas d'Oscar ?

Un accord de partenaire commercial est requis en vertu de HIPAA pour qu'un service tiers traite les informations de santé protégées. Oscar a été la première compagnie d'assurance à signer un BAA avec OpenAI, ce qui rend légal l'utilisation des modèles sur des données réelles de santé — et de se lancer rapidement tandis que les concurrents négociaient encore le cadre juridique.

Combien l'IA a-t-elle accéléré les opérations d'Oscar Health ?

Selon l'étude de cas OpenAI : la documentation des conversations de soins et l'examen des résultats de laboratoire sont devenus près de 40% plus rapides (selon le blog de l'entreprise — moins de 12 minutes par rapport à 20+), et la résolution des escalades de réclamations 50% plus rapide avec une précision égale ou supérieure aux agents humains. En R&D, certaines tâches se sont accélérées de jusqu'à 90% — un plafond de recherche, pas une production.

Comment fonctionne techniquement l'assistant de réclamations ?

Chaque réclamation laisse une trace de réclamation — un journal de toutes les décisions du système. La trace complète dépasse le contexte du modèle, donc les ingénieurs d'Oscar ont conçu la trace de squelette — une « table des matières » de la hiérarchie des modules sans valeurs : GPT-4 inspecte le squelette, demande les segments dont il a besoin, et affine itérativement la réponse ; à faible confiance, le système tire des données supplémentaires. Le résultat — 100% de précision sur plusieurs catégories de questions et 80% sur la plus difficile (Oscar Tech).

L'IA chez Oscar décide-t-elle des paiements de réclamations ?

Les matériels publiés couvrent les tâches d'assistance : documentation, navigation dans les traces de réclamations, résumé des dossiers médicaux, réponse aux questions. Les décisions de paiement restent aux mains des humains ; l'IA réduit le temps consacré à la recherche et la préparation des informations.

Qu'est-ce que le Pod IA d'Oscar ?

Une équipe centrale mandatée pour guider les équipes de produit, de data science et d'exploitation dans l'application de l'IA à leurs cas d'usage. La méthode consiste à décomposer les problèmes difficiles en « tâches gérables » ; les valeurs d'embauche sont la détermination, l'humilité et la curiosité plutôt que les distinctions académiques. Cinq des six membres du Pod sont des femmes âgées de vingt et trente ans.

← Cas