🏥
Seguros de Salud · Oscar Health

Oscar Health: documentación casi 40% más rápida, escalaciones de reclamaciones resueltas 50% más rápido, y el primer BAA con OpenAI

Según el estudio de caso de OpenAI (abril de 2024): el tiempo dedicado a documentar conversaciones de atención y revisar resultados de laboratorio cayó casi 40% (según el blog de la empresa — de 20+ minutos a menos de 12 por conversación); el asistente de reclamaciones redujo el tiempo de resolución de escaladas en 50% con precisión igual o superior a los agentes humanos; la expectativa — automatizar la investigación de al menos 4,000 tickets por mes (48,000 al final del año). Los experimentos de Investigación y Desarrollo mostraron ganancias de productividad de hasta 90% en algunos casos. La inmersión técnica de ingeniería agrega granularidad que normalmente faltan en casos de proveedores: en escenarios simples la máquina igualó a los humanos inmediatamente, en complejos inicialmente se rezagó, y después de que se introdujo Skeleton Trace varias categorías de preguntas alcanzaron 100% de precisión, la más difícil — 80%. Contexto: todas las cifras son auto-reporte de Oscar en un estudio de caso de OpenAI (una parte interesada); 'hasta 90%' es un resultado de Investigación y Desarrollo, no de producción; 4,000 tickets/mes fue una expectativa en el momento de la publicación, no un hecho confirmado; las decisiones de pago permanecen con humanos — la IA acelera encontrar y preparar información. La ambición de 'reducir el costo de consultar médicos por un factor de 10 en tres a cinco años' es la declaración de dirección de Schlosser, no un compromiso con una métrica. En nuestra opinión, el caso contiene dos lecciones sistémicas más allá de seguros. Primero: la secuencia 'BAA primero, modelos segundo' es el orden correcto para cualquier industria regulada; Oscar ganó su ventaja inicial no porque tuviera acceso a modelos diferentes, sino porque fue el primero en construir el constructo legal en el que esos modelos podían tocar legalmente datos reales. Segundo: la brecha entre 40% (producción) y 90% (Investigación y Desarrollo) es el precio honesto de pasar de demostración a operaciones, y las empresas que publican ambas cifras con etiquetas explícitas merecen más confianza que las que reportan '90% en todas partes'. Una tercera observación de ingeniería: el historial del asistente de reclamaciones muestra que el trabajo principal de poner LLM en sistemas heredados no es prompting sino diseño de representación de datos. GPT-4 falló hasta que los traces se reempaquetaron en un Skeleton Trace con recuperación iterativa de detalle — en efecto, el equipo inventó para su tarea lo que más tarde se convertiría en el patrón RAG agéntico común. Leeríamos este caso precisamente como un manual sobre 'preparar datos para el modelo', no como publicidad para una API particular.

~40%
documentación clínica más rápida (20+ min → <12 min)
50%
resolución de escaladas de reclamaciones más rápida
100% / 80%
precisión del asistente por categoría de preguntas (simple / más difícil)
№1
primer BAA de aseguradora con OpenAI
Fuentes
Verificado: 2026-07-11

Contexto

Oscar Health es una empresa estadounidense de tecnología de seguros de salud que construye cobertura alrededor de datos y tecnología. El cofundador y CTO Mario Schlosser explica por qué los modelos de lenguaje se convirtieron en el punto de inflexión de la empresa: 'Los modelos de lenguaje fueron la primera vez que pensamos, puedes traducir el desorden del mundo real en un plan claramente digitalizado.' Para una aseguradora, eso no es una metáfora — su negocio completo consiste en texto no estructurado: registros médicos, contratos, registros de procesamiento de reclamaciones y correspondencia con médicos.

Dos decisiones institucionales distinguen a Oscar de la mayoría de los actores. Primero — disciplina en selección de modelos: 'Evaluamos comparativamente todos los modelos principales de forma regular, con conjuntos de datos propios para casos de uso específicos de atención médica,' dice Nikhita Luthra, Gerente de Productos Senior y Líder de Investigación y Desarrollo de IA. 'Los modelos de OpenAI tienen un desempeño consistentemente superior.' Segundo — el constructo legal: Oscar se convirtió en la primera empresa de seguros en firmar un Acuerdo de Socio Comercial (BAA) con OpenAI — el contrato mandatado por HIPAA que permite que un servicio de terceros procese información protegida de salud. 'OpenAI ha sido un excelente socio para asegurar que los datos se usen de manera realmente responsable y conforme,' observa Luthra.

La empresa es inusualmente transparente para su industria: el equipo de ingeniería publica inmersiones técnicas profundas de sus sistemas de IA en el blog Oscar Tech en Medium (incluyendo un artículo detallado sobre la arquitectura del asistente de reclamaciones, octubre de 2023), y resultados en el blog corporativo. Este caso se ensambla a partir de tres fuentes primarias: el estudio de caso de OpenAI (abril de 2024), la inmersión técnica de ingeniería y el blog de la empresa — una oportunidad rara en IA de atención médica para verificar las capas de marketing y técnicas de una historia.

Problema

La sobrecarga administrativa es uno de los principales impulsores de costos en la atención médica estadounidense. Documentar una sola conversación entre un paciente y el equipo médico toma a un humano más de 20 minutos; a la escala de una aseguradora, eso son miles de horas clínicas gastadas escribiendo texto, y un contribuyente directo al agotamiento de enfermeras y médicos.

Comprender la 'historia de vida' de una reclamación de seguros es aún más difícil. Millones de variables contractuales participan en el procesamiento, y cada reclamación deja un Claim Trace — un registro detallado de todas las decisiones que el sistema tomó en su trayecto. Cuando un médico pregunta sobre una reclamación ('¿por qué fue denegada?', '¿por qué este monto?'), los equipos de Oscar deben examinar esos registros manualmente — trabajo lento y costoso que requiere pericia rara simultánea en medicina, contratos y sistemas internos.

La tercera capa son los registros médicos. Están escritos en lenguaje natural no estructurado, y para pacientes con las condiciones más complejas llegan a 500 páginas: encontrar el hecho relevante es un problema de aguja en un pajar. Aquí se esconde el sesgo sistémico del que habla Luthra: cuanto más enfermo es el paciente, más largo e incómodo es su registro — y peor sirve el sistema precisamente a quienes más ayuda necesitan.

Sobre todo esto se halla el marco regulatorio: HIPAA. Cualquier solución que envíe datos médicos a un modelo de terceros es simplemente ilegal sin el constructo BAA — el primer filtro que elimina la mayoría de los 'pilotos rápidos' en la atención médica estadounidense.

Solución

En la API OpenAI, la empresa automatizó tres bucles, cada uno con una fuente primaria detrás.

Bucle uno — documentación clínica: borradores de documentación de conversaciones de atención y revisiones de resultados de laboratorio. El tiempo cayó casi 40% — según el blog de la empresa, documentar una conversación ahora cabe en menos de 12 minutos versus 20+ para un humano; enfermeras y clínicos se desplazan hacia tareas de orden superior.

Bucle dos — el asistente de reclamaciones, cuyo historial de ingeniería es instructivo (Oscar Tech, octubre de 2023; autores Benjamin Baker, Evan Poe, Nazem Aldroubi). El enfoque ingenuo — 'alimentar a GPT-4 con el Claim Trace completo' — superó los límites de contexto; eliminar datos intermedios ayudó, pero el modelo se perdió en casos complejos. La solución que funcionó fue la estructura Skeleton Trace — una 'tabla de contenidos' del trace que muestra solo la jerarquía de ejecución de módulos sin valores: el modelo examina el esqueleto, decide qué segmento de trace solicitar, e itera refinando la respuesta; el sistema evalúa la confianza del modelo y extrae datos adicionales cuando duda. Resultados por categoría de tarea: desde 100% de precisión en varias clases de preguntas hasta 80% en la más difícil. En operación, el asistente redujo el tiempo de resolución de escaladas del equipo de reclamaciones en 50%, con precisión igual o superior a los agentes humanos; la empresa esperaba automatizar la investigación de al menos 4,000 tickets por mes (48,000 al final del año).

Bucle tres — registros médicos: encontrar información relevante para acelerar la revisión de reclamaciones, resumir registros previos para preparar a un proveedor para una consulta, y extraer datos entre múltiples registros para preguntas como '¿cuál de estos pacientes diabéticos sería candidato ideal para monitoreo continuo de glucosa'.

También existe un cuarto bucle, cultural — la 'rueda volante de conocimiento': Oscar deliberadamente publica sus hallazgos de IA generativa en su blog y redes sociales. La lógica de Schlosser es pragmática: 'Todos están enfrentando los mismos problemas en atención médica. Si resolvemos un problema primero, debemos contárselo a otros — ellos nos contarán lo que resolvieron también, y esa es una forma fantástica de hacer girar la rueda volante.' Y la ambición declarada va mucho más allá de la rutina administrativa: 'No queremos solo mordisquear los bordes de la simplificación de casos de uso administrativo. En los próximos tres a cinco años, necesitamos reducir el costo de consultar médicos y estar en el hospital por un factor de 10. La única forma de hacerlo es tener un modelo en el centro — no solo escribiendo, sino integrándose en interacciones entre miembros y proveedores.'

Organizacionalmente, todo esto es dirigido por un Pod de IA dedicado — un equipo central mandatado para guiar a equipos de producto, ciencia de datos y operaciones en la aplicación de IA. La filosofía comienza desde el problema empresarial, no desde la tecnología: 'Las aplicaciones más exitosas ocurren cuando somos capaces de descomponer un problema muy complicado en tareas manejables,' dice Luthra, añadiendo un detalle del equipo: cinco de los seis miembros del Pod son mujeres, todas en sus veinte y treinta. Finalmente, la empresa juega el juego largo con el regulador: junto con la Casa Blanca, Oscar encabezó una coalición de 37 de los mayores pagadores y proveedores de atención médica en principios para IA responsable en atención médica. 'El mayor aprendizaje ha sido que los reguladores en atención médica quieren que la IA tenga éxito, y están increíblemente entusiasmados. Nos corresponde mantener el flujo transparente de información al gobierno,' dice Schlosser.

Resultado

Según el estudio de caso de OpenAI (abril de 2024): el tiempo dedicado a documentar conversaciones de atención y revisar resultados de laboratorio cayó casi 40% (según el blog de la empresa — de 20+ minutos a menos de 12 por conversación); el asistente de reclamaciones redujo el tiempo de resolución de escaladas en 50% con precisión igual o superior a los agentes humanos; la expectativa — automatizar la investigación de al menos 4,000 tickets por mes (48,000 al final del año). Los experimentos de Investigación y Desarrollo mostraron ganancias de productividad de hasta 90% en algunos casos. La inmersión técnica de ingeniería agrega granularidad que normalmente faltan en casos de proveedores: en escenarios simples la máquina igualó a los humanos inmediatamente, en complejos inicialmente se rezagó, y después de que se introdujo Skeleton Trace varias categorías de preguntas alcanzaron 100% de precisión, la más difícil — 80%.

Contexto: todas las cifras son auto-reporte de Oscar en un estudio de caso de OpenAI (una parte interesada); 'hasta 90%' es un resultado de Investigación y Desarrollo, no de producción; 4,000 tickets/mes fue una expectativa en el momento de la publicación, no un hecho confirmado; las decisiones de pago permanecen con humanos — la IA acelera encontrar y preparar información. La ambición de 'reducir el costo de consultar médicos por un factor de 10 en tres a cinco años' es la declaración de dirección de Schlosser, no un compromiso con una métrica.

En nuestra opinión, el caso contiene dos lecciones sistémicas más allá de seguros. Primero: la secuencia 'BAA primero, modelos segundo' es el orden correcto para cualquier industria regulada; Oscar ganó su ventaja inicial no porque tuviera acceso a modelos diferentes, sino porque fue el primero en construir el constructo legal en el que esos modelos podían tocar legalmente datos reales. Segundo: la brecha entre 40% (producción) y 90% (Investigación y Desarrollo) es el precio honesto de pasar de demostración a operaciones, y las empresas que publican ambas cifras con etiquetas explícitas merecen más confianza que las que reportan '90% en todas partes'.

Una tercera observación de ingeniería: el historial del asistente de reclamaciones muestra que el trabajo principal de poner LLM en sistemas heredados no es prompting sino diseño de representación de datos. GPT-4 falló hasta que los traces se reempaquetaron en un Skeleton Trace con recuperación iterativa de detalle — en efecto, el equipo inventó para su tarea lo que más tarde se convertiría en el patrón RAG agéntico común. Leeríamos este caso precisamente como un manual sobre 'preparar datos para el modelo', no como publicidad para una API particular.

Stack tecnológico
OpenAI APIGPT-4BAA / HIPAA-контурClaim Trace + Skeleton Trace (итеративный запрос деталей)Внутренний AI PodБенчмаркинг моделей на проприетарных датасетах
Cronología
Octubre de 2023 — la inmersión técnica de ingeniería del asistente de reclamaciones en el blog Oscar Tech (evolución: enfoque ingenuo → Skeleton Trace → recuperaciones iterativas; 100%/80% de precisión por categoría); anteriormente — el primer BAA de aseguradora con OpenAI; 1 de abril de 2024 — el estudio de caso de OpenAI con métricas de producción (documentación −40%, escaladas −50%, 4,000 tickets/mes planeados); en paralelo — la coalición de 37 miembros de pagadores-proveedores con la Casa Blanca sobre principios de IA responsable.

Lecciones aprendidas

  1. En atención médica el constructo legal viene primero: el BAA con OpenAI separa un proyecto viable del riesgo inaceptable; Oscar lo hizo antes que cualquier otra aseguradora y ganó una ventaja inicial.
  2. Evaluar comparativamente modelos regularmente en conjuntos de datos propios ('evaluamos todos los modelos principales en datos propios') es el sustituto correcto para elegir un modelo por marketing.
  3. Separar Investigación y Desarrollo de producción en los reportes: Oscar honestamente etiqueta 90% como un techo de investigación y ~40% como el resultado funcional — una disciplina rara y correcta.
  4. El trabajo principal de LLM en sistemas heredados es representación de datos, no prompting: GPT-4 falló en traces de reclamaciones completos hasta que se reempaquetaron en un Skeleton Trace con recuperación iterativa de detalle.
  5. Un Pod de IA centralizado mandatado para guiar otros equipos escala experiencia sin contratar ingenieros de ML en cada departamento, y descomponer problemas difíciles en 'tareas manejables' es su método central.
  6. Las mayores ganancias se esconden en los datos más incómodos: registros de 500 páginas de pacientes complejos se transforman de una barrera en una ventaja — incluyendo el argumento de equidad.
  7. La auto-regulación pública (una coalición de 37 jugadores con la Casa Blanca) es una forma de dar forma a futuras reglas en lugar de esperarlas.

Preguntas frecuentes

¿Qué es un BAA y por qué importa en el caso de Oscar?

Un Acuerdo de Socio Comercial es requerido bajo HIPAA para que un servicio de terceros procese información protegida de salud. Oscar fue la primera empresa de seguros en firmar un BAA con OpenAI, legalizando el uso de los modelos en datos de atención médica reales — y permitiendo lanzamiento rápido mientras los competidores aún negociaban el marco legal.

¿Cuánto aceleró la IA las operaciones de Oscar Health?

Según el estudio de caso de OpenAI: documentar conversaciones de atención y revisar resultados de laboratorio se volvió casi 40% más rápido (según el blog de la empresa — menos de 12 minutos versus 20+), y la resolución de escaladas de reclamaciones 50% más rápido con precisión igual o superior a los agentes humanos. En Investigación y Desarrollo algunas tareas se aceleraron hasta 90% — un techo de investigación, no de producción.

¿Cómo funciona técnicamente el asistente de reclamaciones?

Cada reclamación deja un Claim Trace — un registro de todas las decisiones del sistema. El trace completo excede el contexto del modelo, así que los ingenieros de Oscar idearon la estructura Skeleton Trace — una 'tabla de contenidos' de la jerarquía de módulos sin valores: GPT-4 examina el esqueleto, solicita los segmentos que necesita, e itera refinando la respuesta; con baja confianza el sistema extrae datos adicionales. El resultado — 100% de precisión en varias categorías de preguntas y 80% en la más difícil (Oscar Tech).

¿La IA de Oscar decide sobre los pagos de reclamaciones?

Los materiales publicados cubren tareas de asistencia: documentación, navegación de traces de reclamaciones, resumen de registros médicos, respuesta a preguntas. Las decisiones de pago permanecen con humanos; la IA acelera encontrar y preparar información.

¿Qué es el Pod de IA de Oscar?

Un equipo central mandatado para guiar a equipos de producto, ciencia de datos y operaciones en la aplicación de IA a sus casos de uso. El método es descomponer problemas difíciles en 'tareas manejables'; los valores de contratación son determinación, humildad y curiosidad por encima de acreditaciones académicas. Cinco de los seis miembros del Pod son mujeres en sus veinte y treinta.

← Casos