⚖️
LegalTech · Harvey

Harvey: un modelo personalizado de jurisprudencia estadounidense que los abogados prefirieron sobre GPT-4 el 97% de las veces

Para probar el modelo, Harvey llevó abogados de 10 de los bufetes de abogados más grandes. Se les mostraron salidas lado a lado del modelo de jurisprudencia personalizado y GPT-4 para la misma pregunta. "El 97% del tiempo, los abogados prefirieron la salida del modelo de jurisprudencia", dice Weinberg. "Generalmente, era porque era una respuesta más larga y completa. Se adentró en los matices de lo que la pregunta estaba pidiendo y cubrió más jurisprudencia relevante". La fortaleza de la reacción, admite el equipo, los sorprendió. El segundo resultado concierne a las alucinaciones — en gran medida la razón por la que se construyó el modelo: "No solo el modelo de jurisprudencia no inventa casos, sino que cada oración está efectivamente respaldada por el caso que cita", afirma Weinberg. El encuadre es importante. El 97% es una métrica de preferencia, no una medida de precisión legal formal: muestra qué respuesta eligen los abogados, no cuántos errores contiene. Las pruebas fueron organizadas por Harvey mismo; el tamaño de muestra de preguntas no fue divulgado; ninguna replicación independiente ha sido publicada; y el caso de estudio fue publicado por OpenAI, una parte interesada cuyo producto respalda la solución. La afirmación de no-alucinaciones es igualmente una declaración del fundador, no el resultado de una auditoría independiente publicada. Análisis editorial. La evidencia indirecta de que la apuesta del modelo personalizado valió la pena al menos comercialmente es la trayectoria de Harvey después del caso de estudio: una Serie C de $100M con una valoración de $1.5B (julio de 2024), Serie D de $300M con $3B (febrero de 2025), Serie E de $300M con $5B (junio de 2025), Serie F de $160M con $8B (diciembre de 2025), y una ronda de $200M con una valoración de $11B en marzo de 2026; los ingresos de 2025 fueron de $190M (Wikipedia, basado en divulgaciones públicas). Los clientes incluyen firmas como Paul Weiss y A&O Shearman, donde 3,500 abogados ejecutaron aproximadamente 40,000 consultas durante un período de prueba; Ashurst lanzó Harvey globalmente, WongPartnership de Singapur se convirtió en la primera firma de Asia Sureste en probar el producto, y PwC lo adoptó para servicios legales en Singapur. Para ser justos: el crecimiento de la empresa no aísla la contribución del modelo personalizado — Harvey creció en toda su línea de productos, y una valoración de $11B no puede atribuirse a una decisión técnica. Una segunda observación: el caso capturó la "escalera de madurez" de trabajar con LLMs — prompting → RAG → ajuste fino → entrenamiento personalizado — que posteriormente se convirtió en sentido común de la industria. También muestra cuán rápido envejecen las líneas de base: "preferido sobre GPT-4 el 97% de las veces" sonaba fuerte en abril de 2024, pero una comparación contra un modelo hace mucho superado no dice nada en sí mismo sobre dónde se posiciona Harvey contra los modelos fronterizos actuales.

97%
preferencia del abogado vs GPT-4
10 млрд
tokens de datos añadidos al modelo
10x
crecimiento de ingresos en 2023
$715M
valoración de la Serie B ($80M recaudados)
Fuentes
Verificado: 2026-07-11

Contexto

Harvey es una plataforma de IA generativa para profesionales en derecho, impuestos y finanzas, fundada en el verano de 2022. Detrás hay dos personas con antecedentes raramente superpuestos: Winston Weinberg, abogado con experiencia en litigios de antimonopolio y valores, y Gabe Pereyra, investigador de IA que previamente trabajó en grandes modelos de lenguaje en Google Brain y Meta. Su hipótesis inicial era simple: los LLMs pueden sintetizar enormes volúmenes de información legal y presentarla a los abogados para revisión, en lugar de que los abogados pasen semanas clasificando documentos. La plataforma ayuda con tareas que requieren razonamiento complejo y conocimiento profundo del dominio: redacción de documentos, respuesta a preguntas sobre escenarios de litigios complejos e identificación de discrepancias materiales entre cientos de contratos.

Un prototipo inicial mostró el potencial antes de que el producto existiera. Weinberg y Pereyra extrajeron 100 preguntas de propietario/inquilino de r/legaladvice de Reddit, generaron respuestas con GPT-3 y las mostraron a abogados en ejercicio. Para 86 de 100 preguntas, los abogados dijeron que habrían enviado la respuesta al cliente sin ediciones. "Fue un momento de iluminación", recuerda Weinberg.

A partir de ahí, la empresa creció a un ritmo raro para LegalTech. Noviembre de 2022 trajo una ronda semilla de $5M liderada por el OpenAI Startup Fund; abril de 2023, una Serie A de $23M de Sequoia. Durante 2023, los ingresos crecieron más de 10 veces y el equipo superó 100 personas, y el 19 de diciembre de 2023, Harvey cerró una Serie B de $80M con una valoración de $715M (codirigida por Elad Gil y Kleiner Perkins, con participación del OpenAI Startup Fund y Sequoia), llevando la financiación total a más de $100M. Entre los objetivos declarados de la ronda, la empresa nombró explícitamente la expansión de su construcción de modelos personalizados, el escalamiento del equipo y la construcción del conjunto de características del producto. Para entonces, la base de clientes incluía firmas legales líderes, equipos internos, proveedores de servicios profesionales y firmas de capital privado.

Ese trabajo es el tema de este caso. Harvey, en asociación con OpenAI, construyó un modelo entrenado a medida para jurisprudencia estadounidense — en palabras de OpenAI, el primer modelo de jurisprudencia entrenado a medida. OpenAI publicó el caso de uso el 2 de abril de 2024, y sigue siendo una de las respuestas más citadas a la pregunta de cuándo una empresa debe ir más allá de RAG hacia el entrenamiento de modelos personalizados.

Problema

El trabajo legal sigue creciendo en volumen de datos. "Tanto el trabajo transaccional como el litigio se han vuelto cada vez más complejos — podría haber cientos de miles de contratos para revisar en una fusión internacional, y millones de correos electrónicos para revisar en litigios", explica Weinberg. Los abogados asociados pasan innumerables horas en tareas complejas pero esencialmente rutinarias, y el volumen solo aumenta. Con la IA sintetizando documentos, los abogados pueden pasar menos tiempo clasificando y redactando textos legales y más tiempo en decisiones y clientes.

Pero la investigación de jurisprudencia resultó ser su propia categoría. Harvey imaginó una experiencia donde un abogado pudiera pegar una pregunta de cliente en un modelo y obtener una respuesta exhaustiva citando todas sus fuentes. El equipo primero intentó las técnicas obvias — ajuste fino de modelos base a través de APIs públicas y generación aumentada por recuperación (RAG). Ambas alcanzaron los límites de un caso de uso únicamente complejo y abierto. "Si simplemente haces recuperación, puedes responder preguntas muy simples sobre áreas del derecho en las que realmente no eres experto, pero eso en realidad no es muy útil para la mayoría de los abogados", explicó Weinberg. "Con la investigación de jurisprudencia, estás buscando munición para tu argumento, y eso es mucho más difícil de hacer."

El diagnóstico del equipo: los modelos base son fuertes en razonamiento pero carecen del conocimiento requerido para el trabajo legal. El conocimiento no puede mezclarse mediante un recuperador cuando la tarea no es encontrar un hecho sino construir un argumento en todo el cuerpo de la ley. El ajuste fino a través de APIs públicas también quedó corto: para un caso de uso únicamente complejo y abierto, los levers de ajuste estándar no fueron suficientes. Un requisito separado era tolerancia cero para casos inventados: la reducción de alucinaciones fue una de las principales motivaciones de Harvey para construir un modelo personalizado, porque una respuesta sin fuentes verificables es inutilizable en el trabajo real de un abogado. Eso finalizó la declaración del problema: necesitaban una forma de inyectar tanto nuevo conocimiento como nuevas formas de razonar sobre ese conocimiento en el modelo mismo, más profundo que lo que permite la recuperación o el ajuste fino convencional.

Solución

Harvey decidió construir un modelo entrenado a medida junto con OpenAI, no ajuste fino a través de una API pública, sino trabajo de investigación conjunto que inyecta nuevo conocimiento y nuevas formas de razonar sobre ese conocimiento en un modelo base. "Esto era investigación de vanguardia. Necesitábamos un socio que estuviera dispuesto a invertir recursos para probar algo nuevo. Observamos todas las opciones, pero solo confiamos en construir un modelo entrenado a medida con OpenAI", dice Pereyra.

El proceso en sí fue enfáticamente iterativo y humano. "Ninguno de estos problemas tiene una solución clara", describe Pereyra. "Mucho de esto fue sentarse juntos, hacer que nuestros abogados explicaran cómo funciona la investigación de jurisprudencia, hacer que nuestros investigadores muestren lo que hemos hecho, y aprender de OpenAI sobre los levers que teníamos para abordar el problema." Ese detalle es raro en casos de estudio de proveedores: el modelo personalizado nació no de un conjunto de datos sino de traducir la experiencia de los abogados al lenguaje del entrenamiento de modelos.

El escalamiento procedió como una escalera. Primero, la jurisprudencia de un solo estado — Delaware: una jurisdicción compacta, pero desproporcionadamente importante para el derecho corporativo estadounidense. Luego, expansión a todo el cuerpo de jurisprudencia estadounidense. En total, el equivalente de 10 mil millones de tokens de datos fue añadido al modelo base. El orden de magnitud importa: esto no es "ajuste fino en algunos miles de ejemplos" sino incrustar un corpus completo de conocimiento profesional en el modelo. También vale la pena notar lo que el caso de estudio no contiene: OpenAI usa la redacción cuidadosa "el equivalente de 10 mil millones de tokens" y no divulga ni el modelo base ni la metodología de entrenamiento — qué levers se utilizaron finalmente, cuántas iteraciones tomó. Para cualquiera que espere replicar el enfoque, el caso público establece una dirección pero no proporciona una receta.

El requisito arquitectónico diseñado desde el principio fue la verificabilidad. El modelo fue construido de manera que cada oración de una respuesta descansa en un caso específico citado: el abogado obtiene no la "opinión" del modelo sino un argumento con referencias que pueden ser verificadas. Esto aborda directamente el mayor miedo de la profesión — precedentes fabricados en documentos presentados ante un tribunal.

El modelo personalizado es parte de una plataforma más amplia: Harvey aplica IA a la redacción de documentos, respuesta a preguntas sobre escenarios de litigios complejos e identificación de discrepancias materiales entre cientos de contratos. Las próximas direcciones nombradas en el caso de estudio: redacción de escritos y mociones en la parte superior del modelo de jurisprudencia, ayuda a los abogados a entender cómo varía la jurisprudencia entre jurisdicciones, y agentes — combinación de múltiples llamadas de modelo en una única salida de trabajo para reducir la ingeniería de prompts y la escritura que los usuarios necesitan hacer. El estado final que describe la empresa es Harvey como un miembro solidario del equipo de un bufete de abogados. "El volumen de trabajo legal está creciendo y los abogados asociados pasan innumerables horas en tareas complejas pero rutinarias", dice Weinberg. "La oportunidad que tenemos, no solo en derecho sino en todos los servicios profesionales, es cuidar las tareas rutinarias para que los profesionales puedan enfocarse su tiempo en interacciones con clientes."

Al preguntarle cómo construir productos de IA en medio de un flujo constante de nuevos modelos, Pereyra da consejos que desde entonces se han extendido por toda la industria: "No construyas para las capacidades actuales de los modelos hoy, construye para dónde van a estar los modelos. Aborda versiones más complejas de problemas para que cuando salgan versiones mejores de los modelos, no se resuelvan como efecto secundario."

Resultado

Para probar el modelo, Harvey llevó abogados de 10 de los bufetes de abogados más grandes. Se les mostraron salidas lado a lado del modelo de jurisprudencia personalizado y GPT-4 para la misma pregunta. "El 97% del tiempo, los abogados prefirieron la salida del modelo de jurisprudencia", dice Weinberg. "Generalmente, era porque era una respuesta más larga y completa. Se adentró en los matices de lo que la pregunta estaba pidiendo y cubrió más jurisprudencia relevante". La fortaleza de la reacción, admite el equipo, los sorprendió.

El segundo resultado concierne a las alucinaciones — en gran medida la razón por la que se construyó el modelo: "No solo el modelo de jurisprudencia no inventa casos, sino que cada oración está efectivamente respaldada por el caso que cita", afirma Weinberg.

El encuadre es importante. El 97% es una métrica de preferencia, no una medida de precisión legal formal: muestra qué respuesta eligen los abogados, no cuántos errores contiene. Las pruebas fueron organizadas por Harvey mismo; el tamaño de muestra de preguntas no fue divulgado; ninguna replicación independiente ha sido publicada; y el caso de estudio fue publicado por OpenAI, una parte interesada cuyo producto respalda la solución. La afirmación de no-alucinaciones es igualmente una declaración del fundador, no el resultado de una auditoría independiente publicada.

Análisis editorial. La evidencia indirecta de que la apuesta del modelo personalizado valió la pena al menos comercialmente es la trayectoria de Harvey después del caso de estudio: una Serie C de $100M con una valoración de $1.5B (julio de 2024), Serie D de $300M con $3B (febrero de 2025), Serie E de $300M con $5B (junio de 2025), Serie F de $160M con $8B (diciembre de 2025), y una ronda de $200M con una valoración de $11B en marzo de 2026; los ingresos de 2025 fueron de $190M (Wikipedia, basado en divulgaciones públicas). Los clientes incluyen firmas como Paul Weiss y A&O Shearman, donde 3,500 abogados ejecutaron aproximadamente 40,000 consultas durante un período de prueba; Ashurst lanzó Harvey globalmente, WongPartnership de Singapur se convirtió en la primera firma de Asia Sureste en probar el producto, y PwC lo adoptó para servicios legales en Singapur. Para ser justos: el crecimiento de la empresa no aísla la contribución del modelo personalizado — Harvey creció en toda su línea de productos, y una valoración de $11B no puede atribuirse a una decisión técnica.

Una segunda observación: el caso capturó la "escalera de madurez" de trabajar con LLMs — prompting → RAG → ajuste fino → entrenamiento personalizado — que posteriormente se convirtió en sentido común de la industria. También muestra cuán rápido envejecen las líneas de base: "preferido sobre GPT-4 el 97% de las veces" sonaba fuerte en abril de 2024, pero una comparación contra un modelo hace mucho superado no dice nada en sí mismo sobre dónde se posiciona Harvey contra los modelos fronterizos actuales.

Stack tecnológico
Кастомно обученная модель OpenAIGPT-4 (бейзлайн)Прецедентное право США (полный корпус)Цитирование источников в каждом предложении
Cronología
Verano de 2022 — Harvey fundada; noviembre de 2022 — semilla de $5M (OpenAI Startup Fund); prueba temprana con GPT-3 en 100 preguntas de r/legaladvice anterior al lanzamiento del producto; abril de 2023 — Serie A de $23M (Sequoia); 19 de diciembre de 2023 — Serie B de $80M con una valoración de $715M, con expansión de construcción de modelos personalizados entre los objetivos declarados; el modelo personalizado comenzó con Delaware, luego toda la jurisprudencia estadounidense; 2 de abril de 2024 — OpenAI publica el caso de estudio; posteriormente (según Wikipedia): Series C–F y una ronda de marzo de 2026 con una valoración de $11B.

Lecciones aprendidas

  1. RAG no es el techo: para tareas de experto abiertas (encontrar argumentos, no hechos) Harvey alcanzó los límites de la recuperación y pasó al entrenamiento personalizado, más costoso, pero un nivel de calidad diferente.
  2. Un 'momento de iluminación' es más barato que un piloto: la prueba en 100 preguntas reales de r/legaladvice (86 respuestas que los abogados enviarían sin ediciones) costó casi nada pero dio a los fundadores una prueba temprana de demanda antes de que el producto existiera.
  3. La preferencia del 97% es una métrica fuerte pero específica: mide qué respuesta eligen los abogados, no la corrección formal; al trasladar a tu dominio, planifica una verificación de precisión separada.
  4. La arquitectura anti-alucinación — 'cada oración respaldada por el caso que cita' — es una plantilla para cualquier dominio de tolerancia cero (medicina, cumplimiento, finanzas).
  5. Prueba con los usuarios más exigentes: comparaciones lado a lado con abogados de 10 firmas principales producen comentarios válidos y construyen la confianza de los clientes futuros al mismo tiempo.
  6. Comenzar con una jurisdicción estrecha (Delaware) y expandir a todo el país es la escalera de escalamiento correcta para modelos personalizados.
  7. El consejo de Pereyra — 'construye para dónde van a estar los modelos, no dónde están' — es una estrategia práctica contra la obsolescencia del producto con cada nuevo lanzamiento de modelo.

Preguntas frecuentes

¿Qué significa 'los abogados prefirieron el modelo el 97% de las veces'?

Harvey mostró a abogados de 10 de los bufetes más grandes salidas lado a lado del modelo personalizado y GPT-4 para la misma pregunta. Los abogados eligieron la respuesta del modelo personalizado el 97% de las veces, generalmente por integridad y cobertura de jurisprudencia. Es una métrica de preferencia, no una medida formal de precisión.

¿Inventa el modelo Harvey casos judiciales inexistentes?

Según el cofundador de Harvey en el caso de estudio de OpenAI, el modelo personalizado no inventa casos, y cada oración está respaldada por el caso que cita. La reducción de alucinaciones fue uno de los principales objetivos del entrenamiento personalizado.

¿Cómo difiere un modelo entrenado a medida de RAG?

RAG alimenta documentos recuperados en el contexto de un modelo estándar; el entrenamiento personalizado inyecta conocimiento y patrones de razonamiento en el modelo mismo. Harvey agregó el equivalente de 10 mil millones de tokens de datos de jurisprudencia estadounidense porque la recuperación pura demostró ser insuficiente para encontrar argumentos legales.

¿Quién fundó Harvey y cuándo?

La empresa fue fundada en el verano de 2022. Cofundadores: Winston Weinberg, abogado con experiencia en litigios de antimonopolio y valores (según Wikipedia, previamente en O'Melveny & Myers), y Gabe Pereyra, investigador de IA que, según el caso de estudio de OpenAI, trabajó previamente en LLMs en Google Brain y Meta.

¿Qué pasó con Harvey después del caso de estudio?

Según Wikipedia, la empresa continuó creciendo: Serie C de $100M a $1.5B (julio de 2024), Serie D de $300M a $3B (febrero de 2025), Serie E de $300M a $5B (junio de 2025), Serie F de $160M a $8B (diciembre de 2025), y una ronda de $200M a $11B en marzo de 2026; los ingresos de 2025 fueron de $190M.

← Casos