هارفي: نموذج قانون الحالات الأمريكي المخصص الذي فضله المحامون على GPT-4 بنسبة 97%
لاختبار النموذج، أحضرت هارفي محامين من 10 من أكبر شركات المحاماة. تم عرض عليهم المخرجات جنباً إلى جنب لنموذج قانون الحالات المخصص و GPT-4 للسؤال نفسه. "في 97% من الوقت، فضل المحامون المخرجات من نموذج قانون الحالات،" يقول Weinberg. "عادة، كان السبب أنها كانت إجابة أطول وأكثر اكتمالاً. دخلت في تفاصيل ما كان السؤال يطلبه وغطت قانون حالات أكثر صلة." قوة رد الفعل، كما يعترف الفريق، فاجأتهم. تتعلق النتيجة الثانية بالهلوسة — وهي في الأساس السبب الذي بني النموذج من أجله: "لا يختلق نموذج قانون الحالات الحالات فحسب، بل يدعم كل جملة بالحالة التي يستشهد بها،" يصرح Weinberg. الصياغة التي تهم. نسبة 97% هي مقياس تفضيل، وليس مقياس الدقة القانونية الرسمية: فهي تظهر أي إجابة يختار المحامون، وليس عدد الأخطاء التي تحتويها. تم تنظيم الاختبار من قبل هارفي نفسها؛ لم يتم الكشف عن حجم عينة الأسئلة؛ لم يتم نشر أي تكرار مستقل؛ وتم نشر دراسة الحالة بواسطة OpenAI — طرف معني منتجه يدعم الحل. ادعاء عدم الهلوسة هو أيضاً بيان من المؤسس، وليس نتيجة تدقيق مستقل منشور. التحليل التحريري. الدليل غير المباشر على أن الرهان على النموذج المخصص نجح على الأقل تجارياً هو مسار هارفي بعد دراسة الحالة: جولة Series C بقيمة $100M بتقييم $1.5B (يوليو 2024)، و $300M Series D بتقييم $3B (فبراير 2025)، و $300M Series E بتقييم $5B (يونيو 2025)، و $160M Series F بتقييم $8B (ديسمبر 2025)، وجولة $200M بتقييم $11B في مارس 2026؛ كان إيراد 2025 هو $190M (ويكيبيديا، بناءً على الإفصاحات العامة). تشمل العملاء شركات مثل Paul Weiss و A&O Shearman، حيث قام 3,500 محام بتشغيل حوالي 40,000 استعلام خلال فترة التجربة؛ طرحت Ashurst هارفي عالمياً، وأصبحت WongPartnership في سنغافورة أول شركة محاماة في جنوب شرق آسيا لاختبار المنتج، واعتمدت PwC للخدمات القانونية في سنغافورة. للعدالة: لا تعزل نمو الشركة مساهمة النموذج المخصص — نمت هارفي عبر خط منتجاتها بالكامل، ولا يمكن أن ينسب تقييم $11B إلى قرار تقني واحد. ملاحظة ثانية: التقطت الحالة "سلم النضج" للعمل مع LLMs — المطالبة → RAG → الضبط الدقيق → التدريب المخصص — والذي أصبح لاحقاً حساً مشتركاً في الصناعة. كما يظهر كم بسرعة تصبح الخطوط الأساسية قديمة: "مفضل على GPT-4 بنسبة 97% من الوقت" بدا قوياً في أبريل 2024، لكن المقارنة مع نموذج تم تجاوزه لفترة طويلة لا تقول شيئاً بحد ذاته حول مكان وقوف هارفي أمام نماذج الحدود الحالية.
- Harvey partners with OpenAI to build a custom-trained model for legal professionals — OpenAI (customer story), 2024-04-02
- Harvey raises $80M Series B from Elad Gil, Kleiner Perkins, OpenAI and Sequoia — Harvey (blog), 2023-12-19
- Harvey (software) — Wikipedia (история финансирования и клиентов), 2026
السياق
هارفي هو منصة ذكاء اصطناعي توليدي للمتخصصين في القانون والضرائب والتمويل، تأسست في صيف عام 2022. يقف وراءها شخصان بخلفيات نادراً ما تتقاطع: Winston Weinberg، محام متخصص في قضايا مكافحة الاحتكار والمنازعات الأوراق المالية، و Gabe Pereyra، باحث في الذكاء الاصطناعي عمل سابقاً على نماذج اللغات الكبيرة في Google Brain و Meta. كانت فرضيتهما الأولية بسيطة: يمكن لـ LLMs أن تجمع كميات ضخمة من المعلومات القانونية وتقدمها للمحامين للمراجعة — بدلاً من قضاء المحامين أسابيع في تمحيص الوثائق بأنفسهم. تساعد المنصة في المهام التي تتطلب تفكيراً معقداً ومعرفة عميقة بالمجال: صياغة الوثائق، والإجابة على أسئلة حول سيناريوهات تقاضي معقدة، وتحديد التناقضات الجوهرية بين مئات العقود.
أظهر نموذج أولي مبكر الإمكانات قبل وجود المنتج حتى. قام Weinberg و Pereyra بسحب 100 سؤال من أسئلة المالك/المستأجر من r/legaladvice في Reddit، وأنشأوا إجابات باستخدام GPT-3، وعرضوها على محامين يمارسون المهنة. في 86 من أصل 100 سؤال، قال المحامون إنهم كانوا سيرسلون الإجابة للعميل دون تعديل. "كانت لحظة استنارة،" يتذكر Weinberg.
من هناك نمت الشركة بوتيرة نادرة في قطاع LegalTech. أحضر نوفمبر 2022 جولة استثمارية أولية بقيمة $5M بقيادة صندوق OpenAI Startup؛ وفي أبريل 2023، جولة Series A بقيمة $23M من Sequoia. على مدار عام 2023، نما الإيراد أكثر من 10 مرات وتجاوز الفريق 100 شخص، وفي 19 ديسمبر 2023، أغلقت هارفي جولة Series B بقيمة $80M بتقييم $715M (بقيادة مشتركة من Elad Gil و Kleiner Perkins، مع مشاركة من صندوق OpenAI Startup و Sequoia)، مما رفع إجمالي التمويل إلى أكثر من $100M. من بين الأهداف المعلنة للجولة، ذكرت الشركة صراحة توسيع بناء نموذجها المخصص، وتوسيع نطاق الفريق، وبناء مجموعة ميزات المنتج. بحلول ذلك الوقت، كانت قاعدة العملاء تشمل شركات محاماة رائدة، وفرق داخلية، ومقدمي خدمات مهنية، وشركات الأسهم الخاصة.
هذا العمل هو موضوع هذه الحالة. بناءً على شراكة مع OpenAI، بنت هارفي نموذجاً مدرباً مخصصاً لقانون الحالات الأمريكي — حسب تعبير OpenAI، أول نموذج قانون حالات مدرب مخصص. نشرت OpenAI دراسة الحالة في 2 أبريل 2024، وتبقى إحدى الإجابات الأكثر استشهاداً على سؤال متى يجب على شركة تجاوز RAG إلى التدريب النموذجي المخصص.
المشكلة
يستمر العمل القانوني في النمو من حيث حجم البيانات. "أصبح كل من العمل المعاملات والتقاضي أكثر تعقيداً بشكل متزايد — قد يكون هناك مئات الآلاف من العقود للمراجعة في عملية اندماج دولية، وملايين رسائل البريد الإلكتروني للمراجعة في التقاضي،" يشرح Weinberg. يقضي المتدربون ساعات لا تحصى على مهام معقدة لكنها روتينية بشكل أساسي، والحجم يزداد فقط. مع قيام الذكاء الاصطناعي بتجميع الوثائق، يمكن للمحامين قضاء وقت أقل في تمحيص وصياغة النصوص القانونية — ووقت أكثر على القرارات والعملاء.
لكن بحث قانون الحالات اتضح أنه فئته الخاصة. تصورت هارفي تجربة حيث يمكن لمحام أن يلصق سؤال العميل في نموذج ويحصل على إجابة شاملة تستشهد بجميع مصادره. حاول الفريق أولاً التقنيات الواضحة — الضبط الدقيق للنماذج الأساسية عبر واجهات برمجة التطبيقات العامة والجيل المعزز باسترجاع البيانات (RAG). اصطدمت كلاهما بحدود حالة استخدام معقدة وفتوحة بشكل فريد. "إذا قمت باسترجاع البيانات فقط، يمكنك الإجابة على أسئلة بسيطة جداً حول مجالات قانونية لا تكون خبيراً فيها حقاً، لكن هذا في الواقع ليس مفيداً جداً لمعظم المحامين،" شرح Weinberg. "مع بحث قانون الحالات، تبحث عن أدلة لحجتك، وهذا أصعب بكثير."
تشخيص الفريق: النماذج الأساسية قوية في التفكير لكنها تفتقر إلى المعرفة المطلوبة للعمل القانوني. لا يمكن مزج المعرفة من قبل أداة استرجاع عندما تكون المهمة ليست العثور على حقيقة بل بناء حجة عبر كامل نطاق القانون. الضبط الدقيق عبر واجهات برمجة التطبيقات العامة كان ناقصاً أيضاً: بالنسبة لحالة استخدام معقدة وفتوحة بشكل فريد، لم تكن أدوات الضبط المعيارية كافية. كان هناك متطلب منفصل وهو عدم تحمل الحالات المختلقة: كان تقليل الهلوسة أحد الدوافع الرئيسية لهارفي لبناء نموذج مخصص، لأن الإجابة بدون مصادر قابلة للتحقق غير قابلة للاستخدام في العمل الفعلي للمحام. هذا أضفى الصيغة النهائية على بيان المشكلة: كانوا يحتاجون إلى طريقة لحقن كل من المعرفة الجديدة وطرق جديدة للتفكير حول تلك المعرفة في النموذج نفسه — أعمق مما يسمح به إما الاسترجاع أو الضبط الدقيق التقليدي.
الحل
قررت هارفي بناء نموذج مدرب مخصص مع OpenAI — ليس الضبط الدقيق عبر واجهة برمجة تطبيقات عامة، بل عمل بحثي مشترك يحقن معرفة جديدة، وطرق جديدة للتفكير حول تلك المعرفة، في نموذج أساسي. "كان هذا بحثاً متقدماً. احتجنا إلى شريك كان على استعداد لاستثمار الموارد لتجربة شيء جديد. نظرنا في جميع الخيارات، لكننا ثقنا فقط ببناء نموذج مدرب مخصص مع OpenAI،" يقول Pereyra.
كانت العملية نفسها تكرارية وإنسانية بشكل واضح. "لا توجد حل واضح لأي من هذه المشاكل،" يصف Pereyra. "الكثير منها كان الجلوس معاً، وحصول محامينا على شرح كيفية عمل بحث قانون الحالات، وحصول باحثينا على إظهار ما فعلناه، والتعلم من OpenAI حول الأدوات التي كان لدينا للاقتراب من المشكلة." هذه التفاصيل نادرة في دراسات حالة البائع: ولد النموذج المخصص ليس من مجموعة بيانات بل من ترجمة خبرة المحامين إلى لغة تدريب النموذج.
تقدم التوسع كسلم. أولاً، قانون الحالات لولاية واحدة — ديلاوير: ولاية قضائية مدمجة، لكنها مهمة بشكل غير متناسب لقانون الشركات الأمريكي. ثم، التوسع إلى مجمل قانون الحالات الأمريكي. في المجموع، تم إضافة ما يعادل 10 مليارات رمز من البيانات إلى النموذج الأساسي. يأتي ترتيب الحجم: هذا ليس "الضبط الدقيق على بضعة آلاف من الأمثلة" بل تضمين مجمل الجسم المهني للمعرفة في النموذج. من الجدير بالملاحظة أيضاً ما لا تحتويه دراسة الحالة: تستخدم OpenAI الصيغة الدقيقة "ما يعادل 10 مليارات رمز" ولا تكشف عن النموذج الأساسي ولا منهجية التدريب — أي الأدوات تم استخدامها في النهاية، كم عدد التكرارات التي استغرقتها. لأي شخص يأمل في تكرار النهج، تضع الحالة العامة اتجاهاً لكنها لا توفر وصفة.
كان المتطلب المعماري المصمم منذ البداية قابلية التحقق. تم بناء النموذج بحيث تستند كل جملة من الإجابة على حالة محددة مستشهد بها: لا يحصل المحام على "رأي" النموذج بل حجة مع مراجع يمكن التحقق منها. يعالج هذا مباشرة أكبر خوف من المهنة — الأسبقيات المختلقة في الوثائق المقدمة إلى المحكمة.
النموذج المخصص هو جزء من منصة أوسع: تطبق هارفي الذكاء الاصطناعي على صياغة الوثائق، والإجابة على أسئلة حول سيناريوهات تقاضي معقدة، وتحديد التناقضات الجوهرية بين مئات العقود. الاتجاهات القادمة المذكورة في دراسة الحالة: صياغة الملخصات والالتماسات على أساس نموذج قانون الحالات، ومساعدة المحامين على فهم كيفية اختلاف قانون الحالات عبر الولايات القضائية، والعملاء — دمج استدعاءات نموذج متعددة في مخرجات عمل واحدة لتقليل هندسة المطالبات والكتابة التي يحتاج المستخدمون للقيام بها. حالة النهاية التي تصفها الشركة هي هارفي كعضو داعم في فريق شركة محاماة. "يتزايد حجم العمل القانوني ويقضي المتدربون ساعات لا تحصى على مهام معقدة، لكن روتينية،" يقول Weinberg. "الفرصة التي لدينا، ليس فقط في القانون بل في جميع الخدمات المهنية، هي الاعتناء بالمهام الروتينية حتى يتمكن المتخصصون من تركيز وقتهم على التفاعل مع العملاء."
عندما سُئل عن كيفية بناء منتجات الذكاء الاصطناعي في منتصف سيل مستمر من النماذج الجديدة، قدم Pereyra نصيحة انتشرت منذ ذلك الحين عبر الصناعة: "لا تبني لقدرات النماذج الحالية اليوم — ابني لحيث ستكون النماذج. تعامل مع نسخ أكثر تعقيداً من المشاكل بحيث عندما تظهر نسخ أفضل من النماذج، لا تكون محلولة كأثر جانبي."
النتيجة
لاختبار النموذج، أحضرت هارفي محامين من 10 من أكبر شركات المحاماة. تم عرض عليهم المخرجات جنباً إلى جنب لنموذج قانون الحالات المخصص و GPT-4 للسؤال نفسه. "في 97% من الوقت، فضل المحامون المخرجات من نموذج قانون الحالات،" يقول Weinberg. "عادة، كان السبب أنها كانت إجابة أطول وأكثر اكتمالاً. دخلت في تفاصيل ما كان السؤال يطلبه وغطت قانون حالات أكثر صلة." قوة رد الفعل، كما يعترف الفريق، فاجأتهم.
تتعلق النتيجة الثانية بالهلوسة — وهي في الأساس السبب الذي بني النموذج من أجله: "لا يختلق نموذج قانون الحالات الحالات فحسب، بل يدعم كل جملة بالحالة التي يستشهد بها،" يصرح Weinberg.
الصياغة التي تهم. نسبة 97% هي مقياس تفضيل، وليس مقياس الدقة القانونية الرسمية: فهي تظهر أي إجابة يختار المحامون، وليس عدد الأخطاء التي تحتويها. تم تنظيم الاختبار من قبل هارفي نفسها؛ لم يتم الكشف عن حجم عينة الأسئلة؛ لم يتم نشر أي تكرار مستقل؛ وتم نشر دراسة الحالة بواسطة OpenAI — طرف معني منتجه يدعم الحل. ادعاء عدم الهلوسة هو أيضاً بيان من المؤسس، وليس نتيجة تدقيق مستقل منشور.
التحليل التحريري. الدليل غير المباشر على أن الرهان على النموذج المخصص نجح على الأقل تجارياً هو مسار هارفي بعد دراسة الحالة: جولة Series C بقيمة $100M بتقييم $1.5B (يوليو 2024)، و $300M Series D بتقييم $3B (فبراير 2025)، و $300M Series E بتقييم $5B (يونيو 2025)، و $160M Series F بتقييم $8B (ديسمبر 2025)، وجولة $200M بتقييم $11B في مارس 2026؛ كان إيراد 2025 هو $190M (ويكيبيديا، بناءً على الإفصاحات العامة). تشمل العملاء شركات مثل Paul Weiss و A&O Shearman، حيث قام 3,500 محام بتشغيل حوالي 40,000 استعلام خلال فترة التجربة؛ طرحت Ashurst هارفي عالمياً، وأصبحت WongPartnership في سنغافورة أول شركة محاماة في جنوب شرق آسيا لاختبار المنتج، واعتمدت PwC للخدمات القانونية في سنغافورة. للعدالة: لا تعزل نمو الشركة مساهمة النموذج المخصص — نمت هارفي عبر خط منتجاتها بالكامل، ولا يمكن أن ينسب تقييم $11B إلى قرار تقني واحد.
ملاحظة ثانية: التقطت الحالة "سلم النضج" للعمل مع LLMs — المطالبة → RAG → الضبط الدقيق → التدريب المخصص — والذي أصبح لاحقاً حساً مشتركاً في الصناعة. كما يظهر كم بسرعة تصبح الخطوط الأساسية قديمة: "مفضل على GPT-4 بنسبة 97% من الوقت" بدا قوياً في أبريل 2024، لكن المقارنة مع نموذج تم تجاوزه لفترة طويلة لا تقول شيئاً بحد ذاته حول مكان وقوف هارفي أمام نماذج الحدود الحالية.
الدروس المستفادة
- RAG ليست السقف: بالنسبة للمهام الخبيرة المفتوحة النهاية (إيجاد الحجج، وليس الحقائق) اصطدمت هارفي بحدود الاسترجاع والتحولت إلى التدريب المخصص — أكثر تكلفة، لكن مستوى جودة مختلف.
- لحظة الاستنارة أرخص من التجربة الأولية: الاختبار على 100 سؤال حقيقي من r/legaladvice (86 إجابة كان المحامون سيرسلونها بدون تعديل) لم تكلف تقريباً شيئاً لكنها أعطت المؤسسين إثباتاً مبكراً للطلب قبل وجود المنتج.
- نسبة 97% التفضيل هي مقياس قوي لكن محدد: فهي تقيس أي إجابة يختار المحامون، وليس الصحة الرسمية؛ عند نقل إلى مجالك، خطط فحصاً منفصلاً للدقة.
- المعمارية المضادة للهلوسة — 'كل جملة مدعومة بالحالة التي تستشهد بها' — هي نموذج لأي مجال لا يتحمل الأخطاء (الطب، الامتثال، التمويل).
- اختبر مع المستخدمين الأكثر تطلباً: المقارنات جنباً إلى جنب مع محامين من 10 شركات رائدة تعطي ردود فعل صحيحة وتبني ثقة العملاء المستقبليين في نفس الوقت.
- البدء بولاية قضائية ضيقة (ديلاوير) والتوسع إلى البلد بأكمله هو سلم التوسع الصحيح للنماذج المخصصة.
- نصيحة Pereyra — 'ابني لحيث ستكون النماذج، وليس حيث هي' — هي استراتيجية عملية ضد عدم استخدام المنتج مع كل إطلاق نموذج جديد.
الأسئلة الشائعة
ماذا تعني عبارة 'فضل المحامون النموذج 97% من الوقت'؟
عرضت هارفي على محامين من 10 من أكبر شركات المحاماة المخرجات جنباً إلى جنب لنموذجها المخصص و GPT-4 للسؤال نفسه. اختار المحامون إجابة النموذج المخصص 97% من الوقت — عادة من أجل الاكتمال وتغطية قانون الحالات. إنه مقياس تفضيل، وليس مقياس دقة رسمي.
هل ينشئ نموذج هارفي حالات محكمة غير موجودة؟
وفقاً لمؤسس هارفي المشارك في دراسة حالة OpenAI، لا ينشئ النموذج المخصص حالات، وكل جملة مدعومة بالحالة التي يستشهد بها. كان تقليل الهلوسة أحد الأهداف الرئيسية للتدريب المخصص.
كيف يختلف النموذج المدرب المخصص عن RAG؟
يغذي RAG الوثائق المسترجعة إلى سياق النموذج القياسي؛ التدريب المخصص يحقن المعرفة وأنماط التفكير في النموذج نفسه. أضافت هارفي ما يعادل 10 مليارات رمز من بيانات قانون الحالات الأمريكي لأن الاسترجاع البحت أثبت أنه غير كافٍ لإيجاد الحجج القانونية.
من أسس هارفي ومتى؟
تأسست الشركة في صيف عام 2022. المؤسسون المشاركون: Winston Weinberg، محام متخصص في قضايا مكافحة الاحتكار والمنازعات الأوراق المالية (وفقاً لويكيبيديا، عمل سابقاً في O'Melveny & Myers)، و Gabe Pereyra، باحث في الذكاء الاصطناعي عمل سابقاً على LLMs في Google Brain و Meta (وفقاً لدراسة حالة OpenAI).
ماذا حدث لهارفي بعد دراسة الحالة؟
وفقاً لويكيبيديا، استمرت الشركة في النمو: جولة Series C بقيمة $100M بتقييم $1.5B (يوليو 2024)، و $300M Series D بتقييم $3B (فبراير 2025)، و $300M Series E بتقييم $5B (يونيو 2025)، و $160M Series F بتقييم $8B (ديسمبر 2025)، وجولة $200M بتقييم $11B في مارس 2026؛ كان إيراد 2025 هو $190M.