LangChain Blog→ المصدر

تقارن LangChain بين GPT-4 و Claude والنماذج اللغوية مفتوحة المصدر في استخراج البيانات

أطلقت LangChain بحث Extraction Benchmarking—مقارنة GPT-4 ونماذج Claude والنماذج اللغوية مفتوحة المصدر على استخراج البيانات المنظمة من سجلات المحادثة. تغطي الورقة نتائج المعيار وحدة المقارنة والمنهجية ورسم خريطة للطريقة التي جمعت بها الفريق مجموعة البيانات لتقييم النموذج.

معالج بواسطة الذكاء الاصطناعي من LangChain Blog؛ بتحرير Hamidun News
تقارن LangChain بين GPT-4 و Claude والنماذج اللغوية مفتوحة المصدر في استخراج البيانات
المصدر: LangChain Blog. كولاج: Hamidun News.
◐ استمع للمقال

نشرت فريق LangChain مادة في يوليو 2026 تسمى Extraction Benchmarking — مقارنة لكيفية تعامل نماذج GPT-4 من OpenAI ونماذج عائلة Claude من Anthropic ونماذج LLM مفتوحة المصدر مع استخراج البيانات المنظمة من سجلات الدردشة.

لماذا استخراج البيانات مهمة معقدة لـ LLM

استخراج البيانات المنظمة هو أحد أكثر المهام العملية التي تحل نماذج LLM في الإنتاج: تحويل النص غير المنظم من المراسلات أو تذاكر الدعم أو رسائل البريد الإلكتروني إلى JSON نظيف بالحقول المطلوبة - الاسم والتاريخ والمبلغ وحالة الطلب. تبدو المهمة بسيطة، لكن في الواقع العملي تتعامل النماذج بشكل مختلف مع الصيغ غير واضحة والبيانات المفقودة والحقول التي تحتاج إلى الاستدلال عليها منطقياً وليس نسخها حرفياً.

  • تمت مقارنة GPT-4 ونماذج Claude وعدة نماذج LLM مفتوحة المصدر
  • مصدر البيانات للاستخراج - سجلات الدردشة (chat logs)
  • تضمنت المادة ليس فقط النتائج بل أيضاً منهجية إنشاء مجموعة بيانات التقييم

كيف يتم تنظيم تقييم النماذج

للمقارنة العادلة للنماذج في مثل هذه المهمة، ليس فقط دقة الاستخراج (ما إذا كانت قيمة الحقل تطابق المرجع) مهمة، بل أيضاً مقاييس مثل الاكتمال - هل لم تفتقد النموذج حقلاً كان موجوداً في النص - والاستقرار للصيغة: هل يمكن للنموذج بشكل متسق إرجاع JSON صالح بدون تعليقات وتفسيرات إضافية؟ لهذا السبب يصف فريق LangChain بشكل منفصل ليس فقط الأرقام النهائية للمعيار، بل أيضاً كيف تم جمع مجموعة البيانات نفسها وبأي معايير تم تحديد الإجابات الصحيحة - بدون منهجية شفافة، أرقام مقارنة النموذج تقول القليل للمطورين الذين يختارون نموذجاً لحالة الإنتاج الخاصة بهم.

مهام استخراج البيانات من الدردشات حساسة بشكل خاص للنمط المحادثاتي: يصيغ المستخدمون الحقيقيون الطلبات بشكل مختلف عن المستندات الرسمية، التي غالباً ما تُستخدم لاختبار النماذج، وبالتالي فإن المعايير على سجلات الدردشة المباشرة توفر صورة أكثر صدقاً من مجموعات الاختبار الاصطناعية المجمعة من الأمثلة المنسقة بشكل مثالي.

لماذا منهجية إنشاء مجموعة البيانات مهمة

يواجه مطورو الأطر مثل LangChain بانتظام أسئلة من المجتمع حول أي نموذج يختار لسيناريو معين لاستخراج البيانات - من رسائل البريد الإلكتروني أو تذاكر الدعم أو نصوص الكلام. الإجابة غالباً ما تعتمد ليس على السمعة العامة للنموذج بقدر ما تعتمد على مدى جودة تعامله تحديداً مع نوع النص وهيكل الحقول المطلوب في المشروع.

لذا، في مادة Extraction Benchmarking، يُعطى اهتمام خاص لكيفية إنشاء مجموعة بيانات التقييم بالضبط - ما أنواع الدردشات التي تم تضمينها فيها، وكيف تم تحديد القيم المرجعية وأي حالات حدية (بيانات مفقودة وذكريات متناقضة وصيغ غير واضحة) تم وضعها عن قصد في أمثلة الاختبار بحيث ينعكس المعيار التعقيدات الحقيقية وليس فقط الحالات البسيطة.

لماذا هذه المنهجيات المفتوحة ضرورية

نشر ليس فقط التصنيف النهائي للنموذج بل أيضاً المنهجية الكاملة لتجميع مجموعة البيانات يحل مشكلة أخرى في الصناعة: يمكن للمطورين الذين يبنون خطوطهم الخاصة لاستخراج البيانات إعادة استخدام الطريقة لوضع العلامات والحالات الحدية لتقييم سيناريوهاتهم، بدلاً من أن تضطر كل فريق إلى إعادة اختراع معايير جودة الاستخراج من الصفر.

ما يعنيه هذا

بالنسبة للفرق التي تختار نموذجاً لمهام استخراج البيانات - من إدارة علاقات العملاء إلى أتمتة الدعم - هذه المقارنات المستقلة لـ GPT-4 و Claude ونماذج LLM مفتوحة المصدر على البيانات الواقعية أكثر فائدة من معايير التسويق من بائعي النماذج أنفسهم، لأنها تظهر سلوك النموذج على النصوص النموذجية وليس على النصوص المصقولة بشكل مثالي.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟

أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).

ما رأيك؟
جارٍ تحميل التعليقات…