الهلوسة (Hallucination)
الهلوسة هي مخرجات واثقة وسلسة من نموذج لغة صناعي تكون غير صحيحة في الحقائق أو مختلقة أو غير مرتبطة بمدخلاته أو معرفته، وتُنتج دون أي مؤشر على عدم اليقين.
في سياق نماذج اللغة الكبيرة (LLMs)، تشير الهلوسة إلى توليد معلومات تبدو معقولة لكنها خاطئة في الحقائق أو غير مدعومة بمصادر أو مختلقة بالكامل. على عكس الخطأ البسيط، تُقدم الهلوسة عادة بنفس أسلوب الثقة والسلاسة كما هو الحال مع المخرجات الدقيقة، مما يجعل من الصعب على المستخدمين تحديدها دون التحقق المستقل. المصطلح مستعار من علم النفس لكنه يصف ظاهرة حسابية متميزة متجذرة في كيفية تدريب نماذج اللغة.
تنشأ الهلوسات لأن نماذج اللغة الكبيرة محسّنة لإنتاج متابعات نصوص سلسة ومتماسكة بدلاً من التحقق من دقة الحقائق. عندما يواجه النموذج استعلاماً حول موضوع تكون بيانات التدريب الخاصة به نادرة أو متناقضة أو غائبة، فإنه يولد إكمالاً معقول الصوت يملأ الفجوات بتفاصيل مختلقة. تقلل أنظمة الجيل المعزز بالاسترجاع (RAG) من الهلوسات بربط المخرجات بالوثائق المسترجعة لكنها لا تلغيها. تشمل التخفيفات الإضافية استخدام الأدوات (السماح للنماذج بالتحقق من المطالبات عبر البحث أو واجهات برمجية التطبيقات)، والتدريب المعايري، وتوليد مقيد بالاستشهادات.
تمثل الهلوسات عائقاً عملياً كبيراً لنشر نماذج اللغة الكبيرة في المجالات ذات المخاطر العالية. تشمل الحالات الموثقة استشهادات قانونية مختلقة قُدمت للمحاكم الفيدرالية الأمريكية في عام 2023 (قضية Mata v. Avianca)، ومراجع علمية مختلقة في السياقات الأكاديمية، ومعلومات طبية غير صحيحة قُدمت بثقة واضحة. أدت هذه الإخفاقات إلى إرشادات رسمية من الهيئات القانونية والطبية المهنية تنصح بعدم الاعتماد على المطالبات الحقائقية المولدة من قبل الذكاء الاصطناعي دون مراجعة.
بحلول عام 2026، لا تزال الهلوسات مشكلة بحثية نشطة. تحدد معايير مثل TruthfulQA و HaluEval و FActScore معدلات الهلوسات عبر النماذج. قللت النماذج التجارية الرائدة من تكرار الهلوسات بشكل كبير مقارنة بخطوط الأساس من 2022-2023 من خلال تحسين تدريب المحاذاة وتكامل RAG وتقنيات التوليد المرتكز على الأساس. ومع ذلك، لم يحقق أي نموذج إنتاج عملياً خالياً من الهلوسات، وتختلف المعدلات بشكل كبير حسب المجال وخصوصية الاستعلام وما إذا كان الاسترجاع الخارجي متاحاً.