SIFT: самообучающийся классификатор документов, который переобучается без человека
Исследователи представили SIFT — сервис классификации документов, который дообучается сам. Дешёвый пайплайн SPLADE + LightGBM размечает основную массу страниц, а спорные случаи разбирает LLM-судья и пополняет обучающий корпус. Так дорогая модель учит дешёвую: доля эскалаций падает, а точность растёт с использованием. Два защитных гейта позволяют переобучать модель раз в месяц без участия человека.
معالج بواسطة الذكاء الاصطناعي من arXiv cs.CL؛ بتحرير Hamidun News
قدّم باحثون SIFT (Self-Improving, Frozen-gate Training) — وهي خدمة لتصنيف المستندات تعيد تدريب نفسها على حركة المرور الفعلية وتُعاد معايرتها دون تدخل بشري؛ ونُشرت النسخة الأولية (preprint) على arXiv في يوليو 2026.
كيف يعمل خط الأنابيب الرخيص
تُنجز SIFT التصنيف عبر خط أنابيب يعمل على المعالج (CPU) بتكلفة منخفضة عن قصد: يُغذّي المُرمِّز المتفرّق SPLADE الخصائص إلى نموذج LightGBM، ولا تُصعَّد إلى الحكم المكلف القائم على LLM سوى أقلية من الصفحات ذات الثقة المنخفضة. يُصنّف النظام الغالبية العظمى من المستندات دون اللجوء إلى نموذج لغوي كبير — ومن هنا تأتي التكلفة المنخفضة للاستدلال.
- البنية: SPLADE (مُرمِّز متفرّق) ← رأس LightGBM، بالكامل على المعالج (CPU)
- لا يُصعَّد إلى حكم LLM سوى الأقلية منخفضة الثقة من الصفحات
- إدماج نوع جديد من المستندات يتم عبر حزمة تصريحية (bundle): فضاء التصنيفات، عبارات الإرساء (anchor phrases)، ومسرد الحكم
- إعادة التدريب تحدث نحو مرة كل شهر، تلقائيًا، دون تدخل بشري
- التكلفة الحدّية لوضع العلامات تتجه نحو الصفر
لماذا تتحسّن الدقة مع الوقت
تتراكم دقة SIFT لأن أحكام الحكم القائم على LLM تُكتب مجددًا في المجموعة المُصنَّفة — فالنموذج المكلف يُعلّم باستمرار النموذج الرخيص. ومع نمو المجموعة، تنخفض حصة التصعيدات إلى LLM، وتستمر المجموعة نفسها في النمو من حركة مرور الإنتاج، لا من مشروع تصنيف مكلف في البداية. العائق الكلاسيكي أمام التصنيف على مستوى المؤسسات — ضرورة تصنيف آلاف المستندات يدويًا أولًا — يزول هنا: تُبنى المجموعة من تلقاء نفسها، وتنمو الدقة مع الاستخدام.
كيفية تجنّب التدهور الصامت
الخطر الرئيسي لمصنِّف يُعيد تدريب نفسه تلقائيًا هو التدهور الصامت: فقد يسوء أداء النموذج دون ملاحظة بعد إعادة تدريبه ذاتيًا. تُغلق SIFT هذه الثغرة ببوابة ترقية (promote gate) من جزأين. البوابة الأولى تفحص انحدار F1 على التصنيفات الحرجة؛ والثانية هي مجموعة انحدار "ذهبية" مجمّدة (frozen golden regression set) لا يتدرّب النموذج عليها أبدًا. أي من البوابتين يُفعّل حق النقض ضد إطلاق نسخة جديدة.
«هذا يحوّل "إعادة التدريب مرة كل شهر دون بشر" من تهوّر إلى روتين»، كما
جاء في النسخة الأولية لـ SIFT على arXiv.
ماذا يعني ذلك
تقترح SIFT وصفة على مستوى المؤسسات حيث يعمل نموذج LLM مكلف كمعلّم لمصنِّف رخيص يعمل على المعالج (CPU)، وتسمح بوابتا أمان بإسناد إعادة التدريب إلى الأتمتة. وإذا تكرّر نجاح هذا النهج، فلن تحتاج الشركات بعد الآن إلى مشروع تصنيف واسع النطاق قبل إطلاق مصنِّف — إذ تتراكم البيانات والدقة من تلقاء نفسها مع الاستخدام.
الأسئلة الشائعة
ما هو SIFT؟
SIFT (Self-Improving, Frozen-gate Training) هو خدمة تصنيف ديناميكي للمستندات تعيد تدريب نفسها على حركة مرور الإنتاج: خط أنابيب رخيص يجمع بين SPLADE وLightGBM يُصنّف معظم الصفحات، بينما يتولى حكم LLM الحالات المتنازع عليها ويُغذّي مجموعة التدريب.
هل التصنيف اليدوي للمستندات ضروري؟
لا. فبدلًا من مشروع تصنيف مسبق لنوع جديد من المستندات، تكفي حزمة تصريحية — فضاء تصنيفات، وعبارات إرساء، ومسرد لحكم LLM. بعد ذلك، تنمو المجموعة من تلقاء نفسها من حركة المرور الفعلية.
كيف تُحمى SIFT من التدهور أثناء إعادة التدريب التلقائي؟
عبر بوابتين: فحص انحدار F1 على التصنيفات الحرجة، ومجموعة "ذهبية" مجمّدة لا يتدرّب النموذج عليها أبدًا. وإذا فشلت بوابة واحدة على الأقل، لا يتم إطلاق النسخة الجديدة.
هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟
أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.