TriAgent: комитет мелких моделей вместо дорогого LLM экономит $9,3 млн в год
TriAgent — многоагентный комитет для анализа финансовых настроений: запросы распределяются между тремя уровнями — словарь VADER, трансформер FinBERT и LLM Qwen2.5. Индекс расхождения SDI решает, кому отдать запрос, и дорогой LLM подключается только к спорным случаям. На масштабе 10 млн пользователей это экономит $9,3 млн в год против базы на GPT-4o-mini.
معالج بواسطة الذكاء الاصطناعي من arXiv cs.CL؛ بتحرير Hamidun News
كيف تُبنى لجنة TriAgent
يوزّع TriAgent الاستعلامات بين ثلاثة مستويات من "الرؤية" للنص، كل مستوى أغلى من سابقه. تتولى المستويات الرخيصة معظم الحالات البسيطة، بينما لا يتدخل النموذج اللغوي الكبير المكلف إلا في الحالات الخلافية. تقوم الفكرة على فخّ بنيوي في التكاليف: تُصنَّف معظم الاستعلامات بشكل تافه، لكن المُحلِّل السحابي (reasoner) يعالجها جميعًا، وتنمو الفاتورة خطيًا مع عدد المستخدمين.
- معجم VADER — تحليل على مستوى الكلمة المفردة
- محوّل FinBERT — تحليل على مستوى الجملة
- Qwen2.5 (من 0.5B إلى 14B، بدقة 4-bit) كمُحلِّل (reasoner) فوق عدة جمل، مع فحوصات متقاطعة من Mistral-7B وPhi-3.5-mini
- مؤشر التباين الدلالي (SDI) يقيس مدى تباين المستويات ويقرر لمن تُسند الاستعلام
- التوفير — 9.3 مليون دولار سنويًا عند 10 ملايين مستخدم مقارنة بـ GPT-4o-mini
«تُصنَّف معظم الاستعلامات بشكل تافه، إلا أن المُحلِّلات السحابية
المكلفة تعالجها جميعًا» — من ملخص الورقة البحثية على arXiv.
ما هو "critic plateau"
الاستنتاج الرئيسي للورقة البحثية هو "هضبة الناقد" (critic plateau): عندما يُسنَد إلى النماذج اللغوية الكبيرة دور الناقد على مخرجات الوكلاء الأصغر، يصل مقياس F1 إلى هضبة عند نحو 0.87 لنماذج Qwen من 1.5B إلى 7B (مع تداخل فترات الثقة). للمقارنة، لا يعطي تصويت ثلاث "شخصيات" من الحجم نفسه سوى F1=0.66.
ووفقًا للباحثين، يُفسَّر الفرق بالتنوع الناتج عن اختلاف دقة التحليل: فالمستويات الثلاثة "ترى" النص بطرق مختلفة، وهذا يتضح أنه أكثر فائدة من ثلاثة نماذج متطابقة بأدوار مختلفة.
ثلاث نتائج جانبية لمؤشر SDI
من نفس إشارة SDI، يستخلص الباحثون ثلاث نتائج إضافية. مفردات توافق مشتركة مبنية على sentence-BERT متعدد اللغات تجيب على 95% من الاستعلامات الصينية انطلاقًا من ذاكرة تخزين مؤقت إنجليزية بدقة F1=0.99 — أي أنها تنقل الوسم بين اللغات بتكلفة إضافية شبه معدومة.
كما يعمل SDI كأداة كشف لهلوسات النماذج اللغوية الكبيرة بأثر رجعي بدقة AUC=0.90. وفي اختبار خلفي (backtest) على 20 رمزًا (tickers)، حققت استراتيجية مبنية على SDI عائدًا أفضل معدَّلًا حسب المخاطر: Sharpe 3.50 مقابل 1.36 لاستراتيجية "دائمًا FinBERT" و0.11 لاستراتيجية "دائمًا LLM".
ماذا يعني هذا
يقدّم TriAgent وصفة عملية: عدم تمرير كل استعلام عبر نموذج مكلف، بل توجيهه حسب درجة تعقيده. بالنسبة لبيئة إنتاج تضم ملايين المستخدمين، هذا هو الفرق بين فاتورة تنمو خطيًا وتوفير بملايين الدولارات — دون خسارة في الجودة. وقد أتاح الباحثون الكود والمعاجم ومفردات التوافق في متناول الجميع (open access).
أسئلة شائعة
كم يوفر TriAgent؟
وفقًا لحسابات الباحثين، عند 10 ملايين مستخدم يوفر النظام 9.3 مليون دولار سنويًا مقارنة بحل أساسي على GPT-4o-mini — بفضل عدم تدخل النموذج اللغوي الكبير المكلف إلا في الاستعلامات الخلافية.
ما هو مؤشر SDI؟
مؤشر التباين الدلالي (Semantic Divergence Index - SDI) هو مقياس للتباين الثنائي بين مستويات التحليل الثلاثة (الكلمة، الجملة، عدة جمل). فهو يوجّه الاستعلامات، ويعمل في الوقت نفسه كأداة كشف لهلوسات النماذج اللغوية الكبيرة بدقة AUC=0.90.
ما هي النماذج التي يستخدمها TriAgent؟
معجم VADER، ومحوّل FinBERT، ومُحلِّل Qwen2.5 (من 0.5B إلى 14B بدقة 4-bit)، مع فحوصات متقاطعة من Mistral-7B وPhi-3.5-mini.
هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟
AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.