ضبط نموذج Gemma-3 في الرياضيات باستخدام GRPO ومحولات LoRA
نشر الباحثون سير عمل ضبط دقيق لـ Gemma-3 من Google باستخدام خوارزمية GRPO: يتعلم النموذج حل مسائل رياضية خطوة بخطوة من مجموعة بيانات GSM8K. تستخدم الطريقة محولات LoRA لحفظ الذاكرة والعمل ودوال المكافأة للتنسيق الصحيح والإجابات الرقمية. نتيجة لذلك، يبدأ Gemma-3 بالتفكير المنظم—وبدون مركز بيانات.
معالج بواسطة الذكاء الاصطناعي من MarkTechPost؛ بتحرير Hamidun News
نشر الباحثون في 5 يوليو 2026 سير عمل مفصل لضبط نموذج Gemma-3 من Google على مجموعة بيانات GSM8K الرياضية باستخدام خوارزمية GRPO ومحولات LoRA وإطار عمل Tunix.
ما هو GRPO وكيف يختلف عن الطرق الكلاسيكية
GRPO (Group Relative Policy Optimization) هي خوارزمية من عائلة التعلم المعزز، مخصصة بشكل خاص لنماذج اللغة. بخلاف PPO الكلاسيكي، الذي يتطلب نموذج ناقد مرجعي منفصل، يقارن GRPO متغيرات الإجابة المتعددة المتولدة ضمن مجموعة واحدة وتحديث السياسة لصالح الحلول الأكثر نجاحاً. هذا يقلل من استهلاك الذاكرة ويجعل التدريب أكثر استقراراً.
للمهام الرياضية، يكون هذا النهج مناسباً بشكل خاص: الإجابة إما صحيحة أو خاطئة — يتم حساب إشارة المكافأة تلقائياً وبلا غموض. GSM8K (Grade School Math 8K) هي معيار قياسي يحتوي على 8500 مسألة رياضيات مدرسية تتطلب استدلالاً متعدد المراحل. يتطلب أن ينتج النموذج ليس فقط رقماً، بل يعيد إنتاج سلسلة من الاستدلال، مما يجعله ساحة اختبار مثالية لـ GRPO.
- النموذج الأساسي — Gemma-3 من Google
- مجموعة البيانات — GSM8K (8500 مسائل مدرسية)
- الخوارزمية — GRPO (Group Relative Policy Optimization)
- إطار العمل — Tunix على Hugging Face Transformers
- الضبط الدقيق — محولات LoRA دون تغيير الأوزان الأساسية
كيفية بناء خط الأنابيب خطوة بخطوة
يتم تقسيم سير العمل إلى مراحل منطقية. أولاً، يتم تكوين البيئة والمصادقة على Hugging Face Hub — من حيث يتم تحميل أوزان Gemma-3. ثم يتم تغليف كل مثال من GSM8K في قالب "استدلال + إجابة": يرى النموذج البنية المتوقعة للإخراج من خطوات التدريب الأولى ويتعلم اتباعها.
يتكون العنصر المركزي من وظيفتي مكافأة. الأولى تتحقق من الامتثال الصيغي: هل توجد كتل استدلال ونتائج رقمية في الإجابة؟ الثانية تقيّم الدقة الرقمية — هل يتطابق الرقم النهائي مع المعيار القياسي؟ يقوم GRPO بتحسين كلا الإشارتين في نفس الوقت، وينتج مجموعات من المتغيرات ويختار أفضلها.
لتجنب ضبط النموذج بالكامل، يتم توصيل محولات LoRA بـ Gemma-3 — مصفوفات مدمجة من رتبة منخفضة يتم تدريبها بدلاً من أوزان أساسية "مجمدة". النتيجة: ينخفض عدد المعاملات القابلة للتدريب بشكل حاد، وتنخفض متطلبات الذاكرة المرئية إلى حد يجعل سير العمل قابلاً للتنفيذ على أجهزة المستهلك.
بعد التدريب، يقترح المؤلفون قياس الدقة مع المحولات ومقارنتها مع نقطة تفتيش الأساس. اختياري، يمكن دمج المحولات مع الأوزان الأساسية وتصدير النموذج النهائي للنشر.
لماذا يهم هذا للمطورين
"محولات
LoRA تجعل العملية برمتها ممكنة بدون مركز بيانات"، كما جاء في وصف سير العمل.
قبل بضع سنوات فقط، كان ضبط النماذج الكبيرة يتطلب عشرات غيغابايت من الذاكرة المرئية والوصول إلى عناقيد احترافية. تغير المزيج GRPO + LoRA هذا: الخوارزمية فعالة بالفعل من حيث الذاكرة أكثر من PPO الكلاسيكي، و LoRA يقلل كذلك من عدد المعاملات القابلة للتدريب بمقدار 10–100 مرة حسب رتبة المحول.
النتيجة العملية: يمكن لمطور لديه بطاقة رسومات حديثة واحدة أن يأخذ نموذجاً مفتوحاً مثل Gemma-3، ويضبطه لمجال معين — الرياضيات أو القانون أو الطب — ويحصل على نموذج متخصص مع تحسين قابل للقياس على المعيار القياسي المستهدف. يعمل Tunix كمغلف ملائم يؤتمت تكوين GRPO وإدارة المحولات؛ يمكن تطبيق نهج مشابه على أي مجموعة بيانات بها إجابات قابلة للتحقق.
ما يعنيه هذا
ينتقل الضبط الدقيق GRPO مع LoRA على مجموعات بيانات المجال من الأوراق الأكاديمية إلى الأدلة العملية. أظهر المؤلفون الدورة الكاملة — من التحميل إلى التصدير — على نموذج حقيقي ومعيار عام، مما يخفض حاجز الدخول للمطورين الذين يريدون تحسين نموذج مفتوح لمهمة معينة دون بنية تحتية مكلفة.
هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟
أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.