طور المبرمج مكتبة ML lancetnic المحسّنة للتدريب على 16 جيجابايت من الذاكرة
اكتشف مطور مكتبة ML مفتوحة المصدر lancetnic أنه عند التدريب على مجموعات بيانات نصية كبيرة، تستهلك ذاكرة فائضة: على جهاز محمول بذاكرة 16 جيجابايت لم يستطع النموذج التدريب حتى على 25 ألف سطر. أثناء التحقيق في المشكلة، وجد المؤلف عدة أسباب للاستهلاك الحرج الزائد للذاكرة.
معالج بواسطة الذكاء الاصطناعي من Habr AI؛ بتحرير Hamidun News
طور محسّن مكتبة ML lancetnic للتدريب على 16 جيجابايت RAM
اكتشف مطور المكتبة ML المفتوحة lancetnic أنه عند التدريب على مجموعات بيانات نصية كبيرة كانت تثقل كاهل ذاكرة الوصول العشوائي بالكمبيوتر: على جهاز محمول مزود بـ 16 جيجابايت RAM لم تستطع النموذج التدريب حتى على 25 ألف سطر من النص. أثناء التحقيق في المشكلة، وجد المؤلف عدة أسباب لاستهلاك الذاكرة الحرج.
ما كانت المشكلة
تم تصميم مكتبة lancetnic لتدريب النماذج على البيانات النصية، لكن عند العمل مع مجموعات البيانات الكبيرة كانت عملية التدريب تصطدم بالحد الفيزيائي لذاكرة الوصول العشوائي قبل الانتهاء بوقت طويل. على جهاز محمول نموذجي بـ 16 جيجابايت RAM كانت محاولة تدريب نموذج حتى على مجموعة بيانات متواضعة نسبيًا من 25 ألف سطر تنتهي بحمل زائد على الذاكرة. يصف المؤلف هذا بأنه مشكلة واجهها بشكل شخصي أثناء عمله على المكتبة نفسها، وليس كسيناريو نظري.
ما الذي وجده المؤلف
يصف المؤلف أنه بدأ في التحقيق من أسباب الانهيار واكتشف بعض المصادر المحددة لاستهلاك الذاكرة الحرج في رمز المكتبة. هذا هو نوع المشكلة التي يواجهها أي مطور أدوات ML عند بناء أدوات مخصصة للعمل بدون أجهزة خادم مكلفة: يجب أن يتناسب التدريب مع ذاكرة جهاز محمول عادي، وليس فقط محطات عمل GPU متخصصة.
بالنسبة للمكتبات التي تعمل مع البيانات النصية، فإن المصدر النموذجي لاستهلاك الذاكرة الزائد هو التخزين غير الفعال للتمثيلات الوسيطة لمجموعة البيانات: إذا تم الاحتفاظ بالمجموعة كاملة وجميع تحويلاتها المتجهة في RAM في نفس الوقت بدلاً من معالجة البث في دفعات، فإن استهلاك الذاكرة ينمو خطيًا مع حجم مجموعة البيانات ويصل بسرعة إلى الحد الفيزيائي حتى على كميات صغيرة نسبيًا من النص مثل 25 ألف سطر.
لماذا يقلق هذا أكثر من مجرد المؤلف
مشاكل الذاكرة أثناء التدريب على البيانات النصية هي اختناق نموذجي لمكتبات ML مفتوحة المصدر الصغيرة المكتوبة بواسطة المتحمسين بدون إمكانية الوصول إلى مجموعات الحوسبة الصناعية. الأسباب التي تم العثور عليها لاستهلاك الذاكرة الزائد في مثل هذه الحالات عادة ما تكون عالمية وتظهر بشكل مماثل لدى مطورين آخرين يحلون نفس المشكلة على أجهزتهم الخاصة.
- المكتبة — lancetnic، أداة مفتوحة المصدر لتدريب نماذج ML على النصوص
- أجهزة الاختبار — جهاز محمول مزود بـ 16 جيجابايت من RAM
- مجموعة البيانات حيث حدث الانهيار — 25 ألف سطر من النص
- وجد المؤلف عدة أسباب محددة لاستهلاك الذاكرة الحرج
لماذا يأتي التدريب على جهاز محمول أهمية
ليس كل المطورين الذين يجربون مكتبات ML لديهم إمكانية الوصول إلى خادم به عشرات غيغابايت من ذاكرة الفيديو أو مثيل GPU في السحابة. بالنسبة للمتحمسين والطلاب والفرق الصغيرة، فإن جهاز محمول بسعة 16 جيجابايت من RAM هو معدات عمل قياسية، وعلى هذه الآلة يجب أن تتصرف المكتبة بطريقة يمكن التنبؤ بها. عندما يفشل التدريب بالفعل على مجموعة بيانات من 25 ألف سطر — هذا ليس حالة حدية غريبة، بل سيناريو سيواجهه جزء كبير من مستخدمي lancetnic المحتملين بالفعل عند تشغيلهم الأول.
ما هذا يعني
قصة lancetnic هي مثال مميز على كيفية أن تقدم أدوات ML المفتوحة يسير في كثير من الأحيان من خلال تحديد اختناقات على الأجهزة الضعيفة: إذا لم تعمل مكتبة على جهاز محمول لمطور عادي، فإن قيمتها العملية للمجتمع تقل بشكل كبير بغض النظر عن جودة النموذج نفسه. التحليل العام لمثل هذه المشكلة مفيد لمؤلفين آخرين من أدوات ML مفتوحة المصدر المماثلة — فهو يساعد على وضع معالجة بيانات البث بدلاً من تحميل مجموعة البيانات بأكملها في الذاكرة مرة واحدة مقدمًا.
هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟
أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.