FLOPS
FLOPS (عمليات النقطة العائمة في الثانية) تقيس عدد عمليات الحسابات بالنقطة العائمة التي ينفذها المعالج كل ثانية. وهي المعيار الأساسي للمقارنة بين أجهزة الذكاء الاصطناعي، حيث تقدم معالجات الرسوميات الحديثة عالية الأداء آلاف teraFLOPS بصيغ الدقة المنخفضة المستخدمة في تدريب الذكاء الاصطناعي.
FLOPS هي وحدة من إنتاجية الحسابات تساوي عملية واحدة بالنقطة العائمة في الثانية. البادئات ذات الترتيب الأعلى معيارية: واحد teraFLOPS (TFLOPS) يساوي 10^12 عملية في الثانية، و واحد petaFLOPS يساوي 10^15، و واحد exaFLOPS يساوي 10^18. تنطبق المقياس على وحدات المعالجة المركزية ومعالجات الرسوميات والمسرعات المتخصصة للذكاء الاصطناعي على حد سواء، على الرغم من أن أحمال عمل الذكاء الاصطناعي تعتمد بشكل حصري تقريباً على معالجات الرسوميات والسيليكون المخصص حيث تكون أرقام FLOPS هي الأعلى.
تتضمن عمليات النقطة العائمة الحساب على الأرقام بدقة عشرية. يعمل أجهزة الذكاء الاصطناعي الحديثة بشكل متكرر على صيغ دقة منخفضة — FP16 أو BF16 أو FP8 — بدلاً من FP32 الكامل، مما يضاعف الإنتاجية الفعالة مع قبول المقايضات البسيطة في الدقة. لذلك تنشر الشركات المصنعة أرقام FLOPS متعددة لنفس الرقاقة اعتماداً على نوع البيانات. يوفر NVIDIA H100 SXM تقريباً 2,000 TFLOPS في BF16 dense وحوالي 67 TFLOPS في FP32؛ يقوم Blackwell B200 بتضاعف إنتاجية BF16 تقريباً بالنسبة إلى H100 ويوفر إنتاجية أعلى بكثير في FP8. المقارنة بين الرقاقات دون تحديد نوع البيانات مضللة.
تحدد أرقام FLOPS مباشرة السرعة التي يمكن بها تدريب نماذج الذكاء الاصطناعي وتقديمها. تتطلب نماذج اللغة الأكبر حساباً أكثر لكل رمز تدريب، لذلك يعبر الباحثون أيضاً عن تكلفة التدريب الإجمالية كعدد FLOPs مجمع — مجموع بلا أبعاد وليس معدل. أظهرت قوانين التحجيم التي وثقتها OpenAI و DeepMind في أوائل العشرينات من القرن الحالي أن أداء النموذج تتحسن بشكل متوقع مع إجمالي حوسبة التدريب، مما يجعل FLOPS متغيراً مركزياً في التخطيط لمختبرات الذكاء الاصطناعي الحدودية. بلغت تكلفة التدريب المقدرة لـ GPT-4 عشرات الملايين من الدولارات، تحركها بشكل أساسي ساعات معالج الرسوميات المستهلكة.
بحلول عام 2026، تجمع مجموعات تدريب الذكاء الاصطناعي الكبيرة عشرات الآلاف من معالجات NVIDIA B200 أو H200 أو مسرعات مخصصة معادلة من Google و Amazon و Microsoft، مما يصل إلى إنتاجية مجمعة متعددة exaFLOPS. تستهلك عمليات التدريب لنماذج الحدود الرائدة بانتظام ما بين 10^24 و 10^25 FLOPS إجمالية. تم تعويض التحسينات الخوارزمية — بما في ذلك معماريات mixture-of-experts وتنسيق البيانات بشكل أفضل — جزئياً الطلب على الحوسبة الخام لكل وحدة من جودة النموذج، لكن إجمالي استثمار الأجهزة على مستوى المجموعة يستمر في النمو.