نتفليكس: نظام التوصيات يدفع 80% من المشاهدات ويوفر أكثر من 1B دولار سنويًا
يتم استخدام نظام التوصيات على معظم شاشات المنتج وبشكل عام يؤثر على الاختيار لحوالي 80% من الساعات المبثة على نتفليكس؛ الـ 20% المتبقية تأتي من البحث. يمكن رؤية تطور الرقم: في عام 2012 استشهدت الشركة علناً بـ 75% - بحلول عام 2015 ارتفعت الحصة إلى 80%. لقياس التأثير على الكتالوج، قدم المؤلفون مقياس حجم الكتالوج الفعلي (ECS): يظهر كم عدد الفيديوهات التي تشكل فعلاً ساعة مشاهدة نموذجية. مع ترتيب PVR الشخصي، حجم الكتالوج الفعلي أكبر بحوالي 4 مرات من ترتيب الشعبية غير المخصص: تنتشر المشاهدة بعيداً عن الضربات إلى المكتبة الواسعة، بما في ذلك العناوين المتخصصة. الخط السفلي للعمل مذكور في الورقة بحرفية: 'نعتقد أن التأثير المشترك للتخصيص والتوصيات يوفر لنا أكثر من 1 مليار دولار في السنة.' تمتد الآليات من خلال الفقدان: على مدى سنوات من تطوير التخصيص، تم تقليل معدل الفقدان الشهري بعدة نقاط مئوية، مما يرفع LTV للعضو بالتزامن ويقلل الحاجة للاكتساب المكلف لاستبدال من يغادرون. حدود مهمة: هذا تقدير الشركة الخاص ('نعتقد')، المقدم بحجم 65M+ عضو في عام 2015، والمؤلفون لا يكشفون رياضيتها - لا تعطي الورقة النسب المئوية الدقيقة لتقليل الفقدان ولا تكاليف الاكتساب. في رأينا، يبقى هذا العمل المعيار الذهبي للحديث عن قيمة نظام ML. أولاً، السلسلة 'مقياس النظام → مقياس المنتج → المال' شفافة: ECS ومعدل الأخذ يرتبطان بالمشاركة، والمشاركة بالاحتفاظ، والاحتفاظ بإيرادات الاشتراك. ثانياً، تم نشر تقدير '>1B دولار سنويًا' من قبل المديرين التنفيذيين تحت أسمائهم الخاصة في مجلة محكمة - التزام لا يضاهى بالمقارنة مع بيان صحفي تسويقي مجهول، على الرغم من أن الرقم لا يزال غير قابل للتحقق المستقل. ملاحظتنا الثانية: الأصل الرئيسي لنتفليكس في هذه الحالة ليس الخوارزميات المحددة (خوارزميات Netflix Prize-era SVD و RBM منذ وقت طويل أصبحت مجرد أجزاء من المجموعة) بل بنية الاختبار والانضباط في المقياس. النظام الذي يحسّن احتفاظاً بأفق أشهر بدلاً من نقرات بأفق الجلسة هو قرار إدارة وليس قرار تقني - ويحكم من الورقة، هذا هو ما حول التوصيات إلى مليار دولار.
- The Netflix Recommender System: Algorithms, Business Value, and Innovation — ACM Transactions on Management Information Systems, Vol. 6, No. 4 (Gomez-Uribe & Hunt), 2015-12
- Netflix Recommendations: Beyond the 5 stars (Part 1) — Netflix Prize, «всё — рекомендация», 75% просмотра — Netflix TechBlog (Xavier Amatriain, Justin Basilico), 2012-04-06
السياق
نتفليكس هي الشركة التي جعلت أنظمة التوصيات شائعة على نطاق واسع قبل وقت طويل من موجة الذكاء الاصطناعي الحالية. في عام 2006، في عصر أقراص DVD، أعلنت عن Netflix Prize - مسابقة مفتوحة بجائزة 1 مليون دولار لمن يحسّن دقة نظام التنبؤ بالتقييمات Cinematch بنسبة 10%. كان المقياس هو جذر متوسط الخطأ المربع للتنبؤ بالتقييم: كان يجب تقليل RMSE الأولي البالغ 0.9525 إلى 0.8572. في غضون سنة، حقق فريق Korbell جائزة التقدم الأولى بتحسن بنسبة 8.43%، وتم وضع اثنين من خوارزمياته - تحليل المصفوفات (SVD) وآلات بولتزمان المقيدة (RBM) - في الإنتاج واستمرت في العمل لسنوات. كان عليهم تحجيمها أولاً: تم بناء حلول المسابقة لـ 100 مليون تقييم، بينما الإنتاج احتفظ بأكثر من 5 مليارات.
بحلول عام 2012، كانت الشركة قد تحولت من توصيل أقراص DVD إلى البث، وتغيرت منطق التخصيص: صاغ المهندسون Xavier Amatriain و Justin Basilico، في منشور تقني علامة فارقة، المبدأ القائل بأن 'كل شيء توصية' وأعطوا رقماً: 75% مما يشاهده الناس يأتي من شكل ما من التوصيات. كان المستخدمون يضيفون 2 مليون فيلم وبرنامج إلى قوائم الانتظار الخاصة بهم ويقدمون 4 ملايين تقييم كل يوم.
كان تتويج هذا النهج ورقة عام 2015 في ACM Transactions on Management Information Systems. لم تكتبها مهندسون عاديون بل من قبل اثنين من المديرين التنفيذيين - نائب رئيس الابتكار في المنتج Carlos Gomez-Uribe ورئيس الضابط الرئيسي Neil Hunt. في وقت النشر، كان لدى نتفليكس أكثر من 65 مليون مشترك يشاهدون أكثر من 100 مليون ساعة من الفيديو يومياً. ضعت الورقة سابقة نادرة: شركة عامة، في مجلة محكمة، وصفت ليس فقط تصميم نظام ML الرئيسي لها بل قيمتها التجارية بالدولار - مع المنهجية والمقاييس والتحفظات.
المشكلة
التلفاز عبر الإنترنت يدور حول الاختيار: ماذا ومتى وأين ستشاهد. لكن، كما يكتب مؤلفو الورقة، البشر سيئون بشكل مفاجئ في الاختيار من بين خيارات كثيرة: يشعرون بالإرهاق بسرعة وإما يختارون 'لا شيء' أو يختارون بشكل سيء. أظهر بحث المستهلكين في نتفليكس حدوداً صعبة: يفقد عضو عادي الاهتمام بعد حوالي 60-90 ثانية من الاختيار، بعد مراجعة 10-20 بطاقة عنوان (حوالي ثلاثة بالتفصيل) على شاشة واحدة أو اثنتين. إما أن يلفت انتباهم شيء ما خلال تلك النافذة، أو يزداد خطر التخلي عن الخدمة بشكل كبير.
تم تأطير مشكلة التوصيات وفقاً لذلك: على تلك الشاشتين، يجب على كل عضو أن يرى شيئاً مقنعاً خاصاً بهم. بدون تخصيص، تركز المشاهدة على حفنة من الضربات - كما هو الحال في التلفاز الخطي، حيث تذهب وقت البث لعدد قليل من البرامج - بينما معظم الكتالوج، المدفوع برسوم الترخيص، يبقى عطلاً. وكتالوج نتفليكس متعمد واسع بقصد، بما في ذلك عناوين متخصصة تهم فقط مجموعات صغيرة نسبياً من المشاهدين: بدون مطابقة دقيقة لهذه العناوين لجماهيرهم، لا يؤتي اقتناؤها ثماراً.
الإطار الاقتصادي هو نموذج الاشتراك. الإيرادات متناسبة مع عدد الأعضاء، والذي يتم تحريكه من خلال ثلاث عمليات: اكتساب الأعضاء الجدد والإلغاءات والأعضاء السابقين الذين يعودون. معدل الفقد الشهري في نتفليكس منخفض جداً، وكثير منها ينتج عن فشل الدفع بدلاً من قرار متعمد بالإلغاء. كل عضو محتفظ به يعني كلاً من LTV أعلى وعملية اكتساب واحدة أقل تكلفة لاستبدالهم. هذا هو بالضبط السبب في أن الشركة تقيس جودة التوصية من خلال الاحتفاظ، وليس النقرات.
الحل
موصي نتفليكس ليس خوارزمية واحدة بل مجموعة من الخوارزميات المتخصصة، لكل منها دورها الخاص على الصفحة. عادة ما تتكون الصفحة الرئيسية من حوالي 40 صفاً موضوعياً (حتى 75 فيديو لكل صف، حسب الجهاز). Personalized Video Ranker (PVR) يرتب الكتالوج بأكمله شخصياً (أو مجموعات فرعية من الأنواع) لكل ملف تعريف - يملأ صفوف الأنواع مثل 'أفلام مثيرة'، ويمزج فيها جرعة من الشعبية غير المخصصة. يبني Top-N Video Ranker صف Top Picks، مع التركيز فقط على رأس الترتيب - أفضل العناوين في الكتالوج بالكامل لهذا الشخص. Trending Now يلتقط الاتجاهات قصيرة الأجل في المشاهدة؛ Continue Watching يقدر أي العناوين غير المكتملة يجب إعادة ظهورها أولاً. Video-Video Similarity ('sims') تشغل صفوف 'Because You Watched': قائمة ال similars نفسها غير مخصصة، لكن أي صفوف BYW تجعلها على الصفحة وأي مقاطع فيديو من القائمة يتم عرضها شخصية.
فوق كل هذا يجلس خوارزمية Page Generation: تجمع كل صفحة من صفوف المرشحين، متوازنة بين الملاءمة والتنوع - مع الأخذ في الاعتبار تغيير المزاج من جلسة إلى أخرى والحسابات المشتركة عبر الأسرة. فئة منفصلة هي خوارزميات اختيار الأدلة: تقرر أي 'أدلة' يجب أن تدعم التوصية - التقييم المتنبأ به أو الملخص أو الجوائز أو التشابه مع عنوان شوهد مؤخراً - وأي نسخة من الأعمال الفنية سيتم استخدامها. حتى البحث يتم تأطيره كمشكلة توصية: يأخذ في الاعتبار الـ 20% المتبقية من الساعات المبثة.
آلية التحسين الرئيسية هي ثقافة اختبارات A/B. يتم التحقق من الفرضيات أولاً في البيانات التاريخية، ثم في التجارب عبر الإنترنت: يتم تخصيص الأعضاء للخلايا (يشغل التحكم خوارزمية الإنتاج)، وتعيش المجموعات مع إصدارات منتج مختلفة لمدة 2-6 أشهر. المقاييس الرئيسية هي احتفاظ الأعضاء والمشاركة متوسطة الأجل، وليس النقرات: يشرح المؤلفون السبب في أن مقاييس الوكيل قصيرة الأجل تضلل وكيف تقارن الاختبارات الأعضاء الجدد مقابل الأعضاء الموجودين (يتم انحياز سلوك الأعضاء الموجودين بسبب التعود على المنتج القديم). كما يذكرون حداً صادقاً: حساسية الاختبار تعتمد على حجم العينة، وقياس دلتا الاحتفاظ الصغيرة يتطلب ملايين الأعضاء لكل خلية.
تصف الورقة أيضاً الحدود التالية: وصف المؤلفون خطط لجعل النظام عالمياً وواعياً باللغة - مجموعة واحدة من الخوارزميات لـ 190+ دول - والتجارب مع الاختبارات القائمة على الفرز لتسريع التكرار.
النتيجة
يتم استخدام نظام التوصيات على معظم شاشات المنتج وبشكل عام يؤثر على الاختيار لحوالي 80% من الساعات المبثة على نتفليكس؛ الـ 20% المتبقية تأتي من البحث. يمكن رؤية تطور الرقم: في عام 2012 استشهدت الشركة علناً بـ 75% - بحلول عام 2015 ارتفعت الحصة إلى 80%. لقياس التأثير على الكتالوج، قدم المؤلفون مقياس حجم الكتالوج الفعلي (ECS): يظهر كم عدد الفيديوهات التي تشكل فعلاً ساعة مشاهدة نموذجية. مع ترتيب PVR الشخصي، حجم الكتالوج الفعلي أكبر بحوالي 4 مرات من ترتيب الشعبية غير المخصص: تنتشر المشاهدة بعيداً عن الضربات إلى المكتبة الواسعة، بما في ذلك العناوين المتخصصة.
الخط السفلي للعمل مذكور في الورقة بحرفية: 'نعتقد أن التأثير المشترك للتخصيص والتوصيات يوفر لنا أكثر من 1 مليار دولار في السنة.' تمتد الآليات من خلال الفقدان: على مدى سنوات من تطوير التخصيص، تم تقليل معدل الفقدان الشهري بعدة نقاط مئوية، مما يرفع LTV للعضو بالتزامن ويقلل الحاجة للاكتساب المكلف لاستبدال من يغادرون. حدود مهمة: هذا تقدير الشركة الخاص ('نعتقد')، المقدم بحجم 65M+ عضو في عام 2015، والمؤلفون لا يكشفون رياضيتها - لا تعطي الورقة النسب المئوية الدقيقة لتقليل الفقدان ولا تكاليف الاكتساب.
في رأينا، يبقى هذا العمل المعيار الذهبي للحديث عن قيمة نظام ML. أولاً، السلسلة 'مقياس النظام → مقياس المنتج → المال' شفافة: ECS ومعدل الأخذ يرتبطان بالمشاركة، والمشاركة بالاحتفاظ، والاحتفاظ بإيرادات الاشتراك. ثانياً، تم نشر تقدير '>1B دولار سنويًا' من قبل المديرين التنفيذيين تحت أسمائهم الخاصة في مجلة محكمة - التزام لا يضاهى بالمقارنة مع بيان صحفي تسويقي مجهول، على الرغم من أن الرقم لا يزال غير قابل للتحقق المستقل.
ملاحظتنا الثانية: الأصل الرئيسي لنتفليكس في هذه الحالة ليس الخوارزميات المحددة (خوارزميات Netflix Prize-era SVD و RBM منذ وقت طويل أصبحت مجرد أجزاء من المجموعة) بل بنية الاختبار والانضباط في المقياس. النظام الذي يحسّن احتفاظاً بأفق أشهر بدلاً من نقرات بأفق الجلسة هو قرار إدارة وليس قرار تقني - ويحكم من الورقة، هذا هو ما حول التوصيات إلى مليار دولار.
الدروس المستفادة
- قياس التوصيات بمقاييس العمل، وليس النقرات: تحسّن نتفليكس الاحتفاظ والمشاركة متوسطة الأجل - ولهذا السبب يمكنها تحديد التأثير بالدولار.
- نظام التوصيات هو مجموعة من الخوارزميات المتخصصة (الترتيب والاتجاهات والتشابه وتجميع الصفحة واختيار الأدلة)، وليس نموذجاً واحداً.
- للمستخدمين ميزانية انتباه - 60-90 ثانية و 10-20 بطاقة عنوان: صمم التجربة لهذا الحد، وليس للتمرير اللانهائي.
- 'حجم الكتالوج الفعلي' هو مقياس عائد محتوى قوي: يوزع التخصيص المشاهدة بشكل متساوٍ 4 مرات أكثر ويسدد تراخيص العناوين المتخصصة.
- تقليل الفقدان بعدة نقاط مئوية في نموذج الاشتراك يحول إلى مليارات: ينمو LTV وتنخفض الحاجة للاكتسابات الجديدة.
- اختبارات احتفاظ A/B تتطلب صبراً وحجماً: تعمل الخلايا 2-6 أشهر، وتتطلب الدلتا الصغيرة ملايين الأعضاء - مقاييس الوكيل السريعة تضلل.
- المديرون التنفيذيون الذين ينشرون المنهجية والأرقام في مجلة محكمة هو حالة نادرة حيث يمكن التحقق من 'الذكاء الاصطناعي يستحق 1B دولار' ضد المصدر الأساسي.
الأسئلة الشائعة
كم تبلغ قيمة نظام التوصيات في نتفليكس؟
في ورقة ACM TMIS، قيّم المديرون التنفيذيون في نتفليكس التأثير المشترك للتخصيص والتوصيات بأكثر من 1B دولار في السنة - بشكل أساسي من خلال تقليل الفقدان (عدة نقاط مئوية على مدار السنوات) وتكاليف اكتساب الاشتراكات المنخفضة. إنه تقدير الشركة الخاص؛ الرياضيات المكونة لها لم تُكشف.
ما هي حصة مشاهدات نتفليكس التي تأتي من التوصيات؟
وفقاً لورقة 2015، يؤثر نظام التوصيات على الاختيار لحوالي 80% من الساعات المبثة؛ الـ 20% المتبقية تأتي من البحث. في عام 2012 استشهدت الشركة بـ 75% - نمت الحصة على مدار الوقت.
ما هو 'حجم الكتالوج الفعلي' في نتفليكس؟
مقياس لكيف تنتشر المشاهدة بشكل متساوٍ: يظهر كم عدد الفيديوهات التي تشكل ساعة مشاهدة نموذجية (من 1 إذا شاهد الجميع ضربة واحدة إلى حجم الكتالوج تحت المشاهدة الموحدة). مع ترتيب PVR الشخصي يكون أعلى بحوالي 4 مرات من ترتيب الشعبية.
ما هي الخوارزميات التي تشكل نظام التوصيات في نتفليكس؟
مجموعة: PVR (الترتيب الشخصي لصفوف الأنواع)، Top-N (أفضل العناوين في الكتالوج)، Trending Now، Continue Watching، sims ('Because You Watched')، Page Generation (تجميع صفحة ~40 صف)، وخوارزميات اختيار الأدلة التي تختار الأعمال الفنية والأدلة الداعمة.
كيف تتحقق نتفليكس من تحسينات الخوارزمية؟
من خلال التجارب في البيانات التاريخية والاختبارات A/B عبر الإنترنت: يتم تخصيص الأعضاء للخلايا مع إصدارات خوارزمية مختلفة لمدة 2-6 أشهر، واتخاذ القرارات بناءً على الاحتفاظ والمشاركة متوسطة الأجل بدلاً من النقرات.