Pinterest: تضمين واحد بدلاً من ثلاثة — زيادة +46.7% في إعادات التثبيت في Lens وثلث أنظمة ML للمحافظة عليها
في التقييمات غير المتصلة بالحكم البشري، رفع التضمين الموحد precision@5 بمقدار +22.2% لـ Flashlight، +110.1% لـ Lens، و +72.1% لـ Shop-the-Look مقابل النماذج المتخصصة. حققت أصعب مجال أكبر مكاسب — Lens: التدريب متعدد المهام على بيانات مختلطة وفّر بالضبط التعميم الذي افتقرت إليه صور الكاميرا. تُظهر الورقة أيضاً الانحراف بصراحة: داخل Shop the Look، تتراوح النتائج لكل فئة من −33.3% إلى +249.7% — الفوز في المتوسط لا يعني الفوز في كل مكان. أكّد اختبار A/B العبر الإنترنت في Lens الصورة غير المتصلة برفع في كل مقياس منتج: إعادات تثبيت +46.7%، نسب النقر +35.0%، المشاهدات القريبة +32.7%، ميل المشاركين +16.3% إلى +26.7%. النتيجة التشغيلية: بدلاً من ثلاثة نماذج وثلاث خطوط أنابيب تدريب وثلاث بنى استرجاع، يحافظ الفريق على واحد؛ تنص الورقة مباشرة على أن نشر التضمين الموحد 'قلل بشكل كبير من تكلفة التشغيل والهندسة' — مع تحسين الجودة. في رأينا، الدرس الأساسي للحالة معاكس للحدس: عادة ما يُنظر إلى توحيد النموذج على أنه مقايضة 'أبسط لكن أسوأ'، إلا أن النموذج العالمي في Pinterest تفوق على المتخصصين في مهامهم الخاصة. تتبع الميكانيكا نظرية ML — التعلم متعدد المهام يعمل كتنظيم، وبيانات منتج واحد تصبح توسيعاً لآخر — إلا أن حجم التأثير (+110% في Lens) كان ممكناً لأن المهام ثبت أنها مترابطة بدرجة كافية والمجال الأضعف تلقى أكثر البيانات 'الأجنبية'. لن نعمم 'تضمين واحد هو الأفضل دائماً' على أي مجموعة مهام: انتشار نتائج فئة Shop the Look يوضح السبب. ملاحظتنا الثانية: هذه الحالة تتعلق باقتصاديات منصات ML، وليس فقط الجودة. مع 600+ مليون بحث بصري شهرياً، كل نموذج إضافي يعني إعادة فهرسة مليارات الصور والخدمة المكررة؛ أسطول أصغر بثلث السرعة يسرع كل تكرار لاحق. توحيد البنية التحتية هو أحد تلك الاستثمارات النادرة التي تقلل التكاليف وترفع سرعة الفريق في نفس الوقت؛ نلاحظ فقط أن الأرقام العبر الإنترنت تُنشر لـ Lens وحده، وجميع النتائج هي تقرير ذاتي من الشركة.
- Learning a Unified Embedding for Visual Search at Pinterest (KDD 2019) — Pinterest / arXiv (Zhai et al.), 2019-08-05
- Unifying visual embeddings for visual search at Pinterest — Pinterest Engineering Blog (Andrew Zhai), 2019-08-08
- Visual Discovery at Pinterest (история продуктов: Related Pins 2014, Similar Looks 2015, Flashlight 2016, Lens 2017) — Pinterest / arXiv (Zhai, Kislyuk et al.), 2017-02-15
السياق
Pinterest هي منصة لا يُعتبر البحث البصري فيها ميزة بل جوهر المنتج: يأتي المستخدمون للعثور على أفكار غالباً ما تفتقر إلى أي وصف لفظي. بنت الشركة هذه الإمكانية على مدار السنين: Related Pins (2014)، Similar Looks (2015)، Flashlight (2016) — البحث عن العناصر المشابهة داخل أي pin، Lens (2017) — البحث بواسطة صورة من كاميرا الهاتف، وفي 2019 Shop the Look الآلي، الذي يعثر على منتجات محددة داخل مشهد أو مجموعة ملابس. في وقت دراسة الحالة، كانت المنصة تضم 250+ مليون مستخدم نشط شهرياً، ومجموعة من 200+ مليار 'فكرة'، والبحث البصري يخدم أكثر من 10 منتجات عملاء داخليين. قدّر الفريق نفسه حجم الاستعلام بـ 600+ مليون بحث بصري شهرياً في ورقة KDD 2019 (المنشور المصاحب أكثر حذراً: 'مئات الملايين').
الجانب السلبي لهذا التطور هو الديون التقنية النموذجية للمنظمات ML سريعة النمو. أطلق كل منتج جديد مع نموذج تضمين متخصص خاص به: القاطع البصري من 2015 عمل على Caffe و VGG16، بينما Shop the Look من 2018 استخدم PyTorch و SE-ResNeXt. تباعدت المكدسات ومجموعات البيانات وفضاءات المتجهات؛ كان من الأسهل للفرق إطلاق نموذج متخصص آخر بدلاً من تحسين نموذج مشترك — وحافظ أسطول التضمينات المتخصصة على النمو.
وصف فريق البحث البصري بقيادة Andrew Zhai الحل في 'Learning a Unified Embedding for Visual Search at Pinterest'، المقبولة في KDD 2019، وفي منشور هندسي. وهي واحدة من أولى المنشورات المفصلة حول دمج عدة تضمينات إنتاجية في تضمين عالمي واحد — مع الأرقام الكاملة للتجارب غير المتصلة والعبر الإنترنت.
المشكلة
ثلاثة منتجات بحث بصري — Flashlight و Lens و Shop the Look — كانت تعمل على ثلاث تضمينات متخصصة منفصلة، مما يعني تكاليف مضاعفة ثلاث مرات على طول السلسلة كاملة. كان يجب تدريب كل نموذج وإصداره بشكل منفصل؛ كل واحد يحتاج إلى بنية استرجاع وتخزين خاصة به؛ والأهم من ذلك، كل تحديث لأي نموذج يتطلب إعادة فهرسة مليارات الصور الكتالوجية في فضاء المتجهات لهذا النموذج. نمت تكاليف التخزين والخدمة خطياً مع عدد النماذج بينما انخفضت سرعة التكرار: أمضى الفريق الموارد في الحفاظ على حديقة حيوانات بدلاً من تحسين الجودة.
كانت هناك مشكلة أعمق أيضاً: التحسينات لم تنتقل. التقدم في نموذج Flashlight لم يفعل شيئاً لـ Lens والعكس صحيح — ظلت المعرفة المكتسبة في منتج واحد مقفلة في تضمينه. إلا أن المهام مختلفة حقاً، وهو ما برّر التخصص الأصلي. يعثر Flashlight على عناصر مشابهة بين صور الكتالوج 'النظيفة' باستخدام إشارات المشاركة. Lens مشكلة أصعب بكثير: يجب أن تطابق صورة كاميرا — مع الإضاءة المنزلية والزوايا التعسفية والضوضاء — مقابل المجال الكتالوجي؛ تحول مجال كلاسيكي. يتطلب Shop the Look دقة على مستوى المنتج: ابحث عن ليس 'كرسي مشابه' بل هذا النموذج المحدد.
السؤال الذي حاول الفريق الإجابة عليه: هل يمكن لتضمين عالمي واحد، مدرب على جميع مهام المنتجات الثلاثة في نفس الوقت، أن يطابق النماذج المتخصصة — أم أن انخفاض الجودة هو السعر الحتمي للبساطة التشغيلية؟
الحل
قام الفريق بتدريب تضمين عالمي واحد مع التعلم متعدد المهام المقياسي. الأساس هو شبكة ملتفة SE-ResNeXt101 مدربة مسبقاً على ImageNet؛ فوق الجذع المشترك تجلس فروع لكل مهمة: طبقة متصلة بالكامل وخسارة تصنيف softmax. دار التدريب بشكل متزامن على مجموعات بيانات جميع المنتجات الثلاثة: 800K صورة Flashlight (15K فئة دلالية مجمعة من إشارات المشاركة)، 540K صورة Lens (2K فئة مسمّاة يدوياً، مجالات مختلطة — من صور الكتالوج إلى صور الكاميرا)، و 340K صورة Shop the Look (189 فئة منتج زائد 50K تسمية instance لعناصر محددة).
مكنت وحدتا هندسة تطبيقيتان النظام من الاستخدام العملي بمقياس Pinterest. وحدة subsampling سمحت بتدريب التصنيف على عشرات آلاف الفئات بالاحتفاظ بالبنك الوسيط على CPU وتحميل فقط المجموعة المطلوبة إلى ذاكرة GPU. وحدة binarization (مع GroupNorm يحل محل LayerNorm، الذي أثبت أنه حاسم لتوافق متعدد المهام) تضغط المتجه إلى رمز ثنائي — وهي التضمينات الثنائية التي تُشحن للإنتاج، مما يقلل بشكل كبير من تكاليف التخزين وكمون البحث عبر مليارات الصور. البنية التحتية للتدريب هي PyTorch DistributedDataParallel مع دقة مختلطة (FP16, Apex): عملية نموذجية هي 9 حقب على ثماني وحدات Tesla V100، SGD مع الزخم 0.9.
الفوز الرئيسي للمنتج من معمارية النظام: يخدم متجه واحد جميع سيناريوهات البحث من خلال بنية استرجاع مشتركة. إعادة فهرسة واحدة للكتالوج بدلاً من ثلاث؛ تحسين نموذج واحد يصل تلقائياً إلى كل منتج و 10+ عملاء داخليين للبحث البصري.
تشغيل التحقق على مستويين. غير متصل — كل من المقاييس الآلية على التضمينات الثنائية (على سبيل المثال، ارتفعت دقة Shop the Look precision@1 من 33.0% مع النموذج المتخصص إلى 52.8% مع النموذج الموحد) والأحكام ذات الصلة البشرية على الاستعلامات الحقيقية. عبر الإنترنت — اختبار A/B في Lens، المجال الأصعب: قياس إعادات التثبيت، نسب النقر، المشاهدات القريبة، وميل المشاركين.
النتيجة
في التقييمات غير المتصلة بالحكم البشري، رفع التضمين الموحد precision@5 بمقدار +22.2% لـ Flashlight، +110.1% لـ Lens، و +72.1% لـ Shop-the-Look مقابل النماذج المتخصصة. حققت أصعب مجال أكبر مكاسب — Lens: التدريب متعدد المهام على بيانات مختلطة وفّر بالضبط التعميم الذي افتقرت إليه صور الكاميرا. تُظهر الورقة أيضاً الانحراف بصراحة: داخل Shop the Look، تتراوح النتائج لكل فئة من −33.3% إلى +249.7% — الفوز في المتوسط لا يعني الفوز في كل مكان.
أكّد اختبار A/B العبر الإنترنت في Lens الصورة غير المتصلة برفع في كل مقياس منتج: إعادات تثبيت +46.7%، نسب النقر +35.0%، المشاهدات القريبة +32.7%، ميل المشاركين +16.3% إلى +26.7%. النتيجة التشغيلية: بدلاً من ثلاثة نماذج وثلاث خطوط أنابيب تدريب وثلاث بنى استرجاع، يحافظ الفريق على واحد؛ تنص الورقة مباشرة على أن نشر التضمين الموحد 'قلل بشكل كبير من تكلفة التشغيل والهندسة' — مع تحسين الجودة.
في رأينا، الدرس الأساسي للحالة معاكس للحدس: عادة ما يُنظر إلى توحيد النموذج على أنه مقايضة 'أبسط لكن أسوأ'، إلا أن النموذج العالمي في Pinterest تفوق على المتخصصين في مهامهم الخاصة. تتبع الميكانيكا نظرية ML — التعلم متعدد المهام يعمل كتنظيم، وبيانات منتج واحد تصبح توسيعاً لآخر — إلا أن حجم التأثير (+110% في Lens) كان ممكناً لأن المهام ثبت أنها مترابطة بدرجة كافية والمجال الأضعف تلقى أكثر البيانات 'الأجنبية'. لن نعمم 'تضمين واحد هو الأفضل دائماً' على أي مجموعة مهام: انتشار نتائج فئة Shop the Look يوضح السبب.
ملاحظتنا الثانية: هذه الحالة تتعلق باقتصاديات منصات ML، وليس فقط الجودة. مع 600+ مليون بحث بصري شهرياً، كل نموذج إضافي يعني إعادة فهرسة مليارات الصور والخدمة المكررة؛ أسطول أصغر بثلث السرعة يسرع كل تكرار لاحق. توحيد البنية التحتية هو أحد تلك الاستثمارات النادرة التي تقلل التكاليف وترفع سرعة الفريق في نفس الوقت؛ نلاحظ فقط أن الأرقام العبر الإنترنت تُنشر لـ Lens وحده، وجميع النتائج هي تقرير ذاتي من الشركة.
الدروس المستفادة
- توحيد النموذج هو جودة واقتصاديات معاً: تضمين واحد متعدد المهام تفوق على ثلاثة متخصصة في الصلة وقلل البنية التحتية المُحتفظ بها إلى الثلث.
- التعلم متعدد المهام يعمل كتنظيم: بيانات منتج واحد تحسّن البقية — المجال الأصعب حقق أكبر مكاسب (Lens، +110% precision@5).
- انظر إلى التباين وليس فقط المتوسط: داخل Shop the Look، نتائج الفئة تتراوح من −33.3% إلى +249.7%؛ الفوز في المتوسط لا يضمن الفوز في كل قطاع.
- تحقق من الاثنين غير متصل (الحكام البشريون) وعبر الإنترنت (A/B): في Pinterest تم تأكيد مكاسب الدقة من خلال ارتفاعات في كل مقياس مشاركة.
- binarization التضمين هو رافعة اقتصادية مقدرة بأقل من قيمتها: الأكواد الثنائية تقلل بشكل حاد من تكاليف التخزين والبحث عبر مليارات الصور؛ الشيطان في التفاصيل (GroupNorm بدلاً من LayerNorm).
- النماذج الأقل تعني تكرارات أسرع: تحسين تضمين واحد يرقي تلقائياً كل منتج بحث بصري و 10+ عملاء داخليين في نفس الوقت.
- يؤتي التوحيد ثماره بالمقياس: مع 600M+ عملية بحث بصري شهرياً، كل عملية إعادة فهرسة وكل نموذج إضافي مكلف.
الأسئلة الشائعة
ماذا اكتسبت Pinterest من تضمين بصري موحد واحد؟
مكاسب جودة عبر جميع منتجات البحث البصري الثلاثة (precision@5: +22% Flashlight، +110% Lens، +72% Shop-the-Look)، رفع المشاركة في اختبار Lens A/B (+46.7% إعادات تثبيت، +35% نسب نقر)، وتكاليف بنية تحتية أقل بكثير — نموذج واحد بدلاً من ثلاثة.
كيف قامت Pinterest بتدريب تضمين واحد لثلاثة منتجات مختلفة؟
من خلال التعلم المقياسي متعدد المهام: شبكة SE-ResNeXt101 بجذع مشترك وفروع لكل مهمة تتدرب بشكل متزامن على Flashlight (800K صورة، 15K فئة)، Lens (540K، 2K فئة)، و Shop-the-Look (340K، 189 فئة + 50K تسمية instance)، مما يشكل فضاء متجهاً واحداً.
لماذا تفوق النموذج العالمي على المتخصصين؟
التعلم متعدد المهام يعمل كتنظيم: بيانات كل منتج تصبح إشارة إضافية للآخرين. حقق المجال الأصعب أكبر مكاسب — Lens (+110% precision@5)، حيث افتقرت صور الكاميرا إلى تنوع بيانات التدريب.
كيف يعمل تضمين واحد بمقياس مليارات الصور؟
يستخدم الإنتاج متجهات ثنائية (وحدة binarization مع GroupNorm)، التي تقلل بشكل حاد من تكاليف التخزين وتسرع البحث، بينما تمكّن وحدة subsampling مع بنك وسيط على جانب CPU من تدريب التصنيف على عشرات آلاف الفئات على ثماني وحدات Tesla V100.
ما هو مقياس البحث البصري في Pinterest؟
وفقاً لورقة KDD 2019 — أكثر من 600 مليون بحث بصري شهرياً عبر 250+ مليون مستخدم نشط شهرياً ومجموعة من 200+ مليار pin؛ وضع المنشور الهندسي أكثر حذراً 'مئات الملايين' من عمليات البحث شهرياً.