🎧
الإعلام والموسيقى · Spotify

Spotify: منصة تعليق مدعومة بـ LLM — مجموعة بيانات تعليق أكبر بـ 10x مع إنتاجية معلقين 3x

نمت مجموعة التعليق 10x وإنتاجية المعلقين 3x: أتمتة العينات والمراجعة والتغذية الراجعة للنتائج في خطوط الأنابيب أزالت الخطوات اليدوية، بينما أخذت تعليقات LLM معظم الروتين عن الناس. تعمل المنصة عشرات مشاريع التعليق بالتوازي، تخدم حالات استخدام ML و GenAI عبر مجموعة من مئات الملايين من المسارات والحلقات — من اكتشاف العلاقات بين الإصدارات والتنسيب التلقائي للمحتوى إلى تحليل حلقات البودكاست من أجل انتهاكات السياسة. تحديدات مهمة لهذه الأرقام. 'الـ 10x' و'الـ 3x' هي مقاييس Spotify الداخلية بدون تدقيق خارجي، والمنشور لا يفصح عن خط المقارنة: من غير الواضح من أي مجموعة بيانات ابتدائية وعلى أي فترة تم قياس النمو. مراجعة طرف ثالث في قاعدة بيانات حالات LLMOps في ZenML تلاحظ فجوات إضافية: المنشور لا يعطي تفاصيل تقنية عن المطالبات والنهجات القليلة الطلقات أو ضبط LLM الدقيق، وادعاء 'التكلفة المنخفضة' غير محدد — ما إذا كانت البنية الأساسية ووقت هندسة المطالبات والمراقبة المستمرة للجودة مضمنة غير معروف. نقدم الحالة مع هذه التحفظات: اتجاه النتيجة ليس موضع شك؛ خذ المضاعفات الدقيقة كإبلاغ ذاتي. في رأينا، القيمة الرئيسية للحالة هي نمط معماري ينتقل إلى أي صناعة تقريباً: LLM بالإضافة إلى البشر، مرتبط بمتري الاتفاق مع التصعيد التلقائي. هذا أساسياً أكثر موثوقية من 'LLM بدلاً من البشر': النموذج يوفر النطاق، الناس يوفرون المعايرة والتحكيم في حالات الحافة، ومتري الاتفاق يقرر تلقائياً من يجب أن يتعامل مع كل عنصر محدد. حلقة التغذية الراجعة مزدوجة: الحالات المتنازع عليها ليست فقط ترفع جودة التعليق بل تكشف أيضاً حيث تكون خطوط التعليق الإرشادية غامضة. ملاحظتنا الثانية: تتعامل Spotify مع التعليق كمنتج مع فريقه الخاص والأدوات والمقاييس بدلاً من التوظيف لمرة واحدة. في عصر جودة منتج GenAI محدودة ليس بالعمائر بل بمجموعات بيانات التقييم، تصبح منصة التعليق بنية أساسية حرجة مثل خدمة النموذج — وحالة Spotify كانت الأولى من 'البث الكبير' لإظهار هذا علناً.

10x
نمو مجموعة التعليق
3x
إنتاجية المعلق
100M+
المسارات والحلقات في المجموعة (مئات الملايين)
10+
مشاريع التعليق المتوازية (عشرات)
المصادر
تم التحقق: 2026-07-11

السياق

Spotify هي أكبر خدمة بث صوتي، مع مجموعة تضم مئات الملايين من المسارات وحلقات البودكاست. من وجهة نظر التعلم الآلي، هذه المجموعة هي في نفس الوقت أصل وعبء: التوصيات والبحث والتنسيب التلقائي للمحتوى على صفحات الفنان، واكتشاف العلاقات بين الإصدارات، وتعديل البودكاست من أجل انتهاكات السياسة — كل هذا يتطلب نماذج ML يجب أن تغطي المجموعة بأكملها. وأي نموذج، قبل أن يعمل، يحتاج إلى بيانات معنونة — سواء للتدريب أو لتقييم الجودة.

التعليق هو أكثر جزء لا يحظى بالتقدير في خط أنابيب ML. بينما تناقش الصناعة معمارية النماذج، تواجه فرق الإنتاج السؤال العملي: من سيضع ملايين التعليقات على الصوت والفيديو والنص، وبأي سرعة، وبموثوقية عالية. عمقت الذكاء الاصطناعي التوليدي المشكلة مرتين: تقليل دورات تكرار النموذج من أشهر إلى أسابيع، مما جعل التعليق الذي لا يمكنه مواكبة هذا الإيقاع هو العائق الأساسي — بينما جعلت LLMs نفسها، للمرة الأولى، التعليق التلقائي واسع النطاق بجودة مقبولة ممكناً.

في أكتوبر 2024، نشرت فريق منصة التعليق في Spotify — مدير عمليات المنصة Dana Puleo والمهندسان الرئيسيان Meghana Seetharam و Katarzyna Drzyzga — 'كيف وّلدنا ملايين التعليقات على المحتوى' على مدونة الهندسة: كيف قامت الشركة بصناعة التعليق على البيانات بشكل صناعي من خلال الجمع بين الخبرات البشرية المرتبة مع نظام LLM يعمل بالتوازي مع الأشخاص. المنشور جدير بالملاحظة لنوعه: ليس قصة نموذج واحد بل وصف منصة مصنع داخلي تخدم عشرات مشاريع التعليق عبر الموسيقى والبودكاست والكتب الصوتية — مع التركيز على سلامة المجموعة والتعديل.

المشكلة

البيانات المعنونة في Spotify بحجم المجموعة كانت اختناق خط أنابيب ML بأكمله. المحتوى: مئات الملايين من العناصر؛ المهام: عشرات، من تصنيف المحتوى واكتشاف العلاقات بين الإصدارات إلى تحليل حلقات البودكاست من أجل انتهاكات السياسة؛ والتعليق اليدوي بطيء وغالي التكلفة ولا يتسع جيداً. الثنائية الكلاسيكية: توظيف المزيد من المعلقين والتكاليف تنمو خطياً بينما الجودة، في غياب العمليات الراسخة، تنخفض حتى؛ الأتمتة الساذجة وجودة التعليق تصبح غير متنبأ بها — لكن التدريب والتقييم الموضوعي للنموذج يعتمدان عليها.

المشكلة الثانية كانت التجزئة. بنت فرق Spotify المختلفة عمليات التعليق المتناثرة الخاصة بهم: أدواتهم الخاصة وخطوطهم الإرشادية الخاصة وعايير الجودة الخاصة بهم. لم تُعاد استخدام الخبرة، وكانت الجودة غير متساوية، وإطلاق كل مشروع تعليق جديد يعني بناء عملية من الصفر — وهذا بطيء غير مقبول في عصر تطلب فيه النماذج التوليدية مجموعات تقييم طازجة كل بضعة أسابيع.

الطبقة الثالثة خاصة بمنصة الصوت: التعليق على الصوت والفيديو أصعب من النص. يجب على المعلق الاستماع إلى المقاطع ومقارنة إصدارات المسار ومراجعة حلقات البودكاست — الأدوات القياسية لتعليق النص لا تُبنى لهذا. والمخاطر عالية: أخطاء التعليق في مهام سلامة المجموعة والتعديل تتحول مباشرة إلى مخاطر السمعة والتنظيمية للمنصة.

الحل

بنت Spotify منصة تعليق موحدة على ثلاث دعائم: الخبرة البشرية القابلة للتوسع والأدوات المرنة للتعليق والبنية الأساسية المشتركة المدمجة مع خطوط أنابيب ML.

يتم تنظيم الجانب البشري في ثلاث طبقات. المعلقون الأساسيون هم خبراء المجال يقدمون مراجعة المسار الأول لجميع حالات التعليق. محللو الجودة هم خبراء المجال من أعلى مستوى يعملون كنقطة التصعيد لجميع الحالات الغامضة أو المعقدة. مديرو المشاريع يربطون الفريق ويحافظون على مواد التدريب ويديرون حلقة التغذية الراجعة بين عملاء التعليق والمعلقين. يحل الهرم مشكلتين في نفس الوقت: الحجم (التعليق بالمسار الأول رخيص وسريع) والجودة (العناصر المتنازع عليها تتدفق إلى أقوى الخبراء).

بالتوازي مع البشر يعمل نظام تعليق قائم على LLM قابل للتكوين — وهو القرار المعماري الرئيسي للمنصة. النموذج يعلق نفس البيانات مثل الناس؛ يتم حساب اتفاق المعلقين تلقائياً، والعناصر ذات الإجماع المنخفض — بين البشر، أو بين إنسان والنموذج — تتصعد تلقائياً إلى محللي الجودة. بكلمات الفريق، هذا ما سمح Spotify بـ 'نمو كبير في مجموعة بيانات التعليق عالية الجودة بجهد وتكلفة منخفضة': يمتص LLM معظم الروتين بينما تركز الخبرة البشرية النادرة حيث لا يمكن استبدالها.

الأدوات مبنية للأنواع المحتوى الحقيقية: بما يتجاوز الواجهات القياسية لمهام NLP، توفر المنصة واجهات مخصصة لتعليق مقاطع الصوت والفيديو. تُظهر لوحات المشروع في الوقت الفعلي معدلات الإكمال والأحجام والإنتاجية لكل معلق — يتحول التعليق من 'صندوق أسود تم الاستعانة بمصادر خارجية' إلى عملية إنتاج مُدارة مع SLA قابل للقياس.

وأخيراً، طبقة التكامل: تم دمج المنصة في سير عمل ML في Spotify في كل مرحلة — من خلال CLIs و UIs وأنظمة تنسيق الدفعات. لا تجلس نتائج التعليق في جداول بيانات؛ تتدفق تلقائياً إلى خطوط أنابيب التدريب والتقييم، ويتم تكوين مشروع تعليق جديد على بنية أساسية جاهزة بدلاً من بناؤه من الصفر.

النتيجة

نمت مجموعة التعليق 10x وإنتاجية المعلقين 3x: أتمتة العينات والمراجعة والتغذية الراجعة للنتائج في خطوط الأنابيب أزالت الخطوات اليدوية، بينما أخذت تعليقات LLM معظم الروتين عن الناس. تعمل المنصة عشرات مشاريع التعليق بالتوازي، تخدم حالات استخدام ML و GenAI عبر مجموعة من مئات الملايين من المسارات والحلقات — من اكتشاف العلاقات بين الإصدارات والتنسيب التلقائي للمحتوى إلى تحليل حلقات البودكاست من أجل انتهاكات السياسة.

تحديدات مهمة لهذه الأرقام. 'الـ 10x' و'الـ 3x' هي مقاييس Spotify الداخلية بدون تدقيق خارجي، والمنشور لا يفصح عن خط المقارنة: من غير الواضح من أي مجموعة بيانات ابتدائية وعلى أي فترة تم قياس النمو. مراجعة طرف ثالث في قاعدة بيانات حالات LLMOps في ZenML تلاحظ فجوات إضافية: المنشور لا يعطي تفاصيل تقنية عن المطالبات والنهجات القليلة الطلقات أو ضبط LLM الدقيق، وادعاء 'التكلفة المنخفضة' غير محدد — ما إذا كانت البنية الأساسية ووقت هندسة المطالبات والمراقبة المستمرة للجودة مضمنة غير معروف. نقدم الحالة مع هذه التحفظات: اتجاه النتيجة ليس موضع شك؛ خذ المضاعفات الدقيقة كإبلاغ ذاتي.

في رأينا، القيمة الرئيسية للحالة هي نمط معماري ينتقل إلى أي صناعة تقريباً: LLM بالإضافة إلى البشر، مرتبط بمتري الاتفاق مع التصعيد التلقائي. هذا أساسياً أكثر موثوقية من 'LLM بدلاً من البشر': النموذج يوفر النطاق، الناس يوفرون المعايرة والتحكيم في حالات الحافة، ومتري الاتفاق يقرر تلقائياً من يجب أن يتعامل مع كل عنصر محدد. حلقة التغذية الراجعة مزدوجة: الحالات المتنازع عليها ليست فقط ترفع جودة التعليق بل تكشف أيضاً حيث تكون خطوط التعليق الإرشادية غامضة.

ملاحظتنا الثانية: تتعامل Spotify مع التعليق كمنتج مع فريقه الخاص والأدوات والمقاييس بدلاً من التوظيف لمرة واحدة. في عصر جودة منتج GenAI محدودة ليس بالعمائر بل بمجموعات بيانات التقييم، تصبح منصة التعليق بنية أساسية حرجة مثل خدمة النموذج — وحالة Spotify كانت الأولى من 'البث الكبير' لإظهار هذا علناً.

حزمة التقنيات
LLM-разметка параллельно людям (конфигурируемая)3 уровня человеческой экспертизыМетрики согласованности (agreement) + автоэскалацияКастомные интерфейсы для аудио/видео и NLPДашборды продуктивности в реальном времениИнтеграция: CLI, UI, батч-оркестрация
الجدول الزمني
تطورت المنصة بشكل تكراري؛ نقطة البداية كانت عمليات التعليق المجزأة في فرق فردية. ثم التوحيد إلى منصة واحدة: ثلاث طبقات من الخبرة، نظام LLM متوازي مع البشر، واجهات صوت/فيديو مخصصة، التكامل مع خطوط أنابيب التدريب. التقرير العام مع النتائج (مجموعة 10x، إنتاجية 3x، عشرات المشاريع المتوازية) مؤرخ في 21 أكتوبر 2024، بواسطة Dana Puleo و Meghana Seetharam و Katarzyna Drzyzga.

الدروس المستفادة

  1. جودة منتج GenAI تتعطل بسبب البيانات: منصة التعليق هي بنية أساسية حرجة مثل خدمة النموذج وتستحق فريق مخصص.
  2. LLM + البشر يتفوق على LLM بدلاً من البشر: النموذج يعلق بكميات كبيرة، البشر يحلون الحالات المتنازع عليها — التصعيد التلقائي على متري الاتفاق يربطهم في خط أنابيب واحد.
  3. ثلاث طبقات من الخبرة (المعلق → محلل الجودة → مدير المشروع) توسع الحجم والجودة في نفس الوقت.
  4. منصة مركزية مع أدوات قابلة لإعادة الاستخدام تفوق عشرات العمليات المحلية: مشاريع التعليق الجديدة يتم تكوينها على بنية أساسية جاهزة.
  5. يجب أن تطابق الأدوات نوع المحتوى: الصوت والفيديو يحتاجان واجهات تعليق مبنية بهدف محدد، وليس أدوات نص مكيفة.
  6. المقاييس في الوقت الفعلي (الحجم والإنتاجية والاتفاق) تحول التعليق من صندوق أسود إلى عملية إنتاج مُدارة.
  7. اقرأ المضاعفات بشكل نقدي: 'الـ 10x' و'الـ 3x' هي أرقام داخلية بدون خط أساس مفصح؛ المراجعات الطرفية الثالثة (ZenML) تلاحظ تفاصيل مفقودة عن المطالبات والمحاسبة الكاملة للتكلفة.

الأسئلة الشائعة

ماذا أعطت منصة تعليق LLM إلى Spotify؟

مجموعة تعليق أكبر بـ 10x مع إنتاجية معلقين 3x — بفضل تعليق LLM يعمل بالتوازي مع البشر وأتمتة خط الأنابيب بأكمله من العينات إلى التغذية الراجعة للبيانات في التدريب. تعمل المنصة عشرات مشاريع التعليق في نفس الوقت.

هل استبدلت LLMs المعلقين البشريين في Spotify؟

لا: نظام LLM القابل للتكوين يعمل بالتوازي مع الخبراء. يتم حساب الاتفاق تلقائياً، والعناصر بدون إجماع واضح تتصعد إلى محللي الجودة — يركز البشر على الحالات الصعبة والغامضة.

كيف يتم تنظيم الجانب البشري من المنصة؟

ثلاث طبقات: المعلقون الأساسيون (خبراء المجال، مراجعة المسار الأول لجميع الحالات)، محللو الجودة (خبراء المستوى الأعلى — نقطة التصعيد للحالات المتنازع عليها)، ومديرو المشاريع (اتصال الفريق، مواد التدريب، حلقات التغذية الراجعة).

ما المهام التي تستخدم Spotify هذه التعليقات لها؟

مهام ML و GenAI عبر المجموعة: اكتشاف العلاقات بين الإصدارات، التنسيب التلقائي للمسارات والألبومات على صفحات الفنان، تحليل حلقات البودكاست من أجل انتهاكات السياسة، بالإضافة إلى التدريب وتقييم النماذج عبر الموسيقى والبودكاست والكتب الصوتية.

ما موثوقية أرقام الـ 10x والـ 3x؟

هي مقاييس Spotify الداخلية من مدونة الهندسة — بدون تدقيق خارجي وبدون خط أساس مفصح. تلاحظ مراجعة ZenML الطرفية الثالثة أن المنشور لا يفصل هندسة المطالبات أو إجمالي تكلفة الملكية. اتجاه التأثير ليس موضع شك؛ اقرأ المضاعفات الدقيقة كإبلاغ ذاتي.

← حالات