Spotify: una plataforma de anotación potenciada por LLM — un corpus de etiquetado 10x más grande con productividad de anotadores 3x
El corpus de anotaciones creció 10x y la productividad del anotador 3x: automatizar el muestreo, el servicio de revisión y devolver resultados a canalizaciones de entrenamiento eliminó los pasos manuales, mientras que el etiquetado LLM quitó la rutina masiva de las personas. La plataforma ejecuta docenas de proyectos de etiquetado en paralelo, sirviendo casos de uso ML y GenAI en un catálogo de cientos de millones de pistas y episodios — desde detección de relaciones de lanzamientos y colocación automática de contenido hasta análisis de podcasts por violaciones de política. Límites importantes en estos números. El '10x' y '3x' son métricas internas de Spotify sin auditoría externa, y la publicación no divulga la base de comparación: no está claro desde qué corpus inicial y en qué período se midió el crecimiento. Una revisión de terceros en la base de datos de casos de LLMOps de ZenML señala más brechas: la publicación no proporciona detalles técnicos sobre indicaciones, enfoques de pocos ejemplos o ajuste fino de LLM, y la afirmación de 'bajo costo' no está desglosada — si la infraestructura, el tiempo de ingeniería de indicaciones y el monitoreo continuo de calidad están incluidos es desconocido. Presentamos el caso con estas salvedades: la dirección del resultado no está en duda; toma los multiplicadores exactos como autorreporte. En nuestra opinión, el valor principal del caso es un patrón arquitectónico que se transfiere a prácticamente cualquier industria: LLM más humanos, vinculados por una métrica de acuerdo con escalada automática. Esto es fundamentalmente más confiable que 'LLM en lugar de humanos': el modelo proporciona escala, las personas proporcionan calibración y adjudicación de casos límite, y la métrica de acuerdo decide automáticamente quién debe manejar cada elemento específico. El ciclo de retroalimentación es doble: los casos controvertidos no solo elevan la calidad de las etiquetas sino que también revelan dónde las directrices de etiquetado son ambiguas. Nuestra segunda observación: Spotify trata el etiquetado como un producto con su propio equipo, herramientas y métricas en lugar de una compra única. En una era en la que la calidad del modelo generativo está limitada no por arquitecturas sino por conjuntos de datos de evaluación, una plataforma de anotación se convierte en infraestructura tan crítica como el servicio de modelos — y el caso de Spotify fue el primero de 'big streaming' en mostrarlo públicamente.
- How We Generated Millions of Content Annotations — Spotify Engineering (Puleo, Seetharam, Drzyzga), 2024-10-21
- Spotify: Scaling ML Annotation Platform with LLMs for Content Classification (сторонний критический разбор) — ZenML LLMOps Database
Contexto
Spotify es el servicio de transmisión de audio más grande, con un catálogo de cientos de millones de pistas y episodios de podcast. Desde una perspectiva de aprendizaje automático, ese catálogo es tanto un activo como un pasivo: recomendaciones, búsqueda, colocación automática de contenido en páginas de artistas, detección de relaciones entre lanzamientos y moderación de podcasts por violaciones de política — todos estos son modelos ML que deben cubrir todo el catálogo. Y cualquier modelo, antes de poder funcionar, necesita datos etiquetados — tanto para entrenamiento como para evaluación de calidad.
El etiquetado es la parte más subestimada de la canalización ML. Mientras que la industria debate arquitecturas de modelos, los equipos de producción enfrentan la pregunta prosaica: quién pondrá millones de etiquetas en audio, video y texto, qué tan rápido y qué tan confiablemente. La IA generativa agudizó el problema dos veces: los ciclos de iteración del modelo se redujeron de meses a semanas, haciendo que el etiquetado que no pueda seguir el ritmo sea el freno principal — mientras que los LLMs, por primera vez, hicieron posible el etiquetado automático a gran escala de calidad aceptable.
En octubre de 2024, el equipo de plataforma de anotaciones de Spotify — la gerente de operaciones de plataforma Dana Puleo e ingenieras de personal Meghana Seetharam y Katarzyna Drzyzga — publicaron 'How We Generated Millions of Content Annotations' en el blog de ingeniería: cómo la empresa industrializó el etiquetado de datos combinando experiencia humana estratificada con un sistema LLM ejecutándose en paralelo con personas. La publicación es notable por su género: no la historia de un modelo sino una descripción de una plataforma de fábrica interna que sirve docenas de proyectos de etiquetado en los verticales de Música, Podcasts y Audiolibros — con énfasis en seguridad y moderación del catálogo.
Problema
El etiquetado de datos en la escala del catálogo de Spotify fue el cuello de botella de toda la canalización ML. Contenido: cientos de millones de elementos; tareas: docenas, desde clasificación de contenido y detección de relaciones de lanzamientos hasta análisis de episodios de podcast por violaciones de política; y la anotación manual es lenta, cara y se escala mal. El dilema clásico: contratar más anotadores y los costos crecen linealmente mientras que la calidad, sin procesos sólidos, incluso cae; automatizar ingenuamente y la calidad de las etiquetas se vuelve impredecible — sin embargo, tanto el entrenamiento como la evaluación honesta del modelo dependen de esto.
El segundo problema fue la fragmentación. Diferentes equipos de Spotify construyeron sus propios procesos de anotación dispersos: sus propias herramientas, sus propias directrices, sus propios criterios de calidad. La experiencia no se reutilizaba, la calidad era desigual, y lanzar cada nuevo proyecto de etiquetado significaba construir un proceso desde cero — inaceptablemente lento para una era en la que los modelos generativos demandan nuevos conjuntos de datos de evaluación cada pocas semanas.
La tercera capa es específica de una plataforma de audio: etiquetar sonido y video es más difícil que texto. Un anotador debe escuchar segmentos, comparar versiones de pistas, revisar episodios de podcast — las herramientas estándar de etiquetado de texto no están diseñadas para eso. Y las apuestas son altas: los errores de etiquetado en tareas de seguridad del catálogo y moderación se convierten directamente en riesgos reputacionales y regulatorios para la plataforma.
Solución
Spotify construyó una plataforma de anotación unificada sobre tres pilares: experiencia humana escalable, herramientas de anotación flexibles e infraestructura compartida integrada con canalizaciones ML.
El lado humano está organizado en tres niveles. Los anotadores centrales son expertos de dominio que proporcionan revisión de primera pasada de todos los casos de anotación. Los analistas de calidad son expertos de dominio de nivel superior que actúan como punto de escalada para todos los casos ambiguos o complejos. Los gerentes de proyecto conectan los equipos, mantienen materiales de capacitación y ejecutan el ciclo de retroalimentación entre clientes de etiquetado y anotadores. La pirámide resuelve dos problemas a la vez: volumen (el etiquetado de primera pasada es barato y rápido) y calidad (los elementos controvertidos fluyen hacia los expertos más fuertes).
En paralelo con los humanos funciona un sistema de etiquetado basado en LLM configurable — la decisión arquitectónica clave de la plataforma. El modelo etiqueta los mismos datos que las personas; el acuerdo entre anotadores se calcula automáticamente, y los elementos con bajo consenso — entre humanos, o entre un humano y el modelo — se escalan automáticamente a analistas de calidad. En palabras del equipo, esto es lo que permitió a Spotify 'aumentar significativamente nuestro corpus de datos de anotación de alta calidad con bajo esfuerzo y costo': el LLM absorbe la rutina masiva mientras que la experiencia humana escasa se concentra donde es irreemplazable.
Las herramientas están diseñadas para tipos de contenido reales: más allá de interfaces estándar para tareas NLP, la plataforma proporciona interfaces personalizadas para anotar segmentos de audio y video. Los paneles de control del proyecto en tiempo real muestran tasas de finalización, volúmenes y productividad por anotador — el etiquetado se convierte de una 'caja negra subcontratada' en un proceso de producción gestionado con un SLA medible.
Finalmente, la capa de integración: la plataforma se integra en los flujos de trabajo ML de Spotify en cada etapa — a través de CLIs, interfaces de usuario y sistemas de orquestación por lotes. Los resultados del etiquetado no se quedan en hojas de cálculo; fluyen automáticamente de vuelta a canalizaciones de entrenamiento y evaluación de modelos, y un nuevo proyecto de etiquetado se configura sobre infraestructura lista en lugar de construirse desde cero.
Resultado
El corpus de anotaciones creció 10x y la productividad del anotador 3x: automatizar el muestreo, el servicio de revisión y devolver resultados a canalizaciones de entrenamiento eliminó los pasos manuales, mientras que el etiquetado LLM quitó la rutina masiva de las personas. La plataforma ejecuta docenas de proyectos de etiquetado en paralelo, sirviendo casos de uso ML y GenAI en un catálogo de cientos de millones de pistas y episodios — desde detección de relaciones de lanzamientos y colocación automática de contenido hasta análisis de podcasts por violaciones de política.
Límites importantes en estos números. El '10x' y '3x' son métricas internas de Spotify sin auditoría externa, y la publicación no divulga la base de comparación: no está claro desde qué corpus inicial y en qué período se midió el crecimiento. Una revisión de terceros en la base de datos de casos de LLMOps de ZenML señala más brechas: la publicación no proporciona detalles técnicos sobre indicaciones, enfoques de pocos ejemplos o ajuste fino de LLM, y la afirmación de 'bajo costo' no está desglosada — si la infraestructura, el tiempo de ingeniería de indicaciones y el monitoreo continuo de calidad están incluidos es desconocido. Presentamos el caso con estas salvedades: la dirección del resultado no está en duda; toma los multiplicadores exactos como autorreporte.
En nuestra opinión, el valor principal del caso es un patrón arquitectónico que se transfiere a prácticamente cualquier industria: LLM más humanos, vinculados por una métrica de acuerdo con escalada automática. Esto es fundamentalmente más confiable que 'LLM en lugar de humanos': el modelo proporciona escala, las personas proporcionan calibración y adjudicación de casos límite, y la métrica de acuerdo decide automáticamente quién debe manejar cada elemento específico. El ciclo de retroalimentación es doble: los casos controvertidos no solo elevan la calidad de las etiquetas sino que también revelan dónde las directrices de etiquetado son ambiguas.
Nuestra segunda observación: Spotify trata el etiquetado como un producto con su propio equipo, herramientas y métricas en lugar de una compra única. En una era en la que la calidad del modelo generativo está limitada no por arquitecturas sino por conjuntos de datos de evaluación, una plataforma de anotación se convierte en infraestructura tan crítica como el servicio de modelos — y el caso de Spotify fue el primero de 'big streaming' en mostrarlo públicamente.
Lecciones aprendidas
- La calidad del producto GenAI tiene un cuello de botella en datos: una plataforma de anotación es infraestructura tan crítica como el servicio de modelos y merece un equipo dedicado.
- LLM + humanos supera LLM en lugar de humanos: el modelo etiqueta en masa, los humanos resuelven casos controvertidos — la escalada automática en métricas de acuerdo los vincula en una canalización.
- Tres niveles de experiencia (anotador → analista de calidad → gerente de proyecto) escalan volumen y calidad al mismo tiempo.
- Una plataforma central con herramientas reutilizables supera docenas de procesos caseros: nuevos proyectos de etiquetado se configuran sobre infraestructura lista.
- Las herramientas deben coincidir con el tipo de contenido: audio y video necesitan interfaces de anotación diseñadas para el propósito, no herramientas de texto adaptadas.
- Las métricas en tiempo real (volumen, rendimiento, acuerdo) convierten el etiquetado de una caja negra en un proceso de producción gestionado.
- Lee los multiplicadores críticamente: '10x' y '3x' son cifras internas sin línea base divulgada; las revisiones de terceros (ZenML) señalan detalles faltantes sobre indicaciones y contabilidad de costos completos.
Preguntas frecuentes
¿Qué le dio la plataforma de anotación LLM a Spotify?
Un corpus de anotación 10x más grande con productividad de anotadores 3x — gracias al etiquetado LLM ejecutándose en paralelo con humanos y automatización de toda la canalización desde muestreo hasta devolver datos al entrenamiento. La plataforma ejecuta docenas de proyectos de etiquetado simultáneamente.
¿Los LLMs reemplazaron a los anotadores humanos en Spotify?
No: el sistema LLM configurable funciona en paralelo con expertos. El acuerdo se calcula automáticamente, y los elementos sin consenso claro se escalan a analistas de calidad — los humanos se enfocan en los casos difíciles y ambiguos.
¿Cómo está organizado el lado humano de la plataforma?
Tres niveles: anotadores centrales (expertos de dominio, revisión de primera pasada de todos los casos), analistas de calidad (expertos de nivel superior — el punto de escalada para casos controvertidos) y gerentes de proyecto (enlace de equipo, materiales de capacitación, ciclos de retroalimentación).
¿Para qué tareas usa Spotify estas anotaciones?
Tareas ML y GenAI en todo el catálogo: detección de relaciones entre lanzamientos, colocación automática de pistas/álbumes en páginas de artistas, análisis de episodios de podcast por violaciones de política, además de entrenamiento y evaluación de modelos en música, podcasts y audiolibros.
¿Cuán confiables son las cifras 10x y 3x?
Son métricas internas de Spotify del blog de ingeniería — sin auditoría externa y sin línea base divulgada. La revisión de terceros de ZenML señala que la publicación no detalla ingeniería de indicaciones o costo total de propiedad. La dirección del efecto no está en duda; lee los multiplicadores exactos como autorreporte.