🎧
Media & Music · Spotify

Spotify: платформа аннотаций с LLM — корпус разметки вырос в 10 раз при росте продуктивности аннотаторов втрое

Корпус аннотаций вырос в 10 раз, продуктивность аннотаторов — в 3 раза: автоматизация сэмплирования, подачи данных на проверку и возврата результатов в обучающие пайплайны убрала ручные шаги, а LLM-разметка сняла с людей массовую рутину. Платформа ведёт десятки проектов разметки параллельно, обслуживая ML- и GenAI-задачи по каталогу из сотен миллионов треков и эпизодов — от детекции связей между релизами и автоматической раскладки контента до анализа подкастов на нарушения политик. Важные рамки этих цифр. «10x» и «3x» — внутренние метрики Spotify без внешнего аудита, и пост не раскрывает базу сравнения: неясно, от какого исходного корпуса и за какой период считался рост. Сторонний разбор в базе LLMOps-кейсов ZenML отмечает и другие пробелы: в посте нет технических деталей о промптах, few-shot-подходах или дообучении LLM, а заявление о «низких затратах» не расшифровано — неизвестно, учтены ли инфраструктура, время на промпт-инжиниринг и постоянный мониторинг качества. Мы приводим кейс с этими оговорками: направление результата сомнений не вызывает, точные множители — принимайте как самоотчёт. На наш взгляд, главная ценность кейса — в архитектурном паттерне, который переносится практически в любую индустрию: LLM плюс люди, связанные метрикой согласованности с автоматической эскалацией. Это принципиально надёжнее, чем «LLM вместо людей»: модель даёт масштаб, люди — калибровку и разбор пограничных случаев, а метрика agreement автоматически решает, кому доверить каждый конкретный пример. Обратная петля здесь двойная: спорные кейсы не только повышают качество меток, но и показывают, где гайдлайны разметки неоднозначны. Второе наше наблюдение: Spotify относится к разметке как к продукту с собственной командой, инструментарием и метриками, а не как к разовой закупке. В эпоху, когда качество генеративных моделей упирается не в архитектуры, а в оценочные датасеты, платформа аннотаций становится такой же критичной инфраструктурой, как сервинг моделей, — и кейс Spotify первым из «большого стриминга» показал это публично.

10x
рост корпуса аннотаций
3x
продуктивность аннотаторов
100M+
треков и эпизодов в каталоге (сотни млн)
10+
проектов разметки параллельно (десятки)
Источники
Проверено: 2026-07-11

Контекст

Spotify — крупнейший аудиостриминг с каталогом из сотен миллионов треков и эпизодов подкастов. С точки зрения машинного обучения такой каталог — одновременно актив и обязательство: рекомендации, поиск, автоматическая раскладка контента по страницам артистов, детекция связей между релизами и модерация подкастов на нарушения политик — всё это ML-модели, которым нужно покрывать каталог целиком. А любой модели, прежде чем работать, нужны размеченные данные — и для обучения, и для оценки качества.

Разметка — самая недооценённая часть ML-конвейера. Пока индустрия обсуждает архитектуры моделей, продакшен-команды упираются в прозаичное: кто, как быстро и насколько надёжно проставит миллионы меток на аудио, видео и текстах. С приходом генеративного ИИ проблема обострилась вдвойне: циклы итераций моделей сократились с месяцев до недель, и разметка, не успевающая за этим темпом, стала главным тормозом; одновременно сами LLM впервые сделали возможной масштабную автоматическую разметку приемлемого качества.

В октябре 2024 года команда платформы аннотаций Spotify — операционный менеджер платформы Дана Пулео и staff-инженеры Мегана Ситхарам и Катажина Джижга — опубликовала в инженерном блоге разбор «How We Generated Millions of Content Annotations»: как компания индустриализировала разметку данных, соединив многоуровневую человеческую экспертизу и работающую параллельно с людьми LLM-систему. Пост примечателен жанром: это не история одной модели, а описание внутренней платформы-фабрики, обслуживающей десятки проектов разметки для музыкального, подкастного и аудиокнижного вертикалей — с акцентом на безопасность и модерацию каталога.

Проблема

Разметка данных на масштабе каталога Spotify была узким местом всего ML-конвейера. Контента — сотни миллионов единиц; задач — десятки, от классификации контента и детекции связей между релизами до анализа эпизодов подкастов на нарушения политик; а ручная разметка медленная, дорогая и плохо масштабируется. Классическая дилемма: нанимать больше аннотаторов — расходы растут линейно, а качество без выстроенных процессов даже падает; автоматизировать «в лоб» — качество меток непредсказуемо, а именно от него зависят и обучение, и честная оценка моделей.

Вторая проблема — фрагментация. Разные команды Spotify строили собственные разрозненные процессы аннотирования: свои инструменты, свои гайдлайны, свои критерии качества. Экспертиза не переиспользовалась, качество было неравномерным, а запуск каждого нового проекта разметки означал строительство процесса с нуля — недопустимо долго для эпохи, когда генеративные модели требуют новых оценочных датасетов каждые несколько недель.

Третий пласт специфичен для аудиоплатформы: разметка звука и видео сложнее текстовой. Аннотатору нужно прослушивать фрагменты, сравнивать версии треков, оценивать эпизоды подкастов — стандартные текстовые инструменты разметки для этого не приспособлены. При этом ставки высоки: ошибки в разметке для задач модерации и безопасности каталога конвертируются в прямые репутационные и регуляторные риски платформы.

Решение

Spotify построила единую платформу аннотаций на трёх опорах: масштабируемая человеческая экспертиза, гибкий инструментарий разметки и общая инфраструктура, интегрированная с ML-конвейерами.

Человеческая часть организована в три уровня. Базовые аннотаторы — доменные эксперты, выполняющие первичную разметку всех кейсов. Аналитики качества — эксперты верхнего уровня, точка эскалации для всех неоднозначных и сложных случаев. Проектные менеджеры связывают команды, поддерживают обучающие материалы и организуют обратную связь между заказчиками разметки и исполнителями. Такая пирамида решает сразу две задачи: объём (первичная разметка дешёвая и быстрая) и качество (спорное уходит наверх к сильнейшим экспертам).

Параллельно людям работает конфигурируемая LLM-система разметки — ключевое архитектурное решение платформы. Модель размечает те же данные, что и люди; согласованность оценок (agreement) считается автоматически, и примеры с низким консенсусом — между людьми или между человеком и моделью — автоматически эскалируются аналитикам качества. По формулировке команды, именно это позволило «значительно нарастить корпус высококачественных данных разметки с низкими усилиями и затратами»: LLM забирает массовую рутину, а дефицитная человеческая экспертиза концентрируется там, где она незаменима.

Инструментарий сделан под реальные типы контента: помимо стандартных интерфейсов для NLP-задач платформа даёт кастомные интерфейсы для разметки аудио- и видеофрагментов. Дашборды проектов в реальном времени показывают темпы выполнения, объёмы и продуктивность каждого аннотатора — разметка из «чёрного ящика на аутсорсе» превращается в управляемый производственный процесс с измеримым SLA.

Наконец, интеграционный слой: платформа встроена в ML-воркфлоу Spotify на всех стадиях — через CLI-инструменты, пользовательские интерфейсы и системы батч-оркестрации. Результаты разметки не лежат в таблицах, а автоматически возвращаются в пайплайны обучения и оценки моделей; новый проект разметки конфигурируется поверх готовой инфраструктуры, а не строится с нуля.

Результат

Корпус аннотаций вырос в 10 раз, продуктивность аннотаторов — в 3 раза: автоматизация сэмплирования, подачи данных на проверку и возврата результатов в обучающие пайплайны убрала ручные шаги, а LLM-разметка сняла с людей массовую рутину. Платформа ведёт десятки проектов разметки параллельно, обслуживая ML- и GenAI-задачи по каталогу из сотен миллионов треков и эпизодов — от детекции связей между релизами и автоматической раскладки контента до анализа подкастов на нарушения политик.

Важные рамки этих цифр. «10x» и «3x» — внутренние метрики Spotify без внешнего аудита, и пост не раскрывает базу сравнения: неясно, от какого исходного корпуса и за какой период считался рост. Сторонний разбор в базе LLMOps-кейсов ZenML отмечает и другие пробелы: в посте нет технических деталей о промптах, few-shot-подходах или дообучении LLM, а заявление о «низких затратах» не расшифровано — неизвестно, учтены ли инфраструктура, время на промпт-инжиниринг и постоянный мониторинг качества. Мы приводим кейс с этими оговорками: направление результата сомнений не вызывает, точные множители — принимайте как самоотчёт.

На наш взгляд, главная ценность кейса — в архитектурном паттерне, который переносится практически в любую индустрию: LLM плюс люди, связанные метрикой согласованности с автоматической эскалацией. Это принципиально надёжнее, чем «LLM вместо людей»: модель даёт масштаб, люди — калибровку и разбор пограничных случаев, а метрика agreement автоматически решает, кому доверить каждый конкретный пример. Обратная петля здесь двойная: спорные кейсы не только повышают качество меток, но и показывают, где гайдлайны разметки неоднозначны.

Второе наше наблюдение: Spotify относится к разметке как к продукту с собственной командой, инструментарием и метриками, а не как к разовой закупке. В эпоху, когда качество генеративных моделей упирается не в архитектуры, а в оценочные датасеты, платформа аннотаций становится такой же критичной инфраструктурой, как сервинг моделей, — и кейс Spotify первым из «большого стриминга» показал это публично.

Технологический стек
LLM-разметка параллельно людям (конфигурируемая)3 уровня человеческой экспертизыМетрики согласованности (agreement) + автоэскалацияКастомные интерфейсы для аудио/видео и NLPДашборды продуктивности в реальном времениИнтеграция: CLI, UI, батч-оркестрация
Сроки
Платформа развивалась итеративно; исходное состояние — разрозненные процессы разметки в отдельных командах. Затем — консолидация в единую платформу: три уровня экспертизы, LLM-система параллельно людям, кастомные интерфейсы для аудио/видео, интеграция с пайплайнами обучения. Публичный разбор с итогами (корпус 10x, продуктивность 3x, десятки параллельных проектов) — 21 октября 2024 года, авторы: Дана Пулео, Мегана Ситхарам, Катажина Джижга.

Уроки для индустрии

  1. Качество GenAI-продуктов упирается в данные: платформа разметки — такая же критичная инфраструктура, как сервинг моделей, и заслуживает выделенной команды.
  2. LLM + люди эффективнее, чем LLM вместо людей: модель размечает массово, люди решают спорные случаи — автоматическая эскалация по метрике согласованности связывает их в один конвейер.
  3. Три уровня экспертизы (аннотатор → аналитик качества → менеджер проекта) масштабируют и объём, и качество одновременно.
  4. Централизованная платформа с переиспользуемым инструментарием обгоняет десятки самодельных процессов: новые проекты разметки конфигурируются поверх готовой инфраструктуры.
  5. Инструменты должны соответствовать типу контента: для аудио и видео нужны специализированные интерфейсы разметки, а не адаптированные текстовые.
  6. Метрики в реальном времени (объёмы, скорость, согласованность) превращают разметку из «чёрного ящика» в управляемый производственный процесс.
  7. Читайте множители критично: «10x» и «3x» — внутренние цифры без раскрытой базы сравнения; сторонние разборы (ZenML) отмечают отсутствие деталей о промптах и полной стоимости.

Частые вопросы

Что дала Spotify платформа аннотаций с LLM?

Рост корпуса аннотаций в 10 раз при трёхкратном росте продуктивности аннотаторов — за счёт LLM-разметки, работающей параллельно людям, и автоматизации всего конвейера от сэмплирования до возврата данных в обучение. Платформа ведёт десятки проектов разметки одновременно.

Заменили ли LLM аннотаторов-людей в Spotify?

Нет: конфигурируемая LLM-система работает параллельно экспертам. Согласованность оценок считается автоматически, и случаи без явного консенсуса эскалируются аналитикам качества — люди концентрируются на сложных и неоднозначных примерах.

Как устроена человеческая часть платформы?

Три уровня: базовые аннотаторы (доменные эксперты, первичная разметка всех кейсов), аналитики качества (эксперты верхнего уровня — точка эскалации спорных случаев) и проектные менеджеры (связь команд, обучающие материалы, обратная связь).

Для каких задач Spotify использует эту разметку?

Для ML- и GenAI-задач по каталогу: детекция связей между релизами, автоматическое размещение треков и альбомов на страницах артистов, анализ эпизодов подкастов на нарушения политик, а также обучение и оценка моделей по музыке, подкастам и аудиокнигам.

Насколько надёжны цифры 10x и 3x?

Это внутренние метрики Spotify из инженерного блога — без внешнего аудита и раскрытой базы сравнения. Сторонний разбор ZenML отмечает, что пост не детализирует промпт-инжиниринг и полную стоимость владения. Направление эффекта сомнений не вызывает, точные множители стоит читать как самоотчёт.

← Кейсы