Spotify: платформа аннотаций с LLM — корпус разметки вырос в 10 раз при росте продуктивности аннотаторов втрое
Корпус аннотаций вырос в 10 раз, продуктивность аннотаторов — в 3 раза: автоматизация сэмплирования, подачи данных на проверку и возврата результатов в обучающие пайплайны убрала ручные шаги, а LLM-разметка сняла с людей массовую рутину. Платформа ведёт десятки проектов разметки параллельно, обслуживая ML- и GenAI-задачи по каталогу из сотен миллионов треков и эпизодов — от детекции связей между релизами и автоматической раскладки контента до анализа подкастов на нарушения политик. Важные рамки этих цифр. «10x» и «3x» — внутренние метрики Spotify без внешнего аудита, и пост не раскрывает базу сравнения: неясно, от какого исходного корпуса и за какой период считался рост. Сторонний разбор в базе LLMOps-кейсов ZenML отмечает и другие пробелы: в посте нет технических деталей о промптах, few-shot-подходах или дообучении LLM, а заявление о «низких затратах» не расшифровано — неизвестно, учтены ли инфраструктура, время на промпт-инжиниринг и постоянный мониторинг качества. Мы приводим кейс с этими оговорками: направление результата сомнений не вызывает, точные множители — принимайте как самоотчёт. На наш взгляд, главная ценность кейса — в архитектурном паттерне, который переносится практически в любую индустрию: LLM плюс люди, связанные метрикой согласованности с автоматической эскалацией. Это принципиально надёжнее, чем «LLM вместо людей»: модель даёт масштаб, люди — калибровку и разбор пограничных случаев, а метрика agreement автоматически решает, кому доверить каждый конкретный пример. Обратная петля здесь двойная: спорные кейсы не только повышают качество меток, но и показывают, где гайдлайны разметки неоднозначны. Второе наше наблюдение: Spotify относится к разметке как к продукту с собственной командой, инструментарием и метриками, а не как к разовой закупке. В эпоху, когда качество генеративных моделей упирается не в архитектуры, а в оценочные датасеты, платформа аннотаций становится такой же критичной инфраструктурой, как сервинг моделей, — и кейс Spotify первым из «большого стриминга» показал это публично.
- How We Generated Millions of Content Annotations — Spotify Engineering (Puleo, Seetharam, Drzyzga), 2024-10-21
- Spotify: Scaling ML Annotation Platform with LLMs for Content Classification (сторонний критический разбор) — ZenML LLMOps Database
Контекст
Spotify — крупнейший аудиостриминг с каталогом из сотен миллионов треков и эпизодов подкастов. С точки зрения машинного обучения такой каталог — одновременно актив и обязательство: рекомендации, поиск, автоматическая раскладка контента по страницам артистов, детекция связей между релизами и модерация подкастов на нарушения политик — всё это ML-модели, которым нужно покрывать каталог целиком. А любой модели, прежде чем работать, нужны размеченные данные — и для обучения, и для оценки качества.
Разметка — самая недооценённая часть ML-конвейера. Пока индустрия обсуждает архитектуры моделей, продакшен-команды упираются в прозаичное: кто, как быстро и насколько надёжно проставит миллионы меток на аудио, видео и текстах. С приходом генеративного ИИ проблема обострилась вдвойне: циклы итераций моделей сократились с месяцев до недель, и разметка, не успевающая за этим темпом, стала главным тормозом; одновременно сами LLM впервые сделали возможной масштабную автоматическую разметку приемлемого качества.
В октябре 2024 года команда платформы аннотаций Spotify — операционный менеджер платформы Дана Пулео и staff-инженеры Мегана Ситхарам и Катажина Джижга — опубликовала в инженерном блоге разбор «How We Generated Millions of Content Annotations»: как компания индустриализировала разметку данных, соединив многоуровневую человеческую экспертизу и работающую параллельно с людьми LLM-систему. Пост примечателен жанром: это не история одной модели, а описание внутренней платформы-фабрики, обслуживающей десятки проектов разметки для музыкального, подкастного и аудиокнижного вертикалей — с акцентом на безопасность и модерацию каталога.
Проблема
Разметка данных на масштабе каталога Spotify была узким местом всего ML-конвейера. Контента — сотни миллионов единиц; задач — десятки, от классификации контента и детекции связей между релизами до анализа эпизодов подкастов на нарушения политик; а ручная разметка медленная, дорогая и плохо масштабируется. Классическая дилемма: нанимать больше аннотаторов — расходы растут линейно, а качество без выстроенных процессов даже падает; автоматизировать «в лоб» — качество меток непредсказуемо, а именно от него зависят и обучение, и честная оценка моделей.
Вторая проблема — фрагментация. Разные команды Spotify строили собственные разрозненные процессы аннотирования: свои инструменты, свои гайдлайны, свои критерии качества. Экспертиза не переиспользовалась, качество было неравномерным, а запуск каждого нового проекта разметки означал строительство процесса с нуля — недопустимо долго для эпохи, когда генеративные модели требуют новых оценочных датасетов каждые несколько недель.
Третий пласт специфичен для аудиоплатформы: разметка звука и видео сложнее текстовой. Аннотатору нужно прослушивать фрагменты, сравнивать версии треков, оценивать эпизоды подкастов — стандартные текстовые инструменты разметки для этого не приспособлены. При этом ставки высоки: ошибки в разметке для задач модерации и безопасности каталога конвертируются в прямые репутационные и регуляторные риски платформы.
Решение
Spotify построила единую платформу аннотаций на трёх опорах: масштабируемая человеческая экспертиза, гибкий инструментарий разметки и общая инфраструктура, интегрированная с ML-конвейерами.
Человеческая часть организована в три уровня. Базовые аннотаторы — доменные эксперты, выполняющие первичную разметку всех кейсов. Аналитики качества — эксперты верхнего уровня, точка эскалации для всех неоднозначных и сложных случаев. Проектные менеджеры связывают команды, поддерживают обучающие материалы и организуют обратную связь между заказчиками разметки и исполнителями. Такая пирамида решает сразу две задачи: объём (первичная разметка дешёвая и быстрая) и качество (спорное уходит наверх к сильнейшим экспертам).
Параллельно людям работает конфигурируемая LLM-система разметки — ключевое архитектурное решение платформы. Модель размечает те же данные, что и люди; согласованность оценок (agreement) считается автоматически, и примеры с низким консенсусом — между людьми или между человеком и моделью — автоматически эскалируются аналитикам качества. По формулировке команды, именно это позволило «значительно нарастить корпус высококачественных данных разметки с низкими усилиями и затратами»: LLM забирает массовую рутину, а дефицитная человеческая экспертиза концентрируется там, где она незаменима.
Инструментарий сделан под реальные типы контента: помимо стандартных интерфейсов для NLP-задач платформа даёт кастомные интерфейсы для разметки аудио- и видеофрагментов. Дашборды проектов в реальном времени показывают темпы выполнения, объёмы и продуктивность каждого аннотатора — разметка из «чёрного ящика на аутсорсе» превращается в управляемый производственный процесс с измеримым SLA.
Наконец, интеграционный слой: платформа встроена в ML-воркфлоу Spotify на всех стадиях — через CLI-инструменты, пользовательские интерфейсы и системы батч-оркестрации. Результаты разметки не лежат в таблицах, а автоматически возвращаются в пайплайны обучения и оценки моделей; новый проект разметки конфигурируется поверх готовой инфраструктуры, а не строится с нуля.
Результат
Корпус аннотаций вырос в 10 раз, продуктивность аннотаторов — в 3 раза: автоматизация сэмплирования, подачи данных на проверку и возврата результатов в обучающие пайплайны убрала ручные шаги, а LLM-разметка сняла с людей массовую рутину. Платформа ведёт десятки проектов разметки параллельно, обслуживая ML- и GenAI-задачи по каталогу из сотен миллионов треков и эпизодов — от детекции связей между релизами и автоматической раскладки контента до анализа подкастов на нарушения политик.
Важные рамки этих цифр. «10x» и «3x» — внутренние метрики Spotify без внешнего аудита, и пост не раскрывает базу сравнения: неясно, от какого исходного корпуса и за какой период считался рост. Сторонний разбор в базе LLMOps-кейсов ZenML отмечает и другие пробелы: в посте нет технических деталей о промптах, few-shot-подходах или дообучении LLM, а заявление о «низких затратах» не расшифровано — неизвестно, учтены ли инфраструктура, время на промпт-инжиниринг и постоянный мониторинг качества. Мы приводим кейс с этими оговорками: направление результата сомнений не вызывает, точные множители — принимайте как самоотчёт.
На наш взгляд, главная ценность кейса — в архитектурном паттерне, который переносится практически в любую индустрию: LLM плюс люди, связанные метрикой согласованности с автоматической эскалацией. Это принципиально надёжнее, чем «LLM вместо людей»: модель даёт масштаб, люди — калибровку и разбор пограничных случаев, а метрика agreement автоматически решает, кому доверить каждый конкретный пример. Обратная петля здесь двойная: спорные кейсы не только повышают качество меток, но и показывают, где гайдлайны разметки неоднозначны.
Второе наше наблюдение: Spotify относится к разметке как к продукту с собственной командой, инструментарием и метриками, а не как к разовой закупке. В эпоху, когда качество генеративных моделей упирается не в архитектуры, а в оценочные датасеты, платформа аннотаций становится такой же критичной инфраструктурой, как сервинг моделей, — и кейс Spotify первым из «большого стриминга» показал это публично.
Уроки для индустрии
- Качество GenAI-продуктов упирается в данные: платформа разметки — такая же критичная инфраструктура, как сервинг моделей, и заслуживает выделенной команды.
- LLM + люди эффективнее, чем LLM вместо людей: модель размечает массово, люди решают спорные случаи — автоматическая эскалация по метрике согласованности связывает их в один конвейер.
- Три уровня экспертизы (аннотатор → аналитик качества → менеджер проекта) масштабируют и объём, и качество одновременно.
- Централизованная платформа с переиспользуемым инструментарием обгоняет десятки самодельных процессов: новые проекты разметки конфигурируются поверх готовой инфраструктуры.
- Инструменты должны соответствовать типу контента: для аудио и видео нужны специализированные интерфейсы разметки, а не адаптированные текстовые.
- Метрики в реальном времени (объёмы, скорость, согласованность) превращают разметку из «чёрного ящика» в управляемый производственный процесс.
- Читайте множители критично: «10x» и «3x» — внутренние цифры без раскрытой базы сравнения; сторонние разборы (ZenML) отмечают отсутствие деталей о промптах и полной стоимости.
Частые вопросы
Что дала Spotify платформа аннотаций с LLM?
Рост корпуса аннотаций в 10 раз при трёхкратном росте продуктивности аннотаторов — за счёт LLM-разметки, работающей параллельно людям, и автоматизации всего конвейера от сэмплирования до возврата данных в обучение. Платформа ведёт десятки проектов разметки одновременно.
Заменили ли LLM аннотаторов-людей в Spotify?
Нет: конфигурируемая LLM-система работает параллельно экспертам. Согласованность оценок считается автоматически, и случаи без явного консенсуса эскалируются аналитикам качества — люди концентрируются на сложных и неоднозначных примерах.
Как устроена человеческая часть платформы?
Три уровня: базовые аннотаторы (доменные эксперты, первичная разметка всех кейсов), аналитики качества (эксперты верхнего уровня — точка эскалации спорных случаев) и проектные менеджеры (связь команд, обучающие материалы, обратная связь).
Для каких задач Spotify использует эту разметку?
Для ML- и GenAI-задач по каталогу: детекция связей между релизами, автоматическое размещение треков и альбомов на страницах артистов, анализ эпизодов подкастов на нарушения политик, а также обучение и оценка моделей по музыке, подкастам и аудиокнигам.
Насколько надёжны цифры 10x и 3x?
Это внутренние метрики Spotify из инженерного блога — без внешнего аудита и раскрытой базы сравнения. Сторонний разбор ZenML отмечает, что пост не детализирует промпт-инжиниринг и полную стоимость владения. Направление эффекта сомнений не вызывает, точные множители стоит читать как самоотчёт.