SynthAVE: когда 21 модель разметила 12 тысяч товаров вместо людей
Исследователи предложили SynthAVE — метод автоматической разметки характеристик товаров в e-commerce. Вместо дорогой ручной аннотации 12,726 товаров они использовали 21 LLM-конфигурацию (7 моделей × 3 разных промпта), выбирая итоговый результат голосованием. Точность совпадает с разметкой людей на 95.2% — при этом стоимость снижается на порядки.
AI-обработка оригинала arXiv cs.CL; редакция Hamidun News
Исследователи опубликовали SynthAVE — метод массовой синтетической разметки товаров в e-commerce с использованием множественного LLM-голосования. Вместо ручной аннотации миллионов данных команда применила сеть из 21 LLM-конфигурации (7 моделей × 3 промпта), результаты которой совпадают с оценками экспертов-людей на 95.2% (Cohen's κ = 0.92).
Почему ручная разметка больше не масштабируется
В e-commerce каждый товар имеет десятки параметров: размер, цвет, материал, вес, длина рукава, размер груди и так далее. Крупный маркетплейс работает с тысячами типов товаров и сотнями атрибутов одновременно. Это означает, что для полной разметки нужны миллионы аннотаций. Нанять людей для такого объёма — месячный бюджет в десятки миллионов рублей.
Компании давно знают, что LLM могут генерировать разметку автоматически. Но возникает вопрос: как проверить качество в таком масштабе? Ручная верификация вырождается в ту же дорогостоящую работу.
Метод: арена голосующих моделей
Вместо одного LLM авторы вызывают 7 разных моделей, каждую с 3 вариантами промпта. Каждый образец товара оценивают все 21 конфигурация независимо, затем выбирают финальный результат большинством голосов.
Ключевые цифры датасета:
- 12,726 товаров
- 229 типов товаров
- 792 различных атрибутов
- 4 языка: испанский, французский, итальянский, немецкий
Результат: человеческий уровень при машинной скорости
Большинственное голосование показало Cohen's κ = 0.92 против разметки человека (95.2% прямого совпадения). Индивидуальные модели между собой показывают κ = 0.76.
Парадокс: у каждой модели есть собственные слепые пятна. Одна лучше разбирается в тканях, другая в размерах, третья в материалах. Но когда много моделей голосуют, их ошибки компенсируют друг друга — как в хорошем жюри.
Что это значит
E-commerce компании получают способ масштабировать разметку данных на уровне человека при стоимости в 10–100 раз меньше ручной работы. Это открывает дверь к автоматизации тысяч микротаск, которые раньше требовали людей. Метод универсален: везде, где нужна массовая разметка (медицина, финансы, логистика), можно собрать арену судей и использовать голосование.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.