arXiv cs.CL→ оригинал

SynthAVE: когда 21 модель разметила 12 тысяч товаров вместо людей

Исследователи предложили SynthAVE — метод автоматической разметки характеристик товаров в e-commerce. Вместо дорогой ручной аннотации 12,726 товаров они использовали 21 LLM-конфигурацию (7 моделей × 3 разных промпта), выбирая итоговый результат голосованием. Точность совпадает с разметкой людей на 95.2% — при этом стоимость снижается на порядки.

AI-обработка оригинала arXiv cs.CL; редакция Hamidun News
SynthAVE: когда 21 модель разметила 12 тысяч товаров вместо людей
Источник: arXiv cs.CL. Коллаж: Hamidun News.
◐ Слушать статью

Исследователи опубликовали SynthAVE — метод массовой синтетической разметки товаров в e-commerce с использованием множественного LLM-голосования. Вместо ручной аннотации миллионов данных команда применила сеть из 21 LLM-конфигурации (7 моделей × 3 промпта), результаты которой совпадают с оценками экспертов-людей на 95.2% (Cohen's κ = 0.92).

Почему ручная разметка больше не масштабируется

В e-commerce каждый товар имеет десятки параметров: размер, цвет, материал, вес, длина рукава, размер груди и так далее. Крупный маркетплейс работает с тысячами типов товаров и сотнями атрибутов одновременно. Это означает, что для полной разметки нужны миллионы аннотаций. Нанять людей для такого объёма — месячный бюджет в десятки миллионов рублей.

Компании давно знают, что LLM могут генерировать разметку автоматически. Но возникает вопрос: как проверить качество в таком масштабе? Ручная верификация вырождается в ту же дорогостоящую работу.

Метод: арена голосующих моделей

Вместо одного LLM авторы вызывают 7 разных моделей, каждую с 3 вариантами промпта. Каждый образец товара оценивают все 21 конфигурация независимо, затем выбирают финальный результат большинством голосов.

Ключевые цифры датасета:

  • 12,726 товаров
  • 229 типов товаров
  • 792 различных атрибутов
  • 4 языка: испанский, французский, итальянский, немецкий

Результат: человеческий уровень при машинной скорости

Большинственное голосование показало Cohen's κ = 0.92 против разметки человека (95.2% прямого совпадения). Индивидуальные модели между собой показывают κ = 0.76.

Парадокс: у каждой модели есть собственные слепые пятна. Одна лучше разбирается в тканях, другая в размерах, третья в материалах. Но когда много моделей голосуют, их ошибки компенсируют друг друга — как в хорошем жюри.

Что это значит

E-commerce компании получают способ масштабировать разметку данных на уровне человека при стоимости в 10–100 раз меньше ручной работы. Это открывает дверь к автоматизации тысяч микротаск, которые раньше требовали людей. Метод универсален: везде, где нужна массовая разметка (медицина, финансы, логистика), можно собрать арену судей и использовать голосование.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…