Habr AI→ оригинал

Один и тот же бенчмарк LLM дал 28% и 76% — разница только в способе вопросов

Разработчик тестировал русскоязычные LLM на корпоративных документах — политиках, приказах, счетах, согласованиях. Модель должна была найти нужный документ среди похожих, сослаться на конкретную строку и не сломаться при смене одной даты. Одна и та же модель показала на бенчмарке от 28% до 76% — итог зависел не от выбора модели, а от того, как были организованы запросы к ней.

AI-обработка оригинала Habr AI; редакция Hamidun News
Один и тот же бенчмарк LLM дал 28% и 76% — разница только в способе вопросов
Источник: Habr AI. Коллаж: Hamidun News.
◐ Слушать статью

Разработчик, тестировавший русскоязычные LLM на корпоративных документах, получил на одном и том же бенчмарке результат от 28% до 76% для одной и той же модели — разница объясняется исключительно способом подачи вопросов.

Как устроен бенчмарк

Автор собирал бенчмарк для русскоязычных языковых моделей на реальных типах корпоративных документов — политиках, приказах, счетах и согласованиях. Задача моделей — найти нужный документ среди похожих, сослаться на конкретную строку в нём и не «сломаться», когда в одном из документов меняют всего одну дату.

  • Диапазон результатов одной и той же модели на одном бенчмарке — от 28% до 76%
  • Тип данных — корпоративные документы: политики, приказы, счета, согласования
  • Проверяемые навыки — поиск нужного документа среди похожих, точная ссылка на строку, устойчивость к изменению одной детали (даты)
  • Причина разброса — не сама модель, а то, как организованы запросы к ней

Откуда взялся разброс в 48 процентных пунктов

Ключевой вывод эксперимента — итоговый результат оказался сильно зависим от того, как были организованы запросы к модели, а не от того, какая модель использовалась. Иными словами, ту же самую модель можно «завалить» бенчмарком или заставить пройти его почти в три раза лучше — просто изменив, как ей подают вопрос и контекст документов.

Почему это важно для корпоративного применения LLM

Компании всё чаще строят поверх LLM внутренние системы поиска и работы с документами — то, что в индустрии называют RAG (retrieval-augmented generation): согласования, приказы, счета редко хранятся в удобном для модели виде, и на практике модель должна выбрать нужный документ из множества похожих, а затем сослаться на точную строку. Именно это и проверял бенчмарк автора.

Если разброс результата в разы объясняется форматом запроса, а не выбором модели, то для команд, внедряющих LLM во внутренние процессы, инвестиции в грамотную организацию запросов и контекста могут дать больший эффект, чем переход на более крупную или более дорогую модель. Это особенно заметно на устойчивости к «мелким» изменениям: когда в одном из документов меняют всего одну дату, а модель либо продолжает ссылаться на старую версию, либо теряет нужный документ среди похожих, — именно такие сбои чаще всего портят доверие к LLM-системам внутри компаний, даже если в среднем модель отвечает неплохо.

Что это значит

Бенчмарк на реальных корпоративных документах показывает: сравнивать модели «в лоб» без фиксации способа подачи вопросов — методологически ненадёжно, а для практического внедрения LLM в документооборот важнее не гнаться за более мощной моделью, а довести до ума то, как ей задают вопросы.

Частые вопросы

Что именно тестировал бенчмарк?

Модели проверяли на способности найти нужный документ среди документов, похожих друг на друга, — политик, приказов, счетов и согласований, — сослаться на конкретную строку и не потерять точность, если в одном из документов меняли всего одну дату.

Почему один и тот же бенчмарк дал такой разный результат?

Потому что результат оказался чувствителен не к самой модели, а к тому, как были организованы запросы к ней — автор эксперимента прямо связывает разброс с 28% до 76% именно со способом подачи вопросов, а не с заменой модели.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…