Один и тот же бенчмарк LLM дал 28% и 76% — разница только в способе вопросов
Разработчик тестировал русскоязычные LLM на корпоративных документах — политиках, приказах, счетах, согласованиях. Модель должна была найти нужный документ среди похожих, сослаться на конкретную строку и не сломаться при смене одной даты. Одна и та же модель показала на бенчмарке от 28% до 76% — итог зависел не от выбора модели, а от того, как были организованы запросы к ней.
AI-обработка оригинала Habr AI; редакция Hamidun News
Разработчик, тестировавший русскоязычные LLM на корпоративных документах, получил на одном и том же бенчмарке результат от 28% до 76% для одной и той же модели — разница объясняется исключительно способом подачи вопросов.
Как устроен бенчмарк
Автор собирал бенчмарк для русскоязычных языковых моделей на реальных типах корпоративных документов — политиках, приказах, счетах и согласованиях. Задача моделей — найти нужный документ среди похожих, сослаться на конкретную строку в нём и не «сломаться», когда в одном из документов меняют всего одну дату.
- Диапазон результатов одной и той же модели на одном бенчмарке — от 28% до 76%
- Тип данных — корпоративные документы: политики, приказы, счета, согласования
- Проверяемые навыки — поиск нужного документа среди похожих, точная ссылка на строку, устойчивость к изменению одной детали (даты)
- Причина разброса — не сама модель, а то, как организованы запросы к ней
Откуда взялся разброс в 48 процентных пунктов
Ключевой вывод эксперимента — итоговый результат оказался сильно зависим от того, как были организованы запросы к модели, а не от того, какая модель использовалась. Иными словами, ту же самую модель можно «завалить» бенчмарком или заставить пройти его почти в три раза лучше — просто изменив, как ей подают вопрос и контекст документов.
Почему это важно для корпоративного применения LLM
Компании всё чаще строят поверх LLM внутренние системы поиска и работы с документами — то, что в индустрии называют RAG (retrieval-augmented generation): согласования, приказы, счета редко хранятся в удобном для модели виде, и на практике модель должна выбрать нужный документ из множества похожих, а затем сослаться на точную строку. Именно это и проверял бенчмарк автора.
Если разброс результата в разы объясняется форматом запроса, а не выбором модели, то для команд, внедряющих LLM во внутренние процессы, инвестиции в грамотную организацию запросов и контекста могут дать больший эффект, чем переход на более крупную или более дорогую модель. Это особенно заметно на устойчивости к «мелким» изменениям: когда в одном из документов меняют всего одну дату, а модель либо продолжает ссылаться на старую версию, либо теряет нужный документ среди похожих, — именно такие сбои чаще всего портят доверие к LLM-системам внутри компаний, даже если в среднем модель отвечает неплохо.
Что это значит
Бенчмарк на реальных корпоративных документах показывает: сравнивать модели «в лоб» без фиксации способа подачи вопросов — методологически ненадёжно, а для практического внедрения LLM в документооборот важнее не гнаться за более мощной моделью, а довести до ума то, как ей задают вопросы.
Частые вопросы
Что именно тестировал бенчмарк?
Модели проверяли на способности найти нужный документ среди документов, похожих друг на друга, — политик, приказов, счетов и согласований, — сослаться на конкретную строку и не потерять точность, если в одном из документов меняли всего одну дату.
Почему один и тот же бенчмарк дал такой разный результат?
Потому что результат оказался чувствителен не к самой модели, а к тому, как были организованы запросы к ней — автор эксперимента прямо связывает разброс с 28% до 76% именно со способом подачи вопросов, а не с заменой модели.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.