PubHealthBench: 7929 вопросов проверили, как RAG спасает ИИ от галлюцинаций в медицине
Учёные расширили бенчмарк PubHealthBench — 7929 вопросов по официальным рекомендациям здравоохранения Великобритании — до сценария с retrieval-augmented generation. Гибридный поиск стабильно улучшает качество ответов, а небольшие открытые модели с RAG сравниваются или превосходят крупные модели без него. Также авторы предложили LLM-судью для оценки развёрнутых ответов, проверенного на разметке людьми.
AI-обработка оригинала arXiv cs.CL; редакция Hamidun News
Исследователи расширили бенчмарк PubHealthBench — набор из 7929 вопросов по официальным рекомендациям правительства Великобритании в сфере общественного здравоохранения — до сценария с retrieval-augmented generation (RAG) и систематически проверили, как разные настройки поиска и генерации влияют на точность ответов ИИ. Статья опубликована в arXiv 7 июля 2026 года.
Зачем LLM в медицине нужен RAG
Большие языковые модели показывают многообещающие результаты на медицинских бенчмарках вопросов-ответов, но их применение в общественном здравоохранении ограничено галлюцинациями и быстрой сменой официальных рекомендаций. RAG снижает эти риски, привязывая ответы модели к явно поддерживаемому корпусу документов, но итоговое качество сильно зависит от настройки поиска и от того, как именно оценивается результат — не только в формате выбора одного варианта из нескольких.
Что показало сравнение методов поиска
Авторы сравнили плотный (dense), разреженный (sparse) и гибридный поиск на нескольких моделях эмбеддингов и вариантах корпуса.
- Гибридный поиск стабильно улучшает полноту и качество ранжирования результатов
- Длина фрагмента текста (chunk length) и тема запроса влияют на качество ранжирования
- Добавление найденного контекста существенно повышает точность ответов с выбором варианта у самых разных LLM
- Небольшие открытые модели с RAG сравниваются или превосходят более крупные модели без RAG
- Прирост точности в первую очередь определяется качеством поиска и аккуратным отбором контекста
Как оценивали развёрнутые ответы
Чтобы оценить реалистичные развёрнутые ответы, а не только выбор варианта, авторы предложили LLM-судью на основе рубрики, охватывающей достоверность (faithfulness), полноту, ясность и фактическую согласованность, и проверили его результаты на двойной разметке людьми. Совпадение судьи-модели с людьми оказалось наиболее сильным по критериям достоверности и полноты, тогда как фактическая согласованность и ясность воспроизводятся менее надёжно — это повод осторожнее интерпретировать оценки по этим двум критериям в больших масштабах.
Что это значит
Итоги работы показывают: качество поиска — главный рычаг для надёжных ответов ИИ на вопросы общественного здравоохранения, и даже небольшие открытые модели способны конкурировать с крупными, если поисковая часть системы настроена аккуратно.
Частые вопросы
Что такое PubHealthBench?
Это бенчмарк вопросов-ответов из 7929 вопросов, составленных на основе официальных рекомендаций правительства Великобритании по общественному здравоохранению; в этой работе его расширили до сценария с RAG.
Может ли небольшая модель заменить крупную с помощью RAG?
Да — по данным авторов, предоставление найденного контекста позволяет небольшим открытым моделям сравняться или превзойти более крупные модели, которые работают без RAG.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.