LangChain Blog→ оригинал

LangChain сравнила GPT-4, Claude и open-source LLM в извлечении данных

LangChain выпустила исследование Extraction Benchmarking — сравнение GPT-4, моделей Claude и открытых LLM на задаче извлечения структурированных данных из логов переписки. В материале разбираются результаты бенчмарка, методика оценки качества извлечения и то, как команда собирала датасет для проверки моделей.

AI-обработка оригинала LangChain Blog; редакция Hamidun News
LangChain сравнила GPT-4, Claude и open-source LLM в извлечении данных
Источник: LangChain Blog. Коллаж: Hamidun News.
◐ Слушать статью

Команда LangChain опубликовала в июле 2026 года материал Extraction Benchmarking — сравнение того, как модели GPT-4 от OpenAI, модели семейства Claude от Anthropic и открытые LLM справляются с извлечением структурированных данных из логов чатов.

Почему извлечение данных — сложная задача для LLM

Извлечение структурированных данных (structured data extraction) — одна из самых практичных задач, которые решают LLM в продакшне: превратить неструктурированный текст переписки, тикета поддержки или письма в чистый JSON с нужными полями — именем, датой, суммой, статусом заявки. Задача звучит просто, но на практике модели по-разному справляются с неоднозначными формулировками, пропущенными данными и полями, которые нужно вывести логически, а не скопировать дословно.

  • Сравнивались GPT-4, модели Claude и несколько открытых LLM
  • Источник данных для извлечения — логи чатов (chat logs)
  • В материал вошли не только результаты, но и методика создания оценочного датасета

Как устроена оценка моделей

Для честного сравнения моделей на такой задаче важна не только точность извлечения (совпадает ли значение поля с эталоном), но и метрики вроде полноты — не пропустила ли модель поле, которое присутствовало в тексте, — и устойчивости к формату: способна ли модель стабильно возвращать валидный JSON без лишних комментариев и объяснений. Именно поэтому команда LangChain отдельно описывает не только итоговые цифры бенчмарка, но и то, как собирался сам датасет и по каким критериям размечались правильные ответы — без прозрачной методики цифры сравнения моделей мало что говорят разработчикам, которые выбирают модель под свой продакшн-кейс.

Задачи извлечения данных из чатов особенно чувствительны к разговорному стилю: реальные пользователи формулируют запросы иначе, чем формальные документы, на которых часто тестируют модели, и поэтому бенчмарки на живых логах переписки дают более честную картину, чем синтетические тестовые наборы, собранные из идеально оформленных примеров.

Почему важна методика создания датасета

Разработчики фреймворков вроде LangChain регулярно сталкиваются с вопросами от сообщества о том, какую модель выбрать под конкретный сценарий извлечения данных — из писем, из тикетов поддержки, из голосовых транскриптов. Ответ часто зависит не столько от общей репутации модели, сколько от того, насколько хорошо она справляется именно с тем типом текста и той структурой полей, которая нужна в проекте.

Поэтому в материале Extraction Benchmarking отдельное внимание уделено тому, как именно создавался оценочный датасет — какие типы чатов в него вошли, как размечались эталонные значения и какие граничные случаи (отсутствующие данные, противоречивые упоминания, неоднозначные формулировки) специально закладывались в тестовые примеры, чтобы бенчмарк отражал реальные сложности, а не только простые случаи.

Зачем нужны такие открытые методики

Публикация не только итогового рейтинга моделей, но и полной методики сборки датасета решает ещё одну проблему индустрии: разработчики, которые строят собственные пайплайны извлечения данных, могут переиспользовать подход к разметке и граничным случаям для оценки своих сценариев, вместо того чтобы каждой команде заново изобретать критерии качества извлечения с нуля.

Что это значит

Для команд, выбирающих модель под задачи извлечения данных — от CRM до автоматизации поддержки, — такие независимые сравнения GPT-4, Claude и открытых LLM на реалистичных данных полезнее маркетинговых бенчмарков от самих вендоров моделей, потому что показывают поведение моделей на типичном, а не идеально причёсанном тексте.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…