LangChain: claude-3.5-sonnet, gpt-4o, o1 и o3-mini протестировали как ReAct-агентов
LangChain исследовала, как увеличение числа инструкций и доступных инструментов влияет на качество работы одиночного ReAct-агента. Бенчмарк прогнали на моделях claude-3.5-sonnet, gpt-4o, o1 и o3-mini в двух разных доменах задач, чтобы сравнить их устойчивость к росту сложности системного промпта.
AI-обработка оригинала LangChain Blog; редакция Hamidun News
Команда LangChain в июле 2026 года опубликовала исследование Benchmarking Single Agent Performance, в котором проверила, как рост числа инструкций и доступных инструментов влияет на качество работы одиночного ReAct-агента.
Что тестировали
ReAct (Reasoning + Acting) — один из базовых паттернов построения AI-агентов: модель поочерёдно рассуждает вслух и вызывает инструменты, опираясь на результат каждого предыдущего шага. Чем больше инструментов и правил разработчик добавляет в системный промпт такого агента, тем сложнее становится задача для модели — ей нужно удерживать в контексте не только текущую цель, но и растущий список доступных функций и ограничений.
- В бенчмарке участвовали модели claude-3.5-sonnet, gpt-4o, o1 и o3-mini
- Тесты прогонялись в двух разных доменах задач
- Ключевая переменная эксперимента — число инструкций и инструментов, доступных агенту одновременно
Почему это важно для разработчиков агентов
На практике команды, которые строят production-агентов, часто идут по пути наименьшего сопротивления: добавляют агенту всё новые и новые инструменты — поиск по базе, отправку писем, работу с календарём, — не проверяя, как это сказывается на качестве решений модели. Результаты подобных бенчмарков помогают понять, есть ли у конкретной модели предел, после которого рост числа доступных функций начинает не помогать, а мешать агенту выбирать правильный следующий шаг.
Сравнение сразу нескольких семейств моделей — closed-source claude-3.5-sonnet и gpt-4o, а также reasoning-модели o1 и o3-mini от OpenAI — показывает, что архитектурные различия между «обычными» чат-моделями и моделями, заточенными под пошаговое рассуждение, могут по-разному проявляться именно на нагруженных инструментами агентных сценариях, а не на простых бенчмарках вопрос-ответ.
Что показало сравнение доменов
Прогон бенчмарка сразу в двух разных доменах задач — а не в одном — позволяет отделить общую закономерность («чем больше инструментов, тем сложнее агенту») от частных эффектов конкретной предметной области. Если модель стабильно теряет в качестве при росте числа инструментов в обоих доменах, это сильный сигнал о фундаментальном ограничении подхода ReAct как такового, а не просто об особенностях одной задачи.
Для инженеров, которые проектируют мультиагентные системы, это также аргумент в пользу декомпозиции: вместо одного агента с десятками инструментов часто эффективнее разбить задачу между несколькими узкоспециализированными агентами, каждый из которых работает с небольшим, тщательно подобранным набором функций.
Что даёт сравнение четырёх моделей сразу
Одновременное тестирование claude-3.5-sonnet, gpt-4o и двух reasoning-моделей OpenAI — o1 и o3-mini — на одном и том же наборе инструментов и инструкций даёт разработчикам ориентир при выборе базовой модели для собственного агента: вместо того чтобы полагаться на общие бенчмарки вопрос-ответ, они могут опереться на данные о поведении моделей именно в нагруженном инструментами агентном сценарии, который ближе к их реальной production-задаче, где счёт инструментов идёт на десятки, а не на единицы.
Что это значит
Для инженерных команд, которые проектируют собственных ReAct-агентов, вывод практичен: выбор модели и лимит на число одновременно доступных инструментов — это не второстепенная деталь, а параметр, который стоит тестировать эмпирически на своих задачах, а не считать по умолчанию, что "больше инструментов — значит агент умнее".
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.