OrderBench: почему JSON-схема не спасает LLM-агентов от опасных заказов
Исследователи представили OrderBench — бенчмарк для ресторанных LLM-агентов. Оказалось, даже при 100% соответствии JSON-схеме около 20% заказов у сильнейшей модели семантически неверны, а у слабых моделей двузначный процент небезопасных подтверждений проходит проверку схемы. Вывод: структурированный вывод убирает ошибки парсинга, но не заменяет доменную проверку.
AI-обработка оригинала arXiv cs.AI; редакция Hamidun News
В июле 2026 года исследователи представили OrderBench — детерминированный бенчмарк для ресторанных LLM-агентов, который показал: даже когда модель выдаёт JSON со 100-процентным соответствием схеме, около 20% заказов у сильнейшей модели остаются семантически неверными. Вывод работы прост: структурированный вывод убирает ошибки парсинга, но не гарантирует, что транзакция безопасна и точна.
Что такое OrderBench
OrderBench — это детерминированный тест, который раздельно измеряет шесть свойств ответа агента: синтаксическую корректность, валидность по схеме, правильность статус-решения, точную семантику позиций, сохранение ограничений и небезопасные подтверждения заказа. Мотивация в том, что LLM всё чаще работают «компилятором транзакций»: пользователь формулирует намерение обычными словами, модель выдаёт структурированный объект, а его исполняет API. JSON Schema и провайдерские режимы structured output убирают целый класс ошибок парсинга — но сами по себе не решают, верна ли и безопасна ли транзакция, которую агент собрался исполнить.
Что показал эксперимент
Авторы сделали 2400 вызовов через платформу Nebius Token Factory к четырём открытым моделям в двух режимах — обычный промпт и принудительная JSON-схема. Главный результат: схема-валидный ответ всё ещё может нести крупные семантические ошибки. У самой сильной модели оба режима дают 100% валидности по схеме, но семантический успех держится около 80% — то есть каждый пятый заказ формально корректен, а по сути неверен. У более слабых моделей доля схема-валидных, но небезопасных подтверждений заказа измеряется двузначными процентами.
- Бенчмарк: OrderBench, детерминированный, для ресторанных заказов
- Объём: 2400 вызовов к четырём открытым моделям
- Платформа: Nebius Token Factory
- Режимы: prompt-only и принудительная JSON-схема
- Ключевая цифра: 100% валидности по схеме при ~80% семантической точности у лучшей модели
Почему схема не спасает
Валидность по схеме и правильность заказа — разные вещи, и это центральный вывод работы. JSON-схема гарантирует лишь форму объекта: нужные поля на месте, типы совпадают. Она не проверяет, что агент выбрал именно тот товар, сохранил ограничения — аллергии, замены, количество — и не подтвердил заказ, который следовало отклонить. Такое небезопасное подтверждение остаётся полностью невидимым для валидатора схемы: объект пройдёт проверку и уйдёт в API на исполнение, хотя по смыслу он ошибочен или опасен.
«Структурированный вывод — это необходимый интерфейсный слой, но не
замена доменной верификации и fail-closed-исполнения», — говорится в аннотации исследования на arXiv.
Что это значит
Структурированный вывод решает проблему парсинга, но не проблему доверия. Разработчикам агентных систем работа прямо советует не полагаться на схему как на гарантию: нужен второй слой — доменная верификация и принцип fail-closed, когда при любом сомнении агент отклоняет заказ, а не подтверждает его. Иначе аккуратно оформленный JSON будет исправно и незаметно исполнять неверные транзакции.
Частые вопросы
Что такое OrderBench?
OrderBench — детерминированный бенчмарк для агентов ресторанных заказов, представленный в июле 2026 года. Он раздельно оценивает шесть свойств ответа, включая небезопасные подтверждения заказов, которых валидатор JSON-схемы не замечает.
Гарантирует ли JSON-схема правильность заказа?
Нет. По данным исследования, у сильнейшей модели оба режима дают 100% валидности по схеме, но семантическая точность — около 80%, а у слабых моделей двузначный процент заказов проходит схему, оставаясь небезопасным.
Что значит fail-closed для агента?
Fail-closed — это принцип, при котором агент при любой неоднозначности отклоняет действие, а не подтверждает его. Авторы OrderBench называют его вместе с доменной верификацией обязательным дополнением к структурированному выводу, поскольку сама JSON-схема небезопасные заказы не отсекает.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.