arXiv cs.AI→ оригинал

OrderBench: почему JSON-схема не спасает LLM-агентов от опасных заказов

Исследователи представили OrderBench — бенчмарк для ресторанных LLM-агентов. Оказалось, даже при 100% соответствии JSON-схеме около 20% заказов у сильнейшей модели семантически неверны, а у слабых моделей двузначный процент небезопасных подтверждений проходит проверку схемы. Вывод: структурированный вывод убирает ошибки парсинга, но не заменяет доменную проверку.

AI-обработка оригинала arXiv cs.AI; редакция Hamidun News
OrderBench: почему JSON-схема не спасает LLM-агентов от опасных заказов
Источник: arXiv cs.AI. Коллаж: Hamidun News.
◐ Слушать статью

В июле 2026 года исследователи представили OrderBench — детерминированный бенчмарк для ресторанных LLM-агентов, который показал: даже когда модель выдаёт JSON со 100-процентным соответствием схеме, около 20% заказов у сильнейшей модели остаются семантически неверными. Вывод работы прост: структурированный вывод убирает ошибки парсинга, но не гарантирует, что транзакция безопасна и точна.

Что такое OrderBench

OrderBench — это детерминированный тест, который раздельно измеряет шесть свойств ответа агента: синтаксическую корректность, валидность по схеме, правильность статус-решения, точную семантику позиций, сохранение ограничений и небезопасные подтверждения заказа. Мотивация в том, что LLM всё чаще работают «компилятором транзакций»: пользователь формулирует намерение обычными словами, модель выдаёт структурированный объект, а его исполняет API. JSON Schema и провайдерские режимы structured output убирают целый класс ошибок парсинга — но сами по себе не решают, верна ли и безопасна ли транзакция, которую агент собрался исполнить.

Что показал эксперимент

Авторы сделали 2400 вызовов через платформу Nebius Token Factory к четырём открытым моделям в двух режимах — обычный промпт и принудительная JSON-схема. Главный результат: схема-валидный ответ всё ещё может нести крупные семантические ошибки. У самой сильной модели оба режима дают 100% валидности по схеме, но семантический успех держится около 80% — то есть каждый пятый заказ формально корректен, а по сути неверен. У более слабых моделей доля схема-валидных, но небезопасных подтверждений заказа измеряется двузначными процентами.

  • Бенчмарк: OrderBench, детерминированный, для ресторанных заказов
  • Объём: 2400 вызовов к четырём открытым моделям
  • Платформа: Nebius Token Factory
  • Режимы: prompt-only и принудительная JSON-схема
  • Ключевая цифра: 100% валидности по схеме при ~80% семантической точности у лучшей модели

Почему схема не спасает

Валидность по схеме и правильность заказа — разные вещи, и это центральный вывод работы. JSON-схема гарантирует лишь форму объекта: нужные поля на месте, типы совпадают. Она не проверяет, что агент выбрал именно тот товар, сохранил ограничения — аллергии, замены, количество — и не подтвердил заказ, который следовало отклонить. Такое небезопасное подтверждение остаётся полностью невидимым для валидатора схемы: объект пройдёт проверку и уйдёт в API на исполнение, хотя по смыслу он ошибочен или опасен.

«Структурированный вывод — это необходимый интерфейсный слой, но не

замена доменной верификации и fail-closed-исполнения», — говорится в аннотации исследования на arXiv.

Что это значит

Структурированный вывод решает проблему парсинга, но не проблему доверия. Разработчикам агентных систем работа прямо советует не полагаться на схему как на гарантию: нужен второй слой — доменная верификация и принцип fail-closed, когда при любом сомнении агент отклоняет заказ, а не подтверждает его. Иначе аккуратно оформленный JSON будет исправно и незаметно исполнять неверные транзакции.

Частые вопросы

Что такое OrderBench?

OrderBench — детерминированный бенчмарк для агентов ресторанных заказов, представленный в июле 2026 года. Он раздельно оценивает шесть свойств ответа, включая небезопасные подтверждения заказов, которых валидатор JSON-схемы не замечает.

Гарантирует ли JSON-схема правильность заказа?

Нет. По данным исследования, у сильнейшей модели оба режима дают 100% валидности по схеме, но семантическая точность — около 80%, а у слабых моделей двузначный процент заказов проходит схему, оставаясь небезопасным.

Что значит fail-closed для агента?

Fail-closed — это принцип, при котором агент при любой неоднозначности отклоняет действие, а не подтверждает его. Авторы OrderBench называют его вместе с доменной верификацией обязательным дополнением к структурированному выводу, поскольку сама JSON-схема небезопасные заказы не отсекает.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…