OrderBench: почему JSON-схема не спасает LLM-агентов от опасных заказов
Исследователи представили OrderBench — бенчмарк для ресторанных LLM-агентов. Оказалось, даже при 100% соответствии JSON-схеме около 20% заказов у сильнейшей модели семантически неверны, а у слабых моделей двузначный процент небезопасных подтверждений проходит проверку схемы. Вывод: структурированный вывод убирает ошибки парсинга, но не заменяет доменную проверку.
Processado por IA de arXiv cs.AI; editado por Hamidun News
Em julho de 2026, pesquisadores apresentaram o OrderBench — um benchmark determinístico para agentes LLM de restaurantes que mostrou: mesmo quando um modelo gera um JSON com 100% de conformidade com o esquema, cerca de 20% dos pedidos do modelo mais forte permanecem semanticamente incorretos. A conclusão do estudo é simples: a saída estruturada elimina erros de parsing, mas não garante que a transação seja segura e precisa.
O que é o OrderBench
O OrderBench é um teste determinístico que mede separadamente seis propriedades da resposta de um agente: correção sintática, validade em relação ao esquema, correção da decisão de status, semântica precisa dos itens, preservação de restrições e confirmações de pedido inseguras. A motivação é que os LLMs funcionam cada vez mais como um "compilador de transações": o usuário formula a intenção em palavras comuns, o modelo gera um objeto estruturado e uma API o executa. O JSON Schema e os modos de saída estruturada dos provedores eliminam toda uma classe de erros de parsing — mas, por si só, não determinam se a transação que o agente está prestes a executar é correta e segura.
O que o experimento mostrou
Os autores fizeram 2400 chamadas pela plataforma Nebius Token Factory para quatro modelos abertos em dois modos — prompt normal e esquema JSON forçado. O principal resultado: uma resposta válida em relação ao esquema ainda pode carregar erros semânticos graves. No modelo mais forte, os dois modos geram 100% de validade de esquema, mas o sucesso semântico se mantém em torno de 80% — ou seja, um em cada cinco pedidos é formalmente correto, mas essencialmente errado. Nos modelos mais fracos, a proporção de confirmações de pedido válidas quanto ao esquema, mas inseguras, é medida em percentuais de dois dígitos.
- Benchmark: OrderBench, determinístico, para pedidos de restaurante
- Volume: 2400 chamadas a quatro modelos abertos
- Plataforma: Nebius Token Factory
- Modos: apenas prompt e esquema JSON forçado
- Número-chave: 100% de validade de esquema com ~80% de precisão semântica no melhor modelo
Por que o esquema não resolve
Validade de esquema e correção do pedido são coisas diferentes, e essa é a conclusão central do estudo. Um esquema JSON garante apenas a forma do objeto: os campos necessários estão presentes e os tipos coincidem. Ele não verifica se o agente escolheu exatamente o item certo, se preservou as restrições — alergias, substituições, quantidade — nem se deixou de confirmar um pedido que deveria ter sido rejeitado. Essa confirmação insegura permanece totalmente invisível para o validador de esquema: o objeto passa na verificação e segue para a API para execução, mesmo sendo, em essência, errado ou perigoso.
"A saída estruturada é uma camada de interface necessária, mas não
substitui a verificação de domínio e a execução fail-closed", afirma o resumo do estudo no arXiv.
O que isso significa
A saída estruturada resolve o problema do parsing, mas não o problema da confiança. Para desenvolvedores de sistemas agênticos, o estudo recomenda diretamente não confiar no esquema como garantia: é preciso uma segunda camada — verificação de domínio e o princípio fail-closed, segundo o qual, diante de qualquer dúvida, o agente rejeita o pedido em vez de confirmá-lo. Caso contrário, um JSON bem formatado continuará executando transações incorretas de forma correta na aparência e sem que ninguém perceba.
Perguntas frequentes
O que é o OrderBench?
O OrderBench é um benchmark determinístico para agentes de pedidos de restaurante, apresentado em julho de 2026. Ele avalia separadamente seis propriedades da resposta, incluindo confirmações de pedido inseguras que o validador de esquema JSON não detecta.
Um esquema JSON garante a correção do pedido?
Não. Segundo o estudo, no modelo mais forte os dois modos geram 100% de validade de esquema, mas a precisão semântica é de cerca de 80%, enquanto nos modelos mais fracos um percentual de dois dígitos dos pedidos passa pelo esquema permanecendo inseguro.
O que significa fail-closed para um agente?
Fail-closed é o princípio segundo o qual, diante de qualquer ambiguidade, o agente rejeita a ação em vez de confirmá-la. Os autores do OrderBench o consideram, junto com a verificação de domínio, um complemento obrigatório da saída estruturada, já que o próprio esquema JSON não filtra pedidos inseguros.
Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?
Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.