arXiv cs.AI→ original

OrderBench: почему JSON-схема не спасает LLM-агентов от опасных заказов

Исследователи представили OrderBench — бенчмарк для ресторанных LLM-агентов. Оказалось, даже при 100% соответствии JSON-схеме около 20% заказов у сильнейшей модели семантически неверны, а у слабых моделей двузначный процент небезопасных подтверждений проходит проверку схемы. Вывод: структурированный вывод убирает ошибки парсинга, но не заменяет доменную проверку.

Processado por IA de arXiv cs.AI; editado por Hamidun News
OrderBench: почему JSON-схема не спасает LLM-агентов от опасных заказов
Fonte: arXiv cs.AI. Colagem: Hamidun News.
◐ Ouvir artigo

Em julho de 2026, pesquisadores apresentaram o OrderBench — um benchmark determinístico para agentes LLM de restaurantes que mostrou: mesmo quando um modelo gera um JSON com 100% de conformidade com o esquema, cerca de 20% dos pedidos do modelo mais forte permanecem semanticamente incorretos. A conclusão do estudo é simples: a saída estruturada elimina erros de parsing, mas não garante que a transação seja segura e precisa.

O que é o OrderBench

O OrderBench é um teste determinístico que mede separadamente seis propriedades da resposta de um agente: correção sintática, validade em relação ao esquema, correção da decisão de status, semântica precisa dos itens, preservação de restrições e confirmações de pedido inseguras. A motivação é que os LLMs funcionam cada vez mais como um "compilador de transações": o usuário formula a intenção em palavras comuns, o modelo gera um objeto estruturado e uma API o executa. O JSON Schema e os modos de saída estruturada dos provedores eliminam toda uma classe de erros de parsing — mas, por si só, não determinam se a transação que o agente está prestes a executar é correta e segura.

O que o experimento mostrou

Os autores fizeram 2400 chamadas pela plataforma Nebius Token Factory para quatro modelos abertos em dois modos — prompt normal e esquema JSON forçado. O principal resultado: uma resposta válida em relação ao esquema ainda pode carregar erros semânticos graves. No modelo mais forte, os dois modos geram 100% de validade de esquema, mas o sucesso semântico se mantém em torno de 80% — ou seja, um em cada cinco pedidos é formalmente correto, mas essencialmente errado. Nos modelos mais fracos, a proporção de confirmações de pedido válidas quanto ao esquema, mas inseguras, é medida em percentuais de dois dígitos.

  • Benchmark: OrderBench, determinístico, para pedidos de restaurante
  • Volume: 2400 chamadas a quatro modelos abertos
  • Plataforma: Nebius Token Factory
  • Modos: apenas prompt e esquema JSON forçado
  • Número-chave: 100% de validade de esquema com ~80% de precisão semântica no melhor modelo

Por que o esquema não resolve

Validade de esquema e correção do pedido são coisas diferentes, e essa é a conclusão central do estudo. Um esquema JSON garante apenas a forma do objeto: os campos necessários estão presentes e os tipos coincidem. Ele não verifica se o agente escolheu exatamente o item certo, se preservou as restrições — alergias, substituições, quantidade — nem se deixou de confirmar um pedido que deveria ter sido rejeitado. Essa confirmação insegura permanece totalmente invisível para o validador de esquema: o objeto passa na verificação e segue para a API para execução, mesmo sendo, em essência, errado ou perigoso.

"A saída estruturada é uma camada de interface necessária, mas não

substitui a verificação de domínio e a execução fail-closed", afirma o resumo do estudo no arXiv.

O que isso significa

A saída estruturada resolve o problema do parsing, mas não o problema da confiança. Para desenvolvedores de sistemas agênticos, o estudo recomenda diretamente não confiar no esquema como garantia: é preciso uma segunda camada — verificação de domínio e o princípio fail-closed, segundo o qual, diante de qualquer dúvida, o agente rejeita o pedido em vez de confirmá-lo. Caso contrário, um JSON bem formatado continuará executando transações incorretas de forma correta na aparência e sem que ninguém perceba.

Perguntas frequentes

O que é o OrderBench?

O OrderBench é um benchmark determinístico para agentes de pedidos de restaurante, apresentado em julho de 2026. Ele avalia separadamente seis propriedades da resposta, incluindo confirmações de pedido inseguras que o validador de esquema JSON não detecta.

Um esquema JSON garante a correção do pedido?

Não. Segundo o estudo, no modelo mais forte os dois modos geram 100% de validade de esquema, mas a precisão semântica é de cerca de 80%, enquanto nos modelos mais fracos um percentual de dois dígitos dos pedidos passa pelo esquema permanecendo inseguro.

O que significa fail-closed para um agente?

Fail-closed é o princípio segundo o qual, diante de qualquer ambiguidade, o agente rejeita a ação em vez de confirmá-la. Os autores do OrderBench o consideram, junto com a verificação de domínio, um complemento obrigatório da saída estruturada, já que o próprio esquema JSON não filtra pedidos inseguros.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…