OrderBench: почему JSON-схема не спасает LLM-агентов от опасных заказов
Исследователи представили OrderBench — бенчмарк для ресторанных LLM-агентов. Оказалось, даже при 100% соответствии JSON-схеме около 20% заказов у сильнейшей модели семантически неверны, а у слабых моделей двузначный процент небезопасных подтверждений проходит проверку схемы. Вывод: структурированный вывод убирает ошибки парсинга, но не заменяет доменную проверку.
Procesado por IA desde arXiv cs.AI; editado por Hamidun News
En julio de 2026, investigadores presentaron OrderBench, un benchmark determinista para agentes LLM de restaurantes que demostró lo siguiente: incluso cuando un modelo genera un JSON con un 100% de conformidad con el esquema, alrededor del 20% de los pedidos del modelo más fuerte siguen siendo semánticamente incorrectos. La conclusión del estudio es sencilla: la salida estructurada elimina los errores de parseo, pero no garantiza que la transacción sea segura y precisa.
Qué es OrderBench
OrderBench es una prueba determinista que mide por separado seis propiedades de la respuesta de un agente: corrección sintáctica, validez según el esquema, corrección de la decisión de estado, semántica precisa de los ítems, preservación de restricciones y confirmaciones de pedido inseguras. La motivación es que los LLM funcionan cada vez más como un "compilador de transacciones": el usuario formula su intención con palabras comunes, el modelo genera un objeto estructurado y una API lo ejecuta. JSON Schema y los modos de salida estructurada de los proveedores eliminan toda una clase de errores de parseo, pero por sí solos no determinan si la transacción que el agente está a punto de ejecutar es correcta y segura.
Qué mostró el experimento
Los autores realizaron 2400 llamadas a través de la plataforma Nebius Token Factory a cuatro modelos abiertos en dos modos: prompt normal y esquema JSON forzado. El resultado principal: una respuesta válida según el esquema puede seguir conteniendo errores semánticos graves. En el modelo más fuerte, ambos modos dan un 100% de validez según el esquema, pero el éxito semántico se mantiene alrededor del 80%, es decir, uno de cada cinco pedidos es formalmente correcto pero, en esencia, incorrecto. En los modelos más débiles, la proporción de confirmaciones de pedido válidas según el esquema pero inseguras se mide en porcentajes de dos dígitos.
- Benchmark: OrderBench, determinista, para pedidos de restaurante
- Volumen: 2400 llamadas a cuatro modelos abiertos
- Plataforma: Nebius Token Factory
- Modos: solo prompt y esquema JSON forzado
- Cifra clave: 100% de validez según el esquema con ~80% de precisión semántica en el mejor modelo
Por qué el esquema no salva la situación
La validez según el esquema y la corrección del pedido son cosas distintas, y esa es la conclusión central del estudio. Un esquema JSON solo garantiza la forma del objeto: los campos necesarios están presentes y los tipos coinciden. No verifica que el agente haya elegido exactamente el producto correcto, que haya preservado las restricciones —alergias, sustituciones, cantidad— ni que no haya confirmado un pedido que debía rechazarse. Esa confirmación insegura resulta completamente invisible para el validador del esquema: el objeto pasa la verificación y se envía a la API para su ejecución, aunque en esencia sea erróneo o peligroso.
"La salida estructurada es una capa de interfaz necesaria, pero no un
sustituto de la verificación de dominio y la ejecución fail-closed", se afirma en el resumen del estudio en arXiv.
Qué significa esto
La salida estructurada resuelve el problema del parseo, pero no el problema de la confianza. Para los desarrolladores de sistemas agénticos, el estudio recomienda directamente no confiar en el esquema como garantía: se necesita una segunda capa —verificación de dominio y el principio fail-closed, según el cual, ante cualquier duda, el agente rechaza el pedido en lugar de confirmarlo. De lo contrario, un JSON cuidadosamente formateado seguirá ejecutando transacciones incorrectas de forma correcta en apariencia y sin que nadie lo note.
Preguntas frecuentes
¿Qué es OrderBench?
OrderBench es un benchmark determinista para agentes de pedidos de restaurante, presentado en julio de 2026. Evalúa por separado seis propiedades de la respuesta, incluidas las confirmaciones de pedido inseguras que el validador de esquema JSON no detecta.
¿Garantiza un esquema JSON la corrección del pedido?
No. Según el estudio, en el modelo más fuerte ambos modos dan un 100% de validez según el esquema, pero la precisión semántica es de alrededor del 80%, mientras que en los modelos más débiles un porcentaje de dos dígitos de los pedidos pasa el esquema y sigue siendo inseguro.
¿Qué significa fail-closed para un agente?
Fail-closed es el principio según el cual, ante cualquier ambigüedad, el agente rechaza la acción en lugar de confirmarla. Los autores de OrderBench lo consideran, junto con la verificación de dominio, un complemento obligatorio de la salida estructurada, ya que el esquema JSON por sí solo no filtra los pedidos inseguros.
¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?
Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.