arXiv cs.AI→ оригинал

Агенты на GPT-4o-mini и GPT-5.2 незаметно нарушают правила в тестах τ²-bench

Учёные изучили ИИ-агентов, которые пользуются инструментами, на бенчмарке τ²-bench в домене авиаперевозок. У «бюджетного» агента 78% всех сбоев оказались молчаливыми нарушениями политики — без единой ошибки инструмента. Набор из четырёх детерминированных проверок перед действием поднял успех с 29,6% до 42,0% на gpt-4o-mini. Похожий эффект нашли и на флагманской gpt-5.2.

AI-обработка оригинала arXiv cs.AI; редакция Hamidun News
Агенты на GPT-4o-mini и GPT-5.2 незаметно нарушают правила в тестах τ²-bench
Источник: arXiv cs.AI. Коллаж: Hamidun News.
◐ Слушать статью

Исследователи изучили ИИ-агентов на базе больших языковых моделей, которые пользуются инструментами (tool-using LLM agents), и обнаружили, что такие агенты способны молча нарушать те самые политики, которые должны соблюдать, — при этом задача выглядит выполненной успешно. Работа опубликована в arXiv 7 июля 2026 года.

Что такое молчаливое нарушение политики

В средах, где инструмент технически может выполнить любой корректно оформленный вызов даже вопреки правилам домена (policy-permissive environments), возникает «тихое неверное состояние»: отменённое бронирование, изменённое число пассажиров, обработанная без проверки претензия. Ни сам инструмент, ни отчёт агента о своих действиях не сигнализируют об ошибке.

Команда протестировала этот сценарий на бенчмарке τ²-bench в домене авиаперевозок. У «бюджетного» агента 78% всех зафиксированных сбоев оказались именно молчаливыми нарушениями состояния без единой ошибки инструмента, причём совокупная частота сбоев воспроизводится на независимых наборах сидов, а не является шумом выборки.

Насколько помогают детерминированные ворота

Авторы предложили лёгкое вмешательство — детерминированные, доступные только для чтения проверки (gates), которые изучают предложенный вызов и текущее состояние системы до того, как разрешить запись.

  • Набор из четырёх ворот поднял успех на полном бенчмарке с 29,6% до 42,0% на модели gpt-4o-mini (+12,4 процентного пункта; P=0,0012)
  • Эффект воспроизвёлся на независимом наборе из 15 сидов (+12,3 п.п.; P=0,0008)
  • На 26 из 50 задач, где ворота реально срабатывали, успех вырос на +19,2 п.п.
  • На флагманской модели gpt-5.2 с настройками рассуждений по умолчанию тот же набор ворот поднял успех с 61,2% до 71,6% (+10,4 п.п.; P=0,020, но на выборке всего из 5 прогонов и без повторения эксперимента)

Два негативных контроля — самодостаточный retail-домен, где инструменты сами следят за политикой, и бенчмарк BFCL — очертили границы метода: ворота помогают там, где инструменты допускают нарушение политики, и почти не дают эффекта там, где инструменты и так самостоятельно её соблюдают.

Что это значит

Даже флагманские модели вроде gpt-5.2 продолжают пытаться выполнять нарушающие политику записи — проблема не исчезает с ростом качества модели. Авторы подчёркивают, что детерминированные ворота не гарантируют успех задачи целиком, но надёжно перекрывают конкретный класс молчаливых нарушений на границе действия — именно там, где агент вот-вот собирается что-то реально изменить в системе.

Частые вопросы

Что такое τ²-bench?

Это бенчмарк для тестирования ИИ-агентов с инструментами в домене авиаперевозок, на котором исследователи выявили и измерили молчаливые нарушения политики.

Как работают детерминированные ворота?

Это доступные только для чтения проверки, которые до выполнения записи анализируют предложенный вызов инструмента и текущее состояние системы и блокируют вызовы, нарушающие правила домена.

Работает ли метод на топовых моделях?

Да: на gpt-5.2 с рассуждением по умолчанию тот же набор из четырёх ворот поднял успех с 61,2% до 71,6%, хотя авторы отмечают, что этот результат получен на малой выборке из 5 прогонов и пока не воспроизведён.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…