arXiv cs.CL→ оригинал

CRA-Bench и CRA-Net: как ловить вред, который копится по ходу диалога с LLM

Исследователи выложили на arXiv фреймворк CRA — систему защиты LLM, которая отслеживает риск на протяжении всего диалога, а не в отдельном сообщении. Идея: вредная цель может собираться постепенно из безобидных ходов. Вместе с работой открыт бенчмарк CRA-Bench — 1200 сессий по 8 ходов в трёх семействах угроз, плюс расширенный набор на 2000 сессий.

AI-обработка оригинала arXiv cs.CL; редакция Hamidun News
CRA-Bench и CRA-Net: как ловить вред, который копится по ходу диалога с LLM
Источник: arXiv cs.CL. Коллаж: Hamidun News.
◐ Слушать статью

Команда исследователей в июле 2026 года выложила на arXiv работу «Stateful Guardrails for Multi-Turn LLM Systems» — фреймворк CRA, который отслеживает накопление риска на протяжении всего диалога с языковой моделью, а не в отдельном сообщении, и открыла бенчмарк CRA-Bench из 1200 размеченных сессий.

Почему обычные guardrails пропускают вред

Большинство систем безопасности для LLM оценивают каждую пару «запрос-ответ» изолированно — и не замечают атак, которые собираются постепенно, ход за ходом. Авторы называют это Conversational Risk Accumulation (CRA) и выделяют три формы накопления риска: диалог плавно уходит от безобидной темы, запрещённая инструкция собирается по кускам из отдельных сообщений, а чувствительные данные копятся через повторные раскрытия.

«Безобидные по отдельности ходы складываются во вред», — так авторы

формулируют суть проблемы в аннотации на arXiv.

Что отслеживает CRA Framework

CRA Framework работает на уровне сессии и следит за тремя сигналами траектории диалога. Первый — семантический дрейф от «якоря» сессии: насколько далеко разговор ушёл от изначальной темы. Второй — граф накопления информации по извлечённым сущностям, взвешенный по их чувствительности. Третий — «градиент уступчивости»: сигнал растущей готовности модели выполнять всё более рискованные запросы.

Ключевые факты работы:

  • Термин — Conversational Risk Accumulation (CRA): дрейф намерения, сборка запрещённых инструкций по частям, накопление чувствительности
  • Три сигнала — семантический дрейф, граф накопления информации, градиент уступчивости
  • Два метода оценки — unsupervised convex fusion и обучаемая модель CRA-Net DA с family-adversarial целями
  • CRA-Bench v0.1 — 1200 сессий по 8 ходов, три семейства угроз с «доброкачественными близнецами» по теме
  • Расширенный набор — 2000 сессий, пять семейств (добавлены persona priming и context stuffing)

Для скоринга авторы предлагают два подхода: unsupervised convex fusion — линейное объединение сигналов без обучения, удобное для разбора вклада каждого, — и CRA-Net DA, компактную обучаемую модель траектории, натренированную с family-adversarial целями, чтобы длина и разнообразие тем разговора не подменяли собой сигнал реальной угрозы.

Как измеряли эффективность

Авторы выпустили сразу три версии бенчмарка. CRA-Bench v0.1 содержит 1200 восьмиходовых сессий в трёх семействах угроз, к каждой вредной подобран безобидный «двойник» на ту же тему. CRA-Bench v0.2 — те же сценарии, но перефразированные другой LLM, чтобы убрать шаблонные артефакты. Расширенный набор доводит объём до 2000 сессий и пяти семейств.

Для оценки предложен «траекторный» протокол с разбиением на уровне сессий: Trajectory AUROC, метрика turns-to-detection (за сколько ходов система замечает атаку), калиброванные показатели ложных срабатываний, бутстрэп-доверительные интервалы и стресс-тест leave-one-family-out — когда одно семейство угроз полностью исключают из обучения, чтобы проверить обобщение.

Что это значит

Безопасность LLM сдвигается от проверки одиночных сообщений к анализу всей траектории диалога. Многоходовые атаки, где вред собирается из безобидных на вид кусочков, становятся отдельным измеримым классом угроз — с бенчмарком на 2000+ сессий и метриками, на которых их можно ловить.

Частые вопросы

Что такое Conversational Risk Accumulation?

Это накопление риска в ходе диалога с LLM, когда отдельно безобидные сообщения постепенно складываются во вред: намерение дрейфует, запрещённая инструкция собирается по частям, чувствительные данные копятся через повторные раскрытия.

Что входит в бенчмарк CRA-Bench?

CRA-Bench v0.1 — это 1200 сессий по восемь ходов в трёх семействах угроз, с подобранными по теме безобидными «двойниками». Версия v0.2 добавляет перефразированные другой моделью варианты, а расширенный набор — 2000 сессий и пять семейств угроз.

Чем CRA-Net отличается от простого фильтра?

CRA-Net DA — компактная обучаемая модель, которая анализирует всю траекторию сессии, а не отдельное сообщение, и обучена с family-adversarial целями, чтобы не путать длину и охват тем разговора с реальной угрозой.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…