arXiv cs.CL→ original

CRA-Bench и CRA-Net: как ловить вред, который копится по ходу диалога с LLM

Исследователи выложили на arXiv фреймворк CRA — систему защиты LLM, которая отслеживает риск на протяжении всего диалога, а не в отдельном сообщении. Идея: вредная цель может собираться постепенно из безобидных ходов. Вместе с работой открыт бенчмарк CRA-Bench — 1200 сессий по 8 ходов в трёх семействах угроз, плюс расширенный набор на 2000 сессий.

Processado por IA de arXiv cs.CL; editado por Hamidun News
CRA-Bench и CRA-Net: как ловить вред, который копится по ходу диалога с LLM
Fonte: arXiv cs.CL. Colagem: Hamidun News.
◐ Ouvir artigo

CRA-Bench e CRA-Net: como detectar o dano que se acumula ao longo de

uma conversa com um LLM

Em julho de 2026, uma equipe de pesquisadores publicou no arXiv o artigo «Stateful Guardrails for Multi-Turn LLM Systems» — um framework chamado CRA que rastreia o acúmulo de risco ao longo de toda a conversa com um modelo de linguagem, e não em uma única mensagem isolada, e lançou o benchmark CRA-Bench com 1200 sessões rotuladas.

Por que os guardrails comuns deixam passar o dano

A maioria dos sistemas de segurança para LLM avalia cada par «pergunta-resposta» isoladamente — e não percebe ataques que se constroem gradualmente, turno a turno. Os autores chamam isso de Conversational Risk Accumulation (CRA) e identificam três formas de acúmulo de risco: a conversa se afasta suavemente de um tema inofensivo, uma instrução proibida é montada aos poucos a partir de mensagens separadas, e dados sensíveis se acumulam por meio de revelações repetidas.

«Turnos individualmente inofensivos se somam em dano» — é assim que os

autores formulam a essência do problema no resumo do arXiv.

O que o CRA Framework rastreia

O CRA Framework opera no nível da sessão e monitora três sinais da trajetória da conversa. O primeiro é o desvio semântico em relação à «âncora» da sessão: o quanto a conversa se afastou do tema original. O segundo é um grafo de acúmulo de informação sobre as entidades extraídas, ponderado por sua sensibilidade. O terceiro é um «gradiente de complacência»: um sinal da crescente disposição do modelo em executar pedidos cada vez mais arriscados.

Principais fatos do trabalho:

  • O termo — Conversational Risk Accumulation (CRA): desvio de intenção, montagem de instruções proibidas por partes, acúmulo de sensibilidade
  • Três sinais — desvio semântico, grafo de acúmulo de informação, gradiente de complacência
  • Dois métodos de pontuação — unsupervised convex fusion e um modelo treinável, CRA-Net DA, com objetivos family-adversarial
  • CRA-Bench v0.1 — 1200 sessões de 8 turnos, três famílias de ameaças com «gêmeos benignos» sobre o mesmo tema
  • Conjunto ampliado — 2000 sessões, cinco famílias (com adição de persona priming e context stuffing)

Para a pontuação, os autores propõem duas abordagens: unsupervised convex fusion — uma combinação linear de sinais sem treinamento, conveniente para analisar a contribuição de cada um —, e CRA-Net DA, um modelo de trajetória compacto e treinável, treinado com objetivos family-adversarial, para que a duração e a diversidade de temas da conversa não substituam o sinal de uma ameaça real.

Como a eficácia foi medida

Os autores lançaram de uma só vez três versões do benchmark. O CRA-Bench v0.1 contém 1200 sessões de oito turnos em três famílias de ameaças, e cada sessão nociva é pareada com um «gêmeo» benigno sobre o mesmo tema. O CRA-Bench v0.2 traz os mesmos cenários, mas reformulados por outro LLM para remover artefatos de modelo. O conjunto ampliado eleva o volume para 2000 sessões e cinco famílias.

Para a avaliação, propõe-se um protocolo «de trajetória» com divisão no nível da sessão: Trajectory AUROC, uma métrica turns-to-detection (em quantos turnos o sistema percebe o ataque), taxas de falsos positivos calibradas, intervalos de confiança por bootstrap e um teste de estresse leave-one-family-out — quando uma família de ameaças inteira é totalmente excluída do treinamento para testar a generalização.

O que isso significa

A segurança de LLMs está deixando de verificar mensagens isoladas para analisar toda a trajetória da conversa. Ataques de múltiplos turnos, em que o dano é montado a partir de fragmentos aparentemente inofensivos, estão se tornando uma classe de ameaça distinta e mensurável — com um benchmark de mais de 2000 sessões e métricas para detectá-los.

Perguntas frequentes

O que é Conversational Risk Accumulation?

É o acúmulo de risco ao longo de uma conversa com um LLM, quando mensagens individualmente inofensivas se somam gradualmente em dano: a intenção se desvia, uma instrução proibida é montada aos poucos, e dados sensíveis se acumulam por meio de revelações repetidas.

O que compõe o benchmark CRA-Bench?

O CRA-Bench v0.1 são 1200 sessões de oito turnos em três famílias de ameaças, com «gêmeos» benignos pareados por tema. A versão v0.2 adiciona variantes reformuladas por outro modelo, e o conjunto ampliado soma 2000 sessões e cinco famílias de ameaças.

Em que o CRA-Net se diferencia de um filtro simples?

O CRA-Net DA é um modelo compacto e treinável que analisa toda a trajetória da sessão, e não uma mensagem isolada, e foi treinado com objetivos family-adversarial para não confundir a duração e a abrangência de temas da conversa com uma ameaça real.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Quer parar de ler sobre IA e começar a usar?

AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.

O que você acha?
Carregando comentários…