Anthropic Abriu uma Janela para o Pensamento de Claude: Ferramenta Jacobian Lens Captura Conceitos Ocultos
Anthropic apresentou Jacobian Lens — uma ferramenta de interpretabilidade que abre a caixa preta dos LLMs. A ferramenta mostra quais conceitos são ativados nas camadas intermediárias de Claude ao responder uma pergunta. Do mundano ao incomum: o modelo cria representações ocultas de ideias não visíveis na saída normal. Isso oferece uma visão ingênua de como LLMs 'pensam'.
Processado por IA de MIT Technology Review; editado por Hamidun News
Anthropic desenvolveu a técnica Jacobian lens, que oferece a visão mais clara até agora do que acontece dentro do Claude quando ela responde perguntas ou realiza tarefas.
O Que Encontram
Quando Claude responde a uma pergunta, o Jacobian lens mostra a ativação em camadas intermediárias. Os resultados variam do cotidiano (ativação de uma camada relacionada a números ao resolver matemática) ao inusitado (conceitos ocultos que não aparecem na saída explícita).
Como Funciona
Em vez de revisar pesos e ativações às cegas, a ferramenta usa matemática Jacobiana (matriz de derivadas) para rastrear como mudanças na entrada afetam as representações intermediárias. Isso permite:
- Ver quais conceitos abstratos o modelo ativa
- Rastrear o caminho da lógica da entrada até a saída
- Entender quais cadeias incorretas de raciocínio levam a respostas erradas
Significado para a Segurança
Descobrindo conceitos ocultos é importante para a segurança de IA: se vermos que o modelo ativa conceitos perigosos, mesmo que a resposta final seja segura, podemos corrigi-lo.
Quer parar de ler sobre IA e começar a usar?
AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.