Habr lançou a segunda parte do guia de Activation Steering—repeng, pyreft e vetor exato
Uma segunda parte de uma série sobre Activation Steering foi postada no Habr—uma técnica para controlar o comportamento do modelo de linguagem através da modificação direta de suas ativações internas. Na primeira parte, os autores implementaram steering básico de três formas: via PyTorch hooks brutos, via nnsight e via pyvene, mas encontraram problemas—o vetor foi invertido, o efeito foi moderado e desapareceu em alguns prompts. Na segunda parte, os métodos repeng, pyreft e outros são analisados que devem encontrar o vetor com mais precisão.
Processado por IA de Habr AI; editado por Hamidun News
O autor de um blog técnico no Habr lançou a segunda parte de um guia sobre activation steering—uma técnica para controlar o comportamento do modelo de linguagem alterando diretamente suas ativações internas—e explica como encontrar um vetor de controle com mais precisão usando as bibliotecas repeng e pyreft.
O que Não Funcionou na Primeira Parte
Na primeira parte do guia, intitulada "Puxe para Onde Você Precisa: Tutorial de Activation Steering", o autor implementou a ideia básica de steering de três formas—através de hooks PyTorch brutos, através da biblioteca nnsight e através da biblioteca pyvene. A ideia do steering em si é adicionar um vetor especial às ativações da rede neural intermediária e deslocar sua resposta na direção desejada sem modificar os pesos do modelo.
- Três métodos da primeira parte: hooks PyTorch brutos, biblioteca nnsight, biblioteca pyvene
- A abordagem básica funcionou—o modelo respondeu ao vetor de controle
- Mas o resultado estava longe de ser ideal: o vetor se mostrou invertido, o efeito foi moderado e em alguns prompts não havia efeito algum
"A nossa base funcionou?
Sim—vimos isso. Foi normal? Não—e vimos isso também: o vetor se mostrou invertido, o efeito foi moderado e em alguns prompts não havia efeito", escreve o autor do guia sobre activation steering no Habr.
Quais Ferramentas São Testadas na Segunda Parte
Na segunda parte do guia, o autor passa de ferramentas de interpretabilidade universal para bibliotecas projetadas especificamente para encontrar um vetor de controle mais preciso—repeng, pyreft e outros métodos. O tema da segunda parte é exatamente como corrigir as deficiências encontradas na primeira parte e como implementá-la em Python.
A diferença na abordagem é fundamental: se nnsight e pyvene são bibliotecas universais para trabalhar com estados internos do modelo, então repeng e pyreft foram criados especificamente para a tarefa de encontrar um vetor de controle, o que significa que potencialmente produzem resultados mais previsíveis onde o método básico produziu um vetor invertido ou efeito fraco.
O simples fato de o autor precisar de uma segunda parte do guia mostra: implementar steering "na frente" através de hooks PyTorch brutos não é suficiente para resultados estáveis—a metodologia requer instrumentação separada especificamente para busca de vetor, não apenas para aplicá-lo às ativações do modelo.
O que Isso Significa
O activation steering permanece uma área onde a ideia básica—deslocar as ativações internas de um modelo na direção desejada—é implementada através de um conjunto constantemente crescente de ferramentas; a escolha da biblioteca afeta diretamente quão previsível e preciso é o controle do modelo.
Perguntas Frequentes
Que
Problemas a Abordagem Básica do Activation Steering Tinha?
Na primeira parte do guia, o vetor de controle encontrado usando o método básico se mostrou invertido, deu apenas efeito moderado e não funcionou em absoluto em alguns prompts.
Que Ferramentas Foram Usadas na Primeira Parte do Guia?
Três métodos: hooks PyTorch brutos, biblioteca nnsight e biblioteca pyvene—todas básicas, sem especialização em encontrar um vetor de controle.
Como repeng e pyreft
Diferem das Ferramentas da Primeira Parte?
Foram criados especificamente para buscar e ajustar um vetor de controle, não para trabalho geral com ativações internas do modelo como nnsight e pyvene—este é o tema da segunda parte do guia.
Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?
Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.