arXiv cs.LG→ original

Cientistas Mostram Como Codificação Posicional RoPE Molda a "Impressão Digital" de Cabeças de Atenção em LLMs

Cientistas analisaram sete modelos pré-treinados com três esquemas de codificação posicional — RoPE, learned-absolute e ALiBi. Descobriu-se que o tipo de codificação prediz quase perfeitamente a estrutura matemática ("impressão digital espectral") das cabeças de atenção responsáveis pela indução — o mecanismo de aprendizado em contexto. A divisão por tipos provou ser precisa em cada fatia de dados testada.

Processado por IA de arXiv cs.LG; editado por Hamidun News
Cientistas Mostram Como Codificação Posicional RoPE Molda a "Impressão Digital" de Cabeças de Atenção em LLMs
Fonte: arXiv cs.LG. Colagem: Hamidun News.
◐ Ouvir artigo

Um grupo de pesquisadores publicou um artigo no arXiv explicando como esquemas de codificação posicional — RoPE, learned-absolute ou ALiBi — determinam a estrutura matemática das cabeças de atenção "indução" em transformadores, que é o mecanismo subjacente à capacidade do modelo de aprender em contexto.

O Que Exatamente Foi Medido

A pontuação de atenção antes de softmax é descrita por uma forma bilinear com uma matriz aprendida M = W_q^T W_k. Como esta matriz é normalmente não-simétrica, ela tem um espectro complexo de autovalores — e é precisamente este espectro que os autores usaram como uma "impressão digital" de como uma cabeça de atenção é estruturada internamente. O trabalho foi validado em sete modelos pré-treinados com três esquemas de codificação posicional diferentes, focando em cabeças "previous-token" e "induction" — mecanismos responsáveis por encontrar tokens anteriores similares e prever o próximo por analogia.

  • Sete modelos pré-treinados e três esquemas de codificação posicional foram examinados — RoPE, learned-absolute, ALiBi
  • O agrupamento de modelos por tipo de codificação foi preciso em cada seção examinada (p = 0,029)
  • Nos checkpoints de Pythia, uma assinatura espectral "rotacional" aparece simultaneamente com a formação do comportamento indutivo, não antes
  • Em modelos brinquedo de duas camadas, o aprendizado contorna a restrição do canal espectral, mas com atraso (q_BH ≤ 0,016)
  • Impor simetria de matriz diminui o treinamento de modelos com codificação learned-absolute 2,9 vezes

O Que o Experimento de Bloqueio Mostrou

Em cabeças usando RoPE, o espectro se mostrou "rotacional" — anular a componente de fase desativava completamente a indução na cabeça pré-identificada em todos os três modelos de RoPE. Em modelos com codificação learned-absolute e ALiBi, onde a posição é considerada fora da matriz de atenção em vez de dentro, o espectro se comportava diferentemente — "substancial", sem rotação pronunciada. Ao mesmo tempo, em modelos brinquedo os autores mostraram: se você explicitamente proibir uma cabeça de usar o canal espectral, o aprendizado simplesmente encontra uma solução alternativa e restaura a capacidade de induzir, apenas com formação retardada.

O Que Isso Significa

O artigo mostra que a escolha do esquema de codificação posicional não é um detalhe técnico, mas um fator que determina qual "linguagem" interna o modelo usa para resolver a tarefa de aprendizado em contexto. Para interpretabilidade de LLM, isso significa que análise espectral de matrizes de atenção pode ser usada como uma ferramenta de diagnóstico, mas a "impressão digital" espectral em si é uma consequência do treinamento, não uma restrição rígida sobre o que o modelo é capaz de aprender.

Perguntas Frequentes

O Que São Cabeças de Indução em Transformadores?

São cabeças de atenção que encontram um token no contexto similar ao atual e predizem o próximo token por analogia com o que veio após um token similar antes — um mecanismo fundamental responsável pela capacidade do modelo de aprender diretamente no contexto de um prompt (aprendizado em contexto).

Qual

Esquema de Codificação Posicional Se Mostrou Mais Flexível?

RoPE — o único dos três esquemas onde uma cabeça de atenção pode transmitir informação direcionalmente através do canal de fase mesmo se sua matriz de peso é simétrica; com codificação learned-absolute tal capacidade é perdida, o que diminui o treinamento quando simetria é artificialmente imposta 2,9 vezes.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…