arXiv cs.LG→ original

Jet-Long amplia a janela de contexto de modelos de linguagem para 128K sem fine-tuning

Pesquisadores apresentaram o Jet-Long, um método tuning-free para ampliar a janela de contexto de modelos de linguagem sem fine-tuning. No Qwen3 com contexto de 128K, ele superou todos os métodos zero-shot existentes em RULER e HELMET-RAG, enquanto o prefill em GPUs H100 acelerou em até 1,39× em relação ao FlashAttention 2. A sobrecarga na geração não passa de 4% em qualquer comprimento de contexto.

Processado por IA de arXiv cs.LG; editado por Hamidun News
Jet-Long amplia a janela de contexto de modelos de linguagem para 128K sem fine-tuning
Fonte: arXiv cs.LG. Colagem: Hamidun News.
◐ Ouvir artigo

Jet-Long é um método para estender a janela de contexto de modelos de linguagem sem ajuste fino, publicado no arXiv em 10 de julho de 2026. Em testes em Qwen3 com contexto até 128K tokens, o método superou todos os baselines zero-shot existentes em precisão, e o prefill-throughput em GPU H100 acelerou para 1.39× em relação ao FlashAttention 2.

Por que estender o contexto é um problema tão grande

A maioria dos LLMs abertos são treinados com janelas de contexto de 4K–32K tokens, enquanto tarefas reais — RAG, sistemas de agentes com traços acumulados de ferramentas, análise de repositórios inteiros — regularmente requerem dez vezes mais. Ajuste fino de cada ponto de verificação para contexto longo é caro: você precisa de exemplos de treinamento longos, memória GPU adicional e tempo de processamento. É por isso que os métodos de dimensionamento RoPE zero-shot se tornaram o caminho de implantação padrão.

RoPE (Rotary Position Embedding) é a forma padrão de codificar posições de tokens em transformadores. Durante a inferência além da janela de treinamento, os vetores de posição caem em intervalos que o modelo nunca viu. O redimensionamento "comprime" as posições de volta aos valores conhecidos, mas com compensações inevitáveis: um coeficiente agressivo quebra a qualidade em entradas curtas, um conservador falha com sequências verdadeiramente longas. O valor ideal depende do comprimento da solicitação específica no momento da inferência, e nenhuma constante pode capturá-lo.

Como o Jet-Long funciona

Os autores propõem Dynamic Bifocal RoPE — dois modos de processamento paralelo para embeddings de posição dentro de uma única camada de atenção.

  • Janela local — preserva frequências RoPE padrão para posições curtas para que o modelo se comporte exatamente como durante o treinamento
  • Janela distante — dimensiona as frequências dinamicamente com base no comprimento da sequência atual, não em uma constante predeterminada
  • Mesclagem inclusão-exclusão — combina saídas de ambas as janelas sem contar duplamente os tokens
  • Rotação de correção RoPE on-the-fly — elimina a mudança de fase durante a mesclagem

Toda a construção é implementada em um único kernel CuTe para CUDA, tornando a atenção bifocal praticamente gratuita: nenhuma passagem de GPU adicional. O prefill acelera para 1.39× do FlashAttention 2 em H100 — aproximando-se do FlashAttention 4, que requer chips Hopper e indisponível em GPUs mais antigas. A sobrecarga durante a geração não excede 4% em nenhum comprimento de contexto.

Quais resultados o Jet-Long mostrou em contexto de 128K?

O método foi testado na família Qwen3 — 1.7B, 4B e 8B parâmetros — com contexto até 128K tokens.

  • RULER: +4.79 pp para Qwen3-1.7B, +2.18 pp para 4B, +2.03 pp para 8B em relação ao melhor método concorrente
  • HELMET-RAG: melhor resultado geral entre todas as abordagens comparadas (os autores de HELMET destacaram este benchmark como o preditor mais preciso do desempenho real de downstream)
  • Perplexidade PG-19: mínima entre todos os métodos testados

Jet-Long também foi generalizado para arquitetura híbrida Jet-Nemotron com camadas de atenção densa e esparsa alternadas — e alcançou ganhos adicionais sem retreinamento. Os autores enfatizam que o método não requer ajuste manual de hiperparâmetros e funciona "pronto para usar".

O que isso significa

Jet-Long oferece uma maneira prática de estender o contexto de modelos de peso aberto sem ajuste fino, GPUs especiais e hiperparâmetros manuais. Se o método se reproduzir em outras arquiteturas populares — Llama, Mistral, Gemma — pode se tornar uma ferramenta padrão na pilha de inferência para tarefas de contexto longo: sistemas de agentes, análise de documentos e revisão de código no nível do repositório.

Perguntas frequentes

Preciso ajustar fino o modelo para o Jet-Long?

Não. Jet-Long é um método zero-shot sem ajuste: é suficiente conectá-lo a um ponto de verificação existente sem nenhuma execução de treinamento adicional.

Em quais modelos o Jet-Long foi testado?

No preimpresso de 10 de julho de 2026, foram testados Qwen3-1.7B, Qwen3-4B, Qwen3-8B e arquitetura híbrida Jet-Nemotron. Testes em Llama, Mistral ou outras famílias não são fornecidos no artigo.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…