arXiv cs.LG→ original

Jet-Long amplía la ventana de contexto de los modelos de lenguaje a 128K sin fine-tuning

Los investigadores presentaron Jet-Long, un método tuning-free para ampliar la ventana de contexto de los modelos de lenguaje sin fine-tuning. En Qwen3 con un contexto de 128K, superó a todos los métodos zero-shot existentes en RULER y HELMET-RAG, mientras que el prefill en GPUs H100 se aceleró hasta 1,39× frente a FlashAttention 2. La sobrecarga en la generación no supera el 4% con cualquier longitud de contexto.

Procesado por IA desde arXiv cs.LG; editado por Hamidun News
Jet-Long amplía la ventana de contexto de los modelos de lenguaje a 128K sin fine-tuning
Fuente: arXiv cs.LG. Collage: Hamidun News.
◐ Escuchar artículo

Jet-Long es un método para extender la ventana de contexto de modelos de lenguaje sin ajuste fino, publicado en arXiv el 10 de julio de 2026. En pruebas en Qwen3 con contexto hasta 128K tokens, el método superó a todos los baseline cero-disparos existentes en precisión, y el prefill-throughput en GPU H100 se aceleró a 1.39× relativo a FlashAttention 2.

Por qué extender el contexto es tal problema

La mayoría de LLM abiertos se entrenan con ventanas de contexto de 4K–32K tokens, mientras que tareas reales — RAG, sistemas de agentes con trazas de herramientas acumuladas, análisis de repositorios completos — regularmente requieren diez veces más. Ajustar fino cada punto de control para contexto largo es costoso: necesitas ejemplos de entrenamiento largos, memoria GPU adicional y tiempo de procesamiento. Por eso los métodos de escalado RoPE cero-disparos se han convertido en la ruta de despliegue estándar.

RoPE (Rotary Position Embedding) es la forma estándar de codificar posiciones de tokens en transformadores. Durante la inferencia más allá de la ventana de entrenamiento, los vectores de posición caen en rangos que el modelo nunca ha visto. El rescalado "comprime" posiciones nuevamente en valores familiares, pero con compromisos inevitables: un coeficiente agresivo rompe la calidad en entradas cortas, uno conservador falla con secuencias verdaderamente largas. El valor óptimo depende de la longitud de la solicitud específica en el tiempo de inferencia, y ninguna constante puede capturarlo.

Cómo funciona Jet-Long

Los autores proponen Dynamic Bifocal RoPE — dos modos de procesamiento paralelo para incrustaciones de posición dentro de una capa de atención única.

  • Ventana local — preserva frecuencias RoPE estándar para posiciones cortas para que el modelo se comporte exactamente como lo hizo durante el entrenamiento
  • Ventana lejana — escala frecuencias dinámicamente basadas en la longitud actual de la secuencia, no una constante predeterminada
  • Fusión inclusión-exclusión — combina salidas de ambas ventanas sin contar doblemente tokens
  • Rotación de corrección RoPE sobre la marcha — elimina el cambio de fase durante la fusión

La construcción completa se implementa en un único núcleo CuTe para CUDA, haciendo que la atención bifocal sea prácticamente gratuita: sin paso GPU adicional. El prefill se acelera a 1.39× desde FlashAttention 2 en H100 — acercándose a FlashAttention 4, que requiere chips Hopper e inasequible en GPU más antiguos. La sobrecarga durante la generación no excede 4% a ninguna longitud de contexto.

¿Qué resultados mostró Jet-Long en contexto de 128K?

El método fue probado en la familia Qwen3 — 1.7B, 4B y 8B parámetros — con contexto hasta 128K tokens.

  • RULER: +4.79 pp para Qwen3-1.7B, +2.18 pp para 4B, +2.03 pp para 8B relativo al mejor método competitivo
  • HELMET-RAG: mejor resultado general entre todos los enfoques comparados (los autores de HELMET destacaron este punto de referencia como el predictor más preciso del rendimiento real de downstream)
  • Perplejidad PG-19: mínima entre todos los métodos probados

Jet-Long también se generalizó a la arquitectura híbrida Jet-Nemotron con capas de atención denso y disperso alternas — y logró ganancias adicionales sin reentrenamiento. Los autores enfatizan que el método no requiere ajuste manual de hiperparámetros y funciona "out of the box".

Qué significa esto

Jet-Long ofrece una forma práctica de extender el contexto de modelos de peso abierto sin ajuste fino, GPU especial e hiperparámetros manuales. Si el método se reproduce en otras arquitecturas populares — Llama, Mistral, Gemma — podría convertirse en una herramienta estándar en la pila de inferencia para tareas de contexto largo: sistemas de agentes, análisis de documentos y revisión de código a nivel de repositorio.

Preguntas frecuentes

¿Necesito ajustar fino el modelo para Jet-Long?

No. Jet-Long es un método de cero-disparos sin ajuste: es suficiente conectarlo a un punto de control existente sin ningún ejecutable de entrenamiento adicional.

¿En qué modelos se probó Jet-Long?

En el preimpreso del 10 de julio de 2026, se probaron Qwen3-1.7B, Qwen3-4B, Qwen3-8B y arquitectura híbrida Jet-Nemotron. Las pruebas en Llama, Mistral u otras familias no se proporcionan en el artículo.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?

Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).

¿Qué te parece?
Cargando comentarios…