Hugging Face Blog→ original

Nunchaku Lite: 4-битная генерация изображений в Diffusers — до 50% меньше VRAM

Hugging Face выпустила Nunchaku Lite — интеграцию 4-битного инференса диффузионных моделей прямо в библиотеку Diffusers. Технология сжимает до 4 бит и веса, и активации, снижая расход видеопамяти до 50% и ускоряя генерацию картинок примерно на 30%. На RTX PRO 6000 пик VRAM падает с 31 до 20 ГБ, а в связке с torch.compile ускорение доходит до 1,8x.

Procesado por IA desde Hugging Face Blog; editado por Hamidun News
Nunchaku Lite: 4-битная генерация изображений в Diffusers — до 50% меньше VRAM
Fuente: Hugging Face Blog. Collage: Hamidun News.
◐ Escuchar artículo

El 23 de julio de 2026, HuggingFace lanzó NunchakuLite, una integración nativa de inferencia en 4 bits para modelos de difusión en la biblioteca Diffusers, que reduce el consumo de memoria de video hasta en un 50% y acelera la generación de imágenes en aproximadamente un 30%.

Qué son Nunchaku y SVDQuant

Nunchaku es un motor de inferencia CUDA que implementa el método de cuantización SVDQuant para transformadores de difusión. La integración NunchakuLite es la primera en llevar esta tecnología directamente a Diffusers: el modelo se carga con el `from_pretrained()` habitual, sin un pipeline separado ni compilación manual, y los kernels CUDA necesarios se descargan automáticamente a través del paquete `kernels` en la primera ejecución.

La diferencia clave de Nunchaku respecto a la mayoría de los backends es el modo W4A4: tanto los pesos como las activaciones se comprimen a 4 bits. Los métodos habituales de solo pesos (weight-only) reducen la memoria pero no aceleran el cómputo; aquí se acelera el propio bucle de eliminación de ruido (denoising).

«SVDQuant traslada los valores atípicos de las activaciones a los

pesos, representa la parte más pesada de cada matriz de pesos con una pequeña rama de bajo rango (low-rank) de 16 bits, y cuantiza el residuo restante a 4 bits», señala el blog técnico de HuggingFace.

El método SVDQuant se basa en un artículo publicado en noviembre de 2024 en arXiv por el equipo del MIT HAN Lab. Para las capas pesadas (attention y MLP) funciona el kernel `svdq_w4a4` con corrección de bajo rango, y para las capas de modulación, `awq_w4a16` con pesos de 4 bits y activaciones de 16 bits.

Cuánto se acelera la generación

En una GPU RTX PRO 6000 con resolución de 1024×1024, NunchakuLite ofrece una ganancia medible en todas las métricas. La ejecución base en BF16 toma 3,00 segundos y 31,1 GB de memoria de video; en formato NVFP4, ya son 2,27 segundos y 20,6 GB.

  • BF16 (referencia): 3,00 s, 31,1 GB de memoria — aceleración 1,0x
  • NVFP4: 2,27 s, 20,6 GB — aceleración 1,35x
  • NVFP4 + torch.compile: 1,68 s, 20,6 GB — aceleración 1,8x
  • NVFP4 + codificador de texto NF4: 2,29 s, 16,0 GB de memoria
  • Modelo ERNIE-Image-Turbo: 1024×1024 en ~1,7 s en una RTX 5090 (~12 GB frente a ~24 GB en BF16)

La combinación con `torch.compile` acelera la generación hasta 1,8 veces, y sustituir el codificador de texto por NF4 reduce el pico de memoria a 16,0 GB, suficiente para ejecutar modelos pesados en tarjetas de consumo.

Qué hardware y modelos están soportados

NunchakuLite funciona en la mayoría de las GPU NVIDIA modernas, pero el esquema de cuantización depende de la arquitectura. El formato NVFP4 mediante el kernel `svdq_w4a4` requiere Blackwell (RTX 50, RTX PRO 6000, B200), mientras que en Turing, Ampere y Ada (RTX 30/40, A100, L40S) se usa INT4. Las arquitecturas Volta y Hopper no son compatibles: al cargar, el validador devuelve de inmediato un error claro.

Los modelos listos para usar ya se han publicado en la organización lite-infer en HuggingFace Hub: ERNIE-Image-Turbo (en variantes INT4 y NVFP4), Krea 2 Turbo (NVFP4) y FLUX.2 Klein 4B. Para cuantizar sus propios modelos, el equipo lanzó la herramienta diffuse-compressor: inspecciona el modelo, realiza la calibración SVDQuant, arma un pipeline de Diffusers y publica el resultado en el Hub.

Qué significa esto

La inferencia en 4 bits deja de ser cosa de forks aislados y llega a la biblioteca principal de generación de imágenes. Los desarrolladores obtienen la mitad del consumo de VRAM y una aceleración notable prácticamente con una sola línea de código: esto hace que los modelos de difusión más avanzados sean accesibles en tarjetas gráficas de juego comunes.

Preguntas frecuentes

¿En qué tarjetas gráficas funciona NunchakuLite?

El formato NVFP4 requiere tarjetas Blackwell: RTX 50, RTX PRO 6000 o B200. En RTX 30/40, A100 y L40S funciona el esquema INT4. Las arquitecturas Volta y Hopper no son compatibles en absoluto.

¿Cuánta menos memoria de video se necesita?

En la RTX PRO 6000, el pico de VRAM baja de 31,1 GB en BF16 a 20,6 GB en NVFP4, y con el codificador de texto NF4, a 16,0 GB, es decir, casi la mitad.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?

Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).

¿Qué te parece?
Cargando comentarios…