Hugging Face Blog→ original

Nunchaku Lite: 4-битная генерация изображений в Diffusers — до 50% меньше VRAM

Hugging Face выпустила Nunchaku Lite — интеграцию 4-битного инференса диффузионных моделей прямо в библиотеку Diffusers. Технология сжимает до 4 бит и веса, и активации, снижая расход видеопамяти до 50% и ускоряя генерацию картинок примерно на 30%. На RTX PRO 6000 пик VRAM падает с 31 до 20 ГБ, а в связке с torch.compile ускорение доходит до 1,8x.

Traité par IA depuis Hugging Face Blog ; édité par Hamidun News
Nunchaku Lite: 4-битная генерация изображений в Diffusers — до 50% меньше VRAM
Source : Hugging Face Blog. Collage: Hamidun News.
◐ Écouter l'article

Le 23 juillet 2026, HuggingFace a lancé NunchakuLite — une intégration native de l'inférence en 4 bits pour les modèles de diffusion dans la bibliothèque Diffusers, qui réduit la consommation de mémoire vidéo jusqu'à 50% et accélère la génération d'images d'environ 30%.

Que sont Nunchaku et SVDQuant

Nunchaku est un moteur d'inférence CUDA qui met en œuvre la méthode de quantification SVDQuant pour les transformeurs de diffusion. L'intégration NunchakuLite est la première à porter cette technologie directement dans Diffusers : le modèle se charge avec le `from_pretrained()` habituel, sans pipeline séparé ni compilation manuelle, et les kernels CUDA nécessaires sont téléchargés automatiquement via le paquet `kernels` au premier lancement.

La différence clé de Nunchaku par rapport à la plupart des backends est le mode W4A4 : les poids comme les activations sont compressés en 4 bits. Les méthodes habituelles de type weight-only réduisent la mémoire mais n'accélèrent pas le calcul ; ici, c'est la boucle de débruitage (denoising) elle-même qui est accélérée.

« SVDQuant transfère les valeurs aberrantes des activations vers les

poids, représente la partie la plus lourde de chaque matrice de poids par une petite branche low-rank en 16 bits, et quantifie le résidu restant en 4 bits », indique le blog technique de HuggingFace.

La méthode SVDQuant s'appuie sur un article publié en novembre 2024 sur arXiv par l'équipe du MIT HAN Lab. Pour les couches lourdes (attention et MLP), le kernel `svdq_w4a4` avec correction low-rank est utilisé, et pour les couches de modulation, `awq_w4a16` avec des poids en 4 bits et des activations en 16 bits.

De combien la génération s'accélère-t-elle

Sur une carte graphique RTX PRO 6000 en résolution 1024×1024, NunchakuLite offre un gain mesurable sur toutes les métriques. L'exécution de référence en BF16 prend 3,00 secondes et 31,1 Go de mémoire vidéo ; au format NVFP4, on passe déjà à 2,27 secondes et 20,6 Go.

  • BF16 (référence) : 3,00 s, 31,1 Go de mémoire — accélération 1,0x
  • NVFP4 : 2,27 s, 20,6 Go — accélération 1,35x
  • NVFP4 + torch.compile : 1,68 s, 20,6 Go — accélération 1,8x
  • NVFP4 + encodeur de texte NF4 : 2,29 s, 16,0 Go de mémoire
  • Modèle ERNIE-Image-Turbo : 1024×1024 en ~1,7 s sur RTX 5090 (~12 Go contre ~24 Go en BF16)

L'association avec `torch.compile` accélère la génération jusqu'à 1,8 fois, et remplacer l'encodeur de texte par NF4 fait chuter le pic de mémoire à 16,0 Go — suffisant pour exécuter des modèles lourds sur des cartes grand public.

Quel matériel et quels modèles sont pris en charge

NunchakuLite fonctionne sur la plupart des cartes NVIDIA récentes, mais le schéma de quantification dépend de l'architecture. Le format NVFP4 via le kernel `svdq_w4a4` nécessite Blackwell (RTX 50, RTX PRO 6000, B200), tandis que sur Turing, Ampere et Ada (RTX 30/40, A100, L40S), c'est l'INT4 qui est utilisé. Les architectures Volta et Hopper ne sont pas prises en charge — au chargement, le validateur renvoie immédiatement une erreur claire.

Des modèles prêts à l'emploi sont déjà publiés au sein de l'organisation lite-infer sur HuggingFace Hub : ERNIE-Image-Turbo (en variantes INT4 et NVFP4), Krea 2 Turbo (NVFP4) et FLUX.2 Klein 4B. Pour une quantification personnalisée, l'équipe a publié l'outil diffuse-compressor : il inspecte le modèle, effectue le calibrage SVDQuant, assemble un pipeline Diffusers et publie le résultat sur le Hub.

Ce que cela signifie

L'inférence en 4 bits cesse d'être l'apanage de forks isolés et arrive dans la bibliothèque principale de génération d'images. Les développeurs obtiennent une consommation de VRAM divisée par deux et une accélération notable pour pratiquement une seule ligne de code — cela rend les modèles de diffusion phares accessibles sur des cartes graphiques grand public.

Questions fréquentes

Sur quelles cartes graphiques NunchakuLite fonctionne-t-il ?

Le format NVFP4 nécessite des cartes Blackwell — RTX 50, RTX PRO 6000 ou B200. Sur RTX 30/40, A100 et L40S, c'est le schéma INT4 qui fonctionne. Les architectures Volta et Hopper ne sont pas prises en charge du tout.

De combien la mémoire vidéo nécessaire est-elle réduite ?

Sur la RTX PRO 6000, le pic de VRAM passe de 31,1 Go en BF16 à 20,6 Go en NVFP4, et avec l'encodeur de texte NF4, à 16,0 Go, soit presque deux fois moins.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?

Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).

Qu'en pensez-vous ?
Chargement des commentaires…