Nunchaku Lite: 4-битная генерация изображений в Diffusers — до 50% меньше VRAM
Hugging Face выпустила Nunchaku Lite — интеграцию 4-битного инференса диффузионных моделей прямо в библиотеку Diffusers. Технология сжимает до 4 бит и веса, и активации, снижая расход видеопамяти до 50% и ускоряя генерацию картинок примерно на 30%. На RTX PRO 6000 пик VRAM падает с 31 до 20 ГБ, а в связке с torch.compile ускорение доходит до 1,8x.
Processado por IA de Hugging Face Blog; editado por Hamidun News
Em 23 de julho de 2026, a HuggingFace lançou o NunchakuLite — uma integração nativa de inferência em 4 bits para modelos de difusão na biblioteca Diffusers, que reduz o consumo de memória de vídeo em até 50% e acelera a geração de imagens em aproximadamente 30%.
O que são Nunchaku e SVDQuant
Nunchaku é um motor de inferência CUDA que implementa o método de quantização SVDQuant para transformers de difusão. A integração NunchakuLite é a primeira a trazer essa tecnologia diretamente para o Diffusers: o modelo é carregado com o `from_pretrained()` padrão, sem pipeline separado nem compilação manual, e os kernels CUDA necessários são baixados automaticamente pelo pacote `kernels` na primeira execução.
A principal diferença do Nunchaku em relação à maioria dos backends é o modo W4A4: tanto os pesos quanto as ativações são comprimidos para 4 bits. Os métodos comuns de weight-only reduzem a memória, mas não aceleram o cálculo; aqui, o próprio loop de denoising é acelerado.
"O SVDQuant transfere os outliers de ativação para os pesos,
representa a parte mais pesada de cada matriz de pesos com um pequeno ramo low-rank de 16 bits e quantiza o restante do resíduo para 4 bits", afirma o blog técnico da HuggingFace.
O método SVDQuant é baseado em um artigo publicado em novembro de 2024 no arXiv pela equipe do MIT HAN Lab. Para camadas pesadas (attention e MLP), funciona o kernel `svdq_w4a4` com correção low-rank, e para as camadas de modulação, `awq_w4a16` com pesos de 4 bits e ativações de 16 bits.
Quanto a geração acelera
Em uma GPU RTX PRO 6000, na resolução 1024×1024, o NunchakuLite entrega um ganho mensurável em todas as métricas. A execução básica em BF16 leva 3,00 segundos e 31,1 GB de memória de vídeo; no formato NVFP4, já são 2,27 segundos e 20,6 GB.
- BF16 (referência): 3,00 s, 31,1 GB de memória — aceleração de 1,0x
- NVFP4: 2,27 s, 20,6 GB — aceleração de 1,35x
- NVFP4 + torch.compile: 1,68 s, 20,6 GB — aceleração de 1,8x
- NVFP4 + codificador de texto NF4: 2,29 s, 16,0 GB de memória
- Modelo ERNIE-Image-Turbo: 1024×1024 em ~1,7 s em uma RTX 5090 (~12 GB contra ~24 GB em BF16)
A combinação com `torch.compile` acelera a geração em até 1,8 vez, e trocar o codificador de texto por NF4 reduz o pico de memória para 16,0 GB — suficiente para rodar modelos pesados em placas de consumo.
Que hardware e modelos são suportados
O NunchakuLite funciona na maioria das GPUs NVIDIA modernas, mas o esquema de quantização depende da arquitetura. O formato NVFP4, via kernel `svdq_w4a4`, exige Blackwell (RTX 50, RTX PRO 6000, B200), enquanto em Turing, Ampere e Ada (RTX 30/40, A100, L40S) é usado o INT4. As arquiteturas Volta e Hopper não são suportadas — ao carregar, o validador já retorna um erro claro.
Modelos prontos para uso já foram publicados na organização lite-infer no HuggingFace Hub: ERNIE-Image-Turbo (nas variantes INT4 e NVFP4), Krea 2 Turbo (NVFP4) e FLUX.2 Klein 4B. Para quantização própria, a equipe lançou o kit de ferramentas diffuse-compressor — ele inspeciona o modelo, realiza a calibração SVDQuant, monta um pipeline do Diffusers e publica o resultado no Hub.
O que isso significa
A inferência em 4 bits deixa de ser exclusividade de forks isolados e chega à biblioteca principal de geração de imagens. Os desenvolvedores ganham metade do consumo de VRAM e uma aceleração perceptível praticamente com uma única linha de código — isso torna os modelos de difusão de ponta acessíveis em placas de vídeo gamer comuns.
Perguntas frequentes
Em quais placas de vídeo o NunchakuLite funciona?
O formato NVFP4 exige placas Blackwell — RTX 50, RTX PRO 6000 ou B200. Em RTX 30/40, A100 e L40S funciona o esquema INT4. As arquiteturas Volta e Hopper não são suportadas de forma alguma.
Quanto menos memória de vídeo é necessária?
Na RTX PRO 6000, o pico de VRAM cai de 31,1 GB em BF16 para 20,6 GB em NVFP4, e com o codificador de texto NF4, para 16,0 GB — ou seja, quase pela metade.
Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?
Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.