Hugging Face Blog→ original

Nunchaku Lite: 4-битная генерация изображений в Diffusers — до 50% меньше VRAM

Hugging Face выпустила Nunchaku Lite — интеграцию 4-битного инференса диффузионных моделей прямо в библиотеку Diffusers. Технология сжимает до 4 бит и веса, и активации, снижая расход видеопамяти до 50% и ускоряя генерацию картинок примерно на 30%. На RTX PRO 6000 пик VRAM падает с 31 до 20 ГБ, а в связке с torch.compile ускорение доходит до 1,8x.

Processado por IA de Hugging Face Blog; editado por Hamidun News
Nunchaku Lite: 4-битная генерация изображений в Diffusers — до 50% меньше VRAM
Fonte: Hugging Face Blog. Colagem: Hamidun News.
◐ Ouvir artigo

Em 23 de julho de 2026, a HuggingFace lançou o NunchakuLite — uma integração nativa de inferência em 4 bits para modelos de difusão na biblioteca Diffusers, que reduz o consumo de memória de vídeo em até 50% e acelera a geração de imagens em aproximadamente 30%.

O que são Nunchaku e SVDQuant

Nunchaku é um motor de inferência CUDA que implementa o método de quantização SVDQuant para transformers de difusão. A integração NunchakuLite é a primeira a trazer essa tecnologia diretamente para o Diffusers: o modelo é carregado com o `from_pretrained()` padrão, sem pipeline separado nem compilação manual, e os kernels CUDA necessários são baixados automaticamente pelo pacote `kernels` na primeira execução.

A principal diferença do Nunchaku em relação à maioria dos backends é o modo W4A4: tanto os pesos quanto as ativações são comprimidos para 4 bits. Os métodos comuns de weight-only reduzem a memória, mas não aceleram o cálculo; aqui, o próprio loop de denoising é acelerado.

"O SVDQuant transfere os outliers de ativação para os pesos,

representa a parte mais pesada de cada matriz de pesos com um pequeno ramo low-rank de 16 bits e quantiza o restante do resíduo para 4 bits", afirma o blog técnico da HuggingFace.

O método SVDQuant é baseado em um artigo publicado em novembro de 2024 no arXiv pela equipe do MIT HAN Lab. Para camadas pesadas (attention e MLP), funciona o kernel `svdq_w4a4` com correção low-rank, e para as camadas de modulação, `awq_w4a16` com pesos de 4 bits e ativações de 16 bits.

Quanto a geração acelera

Em uma GPU RTX PRO 6000, na resolução 1024×1024, o NunchakuLite entrega um ganho mensurável em todas as métricas. A execução básica em BF16 leva 3,00 segundos e 31,1 GB de memória de vídeo; no formato NVFP4, já são 2,27 segundos e 20,6 GB.

  • BF16 (referência): 3,00 s, 31,1 GB de memória — aceleração de 1,0x
  • NVFP4: 2,27 s, 20,6 GB — aceleração de 1,35x
  • NVFP4 + torch.compile: 1,68 s, 20,6 GB — aceleração de 1,8x
  • NVFP4 + codificador de texto NF4: 2,29 s, 16,0 GB de memória
  • Modelo ERNIE-Image-Turbo: 1024×1024 em ~1,7 s em uma RTX 5090 (~12 GB contra ~24 GB em BF16)

A combinação com `torch.compile` acelera a geração em até 1,8 vez, e trocar o codificador de texto por NF4 reduz o pico de memória para 16,0 GB — suficiente para rodar modelos pesados em placas de consumo.

Que hardware e modelos são suportados

O NunchakuLite funciona na maioria das GPUs NVIDIA modernas, mas o esquema de quantização depende da arquitetura. O formato NVFP4, via kernel `svdq_w4a4`, exige Blackwell (RTX 50, RTX PRO 6000, B200), enquanto em Turing, Ampere e Ada (RTX 30/40, A100, L40S) é usado o INT4. As arquiteturas Volta e Hopper não são suportadas — ao carregar, o validador já retorna um erro claro.

Modelos prontos para uso já foram publicados na organização lite-infer no HuggingFace Hub: ERNIE-Image-Turbo (nas variantes INT4 e NVFP4), Krea 2 Turbo (NVFP4) e FLUX.2 Klein 4B. Para quantização própria, a equipe lançou o kit de ferramentas diffuse-compressor — ele inspeciona o modelo, realiza a calibração SVDQuant, monta um pipeline do Diffusers e publica o resultado no Hub.

O que isso significa

A inferência em 4 bits deixa de ser exclusividade de forks isolados e chega à biblioteca principal de geração de imagens. Os desenvolvedores ganham metade do consumo de VRAM e uma aceleração perceptível praticamente com uma única linha de código — isso torna os modelos de difusão de ponta acessíveis em placas de vídeo gamer comuns.

Perguntas frequentes

Em quais placas de vídeo o NunchakuLite funciona?

O formato NVFP4 exige placas Blackwell — RTX 50, RTX PRO 6000 ou B200. Em RTX 30/40, A100 e L40S funciona o esquema INT4. As arquiteturas Volta e Hopper não são suportadas de forma alguma.

Quanto menos memória de vídeo é necessária?

Na RTX PRO 6000, o pico de VRAM cai de 31,1 GB em BF16 para 20,6 GB em NVFP4, e com o codificador de texto NF4, para 16,0 GB — ou seja, quase pela metade.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…