Habr AI→ original

BitNet b1.58: как тернарное квантование позволяет запустить 27B-модель без GPU

Несколько лет назад запуск 27B-модели без мощной видеокарты был невозможен. Теперь — реальность: тернарное квантование, где каждый вес принимает одно из трёх значений {-1, 0, 1}, сжимает нейросеть до ~1.58 бита на параметр. Никаких операций умножения в инференсе — только сложения и вычитания, которые вытягивает любой процессор.

Processado por IA de Habr AI; editado por Hamidun News
BitNet b1.58: как тернарное квантование позволяет запустить 27B-модель без GPU
Fonte: Habr AI. Colagem: Hamidun News.
◐ Ouvir artigo

Alguns anos atrás, a ideia de executar um modelo de 27 bilhões de parâmetros em um laptop comum sem GPU parecia absurda. Em 2024–2025, isso se tornou realidade — graças à quantização não convencional: em vez de aproximar os pesos, a rede é construída literalmente sobre dois ou três valores discretos.

O que é quantização não convencional

A quantização padrão reduz a precisão dos pesos ao longo da escala float32 → INT8 → INT4 → INT2, mantendo um intervalo numérico contínuo. A abordagem não convencional é mais radical: os pesos assumem apenas os valores {-1, 0, 1} — isso é a quantização ternária. A Microsoft Research desenvolveu a família BitNet, na qual cada peso é armazenado com uma média de 1,58 bits.

  • BitNet — arquitetura com pesos de 1 bit durante o treinamento, proposta pela Microsoft Research em 2023
  • BitNet b1.58 — versão ternária com pesos {-1, 0, 1}, com média de 1,58 bits por parâmetro, publicada em março de 2024
  • O Gemma 27B no formato ternário ocupa 6–7 GB e funciona em um laptop somente com CPU
  • O llama.cpp suporta formatos GGUF de 1 bit desde março de 2024
  • As multiplicações são substituídas por adições e subtrações — sem carga nas unidades FP do processador

Por que isso não é o mesmo que INT4

A quantização clássica INT4 é uma compressão pós-treinamento: um modelo float32 pronto é "comprimido" após o treinamento, e a qualidade inevitavelmente cai, especialmente em tamanhos menores. A quantização não convencional funciona de maneira diferente: a rede é treinada desde o início para que os pesos se situem em posições discretas. Isso muda fundamentalmente a natureza das perdas.

"Um modelo com pesos {-1, 0, 1}, quando treinado corretamente, é comparável ao seu equivalente de precisão total em perplexidade, exigindo 3 a 5 vezes menos RAM", afirma o relatório técnico da

Microsoft Research sobre o BitNet b1.58.

De acordo com benchmarks abertos, a diferença em relação à linha de base float16 para modelos a partir de 7B é de 1–3% na maioria das tarefas — um preço aceitável para que o modelo caiba na RAM de um laptop comum.

O que roda em um laptop agora

O exemplo mais ilustrativo são modelos da classe 27B em um MacBook com 32 GB de memória unificada ou em um laptop Windows com um processador padrão sem GPU discreta. A velocidade de geração no Apple M2 Pro para um modelo ternário de 27B é de aproximadamente 10–15 tokens por segundo — suficiente para a maioria das tarefas práticas.

Um detalhe importante: a quantização não convencional funciona melhor em modelos treinados do zero no modo correspondente. "Ternarizar" retroativamente um modelo já pronto — como o Llama 3 — sem uma queda perceptível na qualidade é difícil: requer ajuste fino ou destilação por meio de um professor ternário.

O que isso significa

A quantização ternária e de 1 bit desloca a fronteira da acessibilidade: modelos de linguagem completos de 27B e acima deixam de exigir hardware de nível servidor. Para cenários corporativos com requisitos de privacidade de dados, isso é especialmente relevante — a inferência local sem nuvem torna-se técnica e economicamente viável.

Perguntas frequentes

Como executar um modelo ternário sem GPU?

Modelos ternários e de 1 bit no formato GGUF são executados via llama.cpp em um processador padrão. 16–32 GB de RAM são suficientes para modelos de 7B a 27B — não é necessário GPU.

Como o BitNet b1.58 difere da quantização INT4?

O BitNet b1.58 é treinado com pesos ternários desde o início, em vez de obtê-los como resultado da compressão pós-treinamento. Isso proporciona uma qualidade mais previsível e elimina completamente as operações de multiplicação da inferência.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…