BitNet b1.58: как тернарное квантование позволяет запустить 27B-модель без GPU
Несколько лет назад запуск 27B-модели без мощной видеокарты был невозможен. Теперь — реальность: тернарное квантование, где каждый вес принимает одно из трёх значений {-1, 0, 1}, сжимает нейросеть до ~1.58 бита на параметр. Никаких операций умножения в инференсе — только сложения и вычитания, которые вытягивает любой процессор.
Processado por IA de Habr AI; editado por Hamidun News
Alguns anos atrás, a ideia de executar um modelo de 27 bilhões de parâmetros em um laptop comum sem GPU parecia absurda. Em 2024–2025, isso se tornou realidade — graças à quantização não convencional: em vez de aproximar os pesos, a rede é construída literalmente sobre dois ou três valores discretos.
O que é quantização não convencional
A quantização padrão reduz a precisão dos pesos ao longo da escala float32 → INT8 → INT4 → INT2, mantendo um intervalo numérico contínuo. A abordagem não convencional é mais radical: os pesos assumem apenas os valores {-1, 0, 1} — isso é a quantização ternária. A Microsoft Research desenvolveu a família BitNet, na qual cada peso é armazenado com uma média de 1,58 bits.
- BitNet — arquitetura com pesos de 1 bit durante o treinamento, proposta pela Microsoft Research em 2023
- BitNet b1.58 — versão ternária com pesos {-1, 0, 1}, com média de 1,58 bits por parâmetro, publicada em março de 2024
- O Gemma 27B no formato ternário ocupa 6–7 GB e funciona em um laptop somente com CPU
- O llama.cpp suporta formatos GGUF de 1 bit desde março de 2024
- As multiplicações são substituídas por adições e subtrações — sem carga nas unidades FP do processador
Por que isso não é o mesmo que INT4
A quantização clássica INT4 é uma compressão pós-treinamento: um modelo float32 pronto é "comprimido" após o treinamento, e a qualidade inevitavelmente cai, especialmente em tamanhos menores. A quantização não convencional funciona de maneira diferente: a rede é treinada desde o início para que os pesos se situem em posições discretas. Isso muda fundamentalmente a natureza das perdas.
"Um modelo com pesos {-1, 0, 1}, quando treinado corretamente, é comparável ao seu equivalente de precisão total em perplexidade, exigindo 3 a 5 vezes menos RAM", afirma o relatório técnico da
Microsoft Research sobre o BitNet b1.58.
De acordo com benchmarks abertos, a diferença em relação à linha de base float16 para modelos a partir de 7B é de 1–3% na maioria das tarefas — um preço aceitável para que o modelo caiba na RAM de um laptop comum.
O que roda em um laptop agora
O exemplo mais ilustrativo são modelos da classe 27B em um MacBook com 32 GB de memória unificada ou em um laptop Windows com um processador padrão sem GPU discreta. A velocidade de geração no Apple M2 Pro para um modelo ternário de 27B é de aproximadamente 10–15 tokens por segundo — suficiente para a maioria das tarefas práticas.
Um detalhe importante: a quantização não convencional funciona melhor em modelos treinados do zero no modo correspondente. "Ternarizar" retroativamente um modelo já pronto — como o Llama 3 — sem uma queda perceptível na qualidade é difícil: requer ajuste fino ou destilação por meio de um professor ternário.
O que isso significa
A quantização ternária e de 1 bit desloca a fronteira da acessibilidade: modelos de linguagem completos de 27B e acima deixam de exigir hardware de nível servidor. Para cenários corporativos com requisitos de privacidade de dados, isso é especialmente relevante — a inferência local sem nuvem torna-se técnica e economicamente viável.
Perguntas frequentes
Como executar um modelo ternário sem GPU?
Modelos ternários e de 1 bit no formato GGUF são executados via llama.cpp em um processador padrão. 16–32 GB de RAM são suficientes para modelos de 7B a 27B — não é necessário GPU.
Como o BitNet b1.58 difere da quantização INT4?
O BitNet b1.58 é treinado com pesos ternários desde o início, em vez de obtê-los como resultado da compressão pós-treinamento. Isso proporciona uma qualidade mais previsível e elimina completamente as operações de multiplicação da inferência.
Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?
Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.