Habr AI→ original

BitNet b1.58: как тернарное квантование позволяет запустить 27B-модель без GPU

Несколько лет назад запуск 27B-модели без мощной видеокарты был невозможен. Теперь — реальность: тернарное квантование, где каждый вес принимает одно из трёх значений {-1, 0, 1}, сжимает нейросеть до ~1.58 бита на параметр. Никаких операций умножения в инференсе — только сложения и вычитания, которые вытягивает любой процессор.

Traité par IA depuis Habr AI ; édité par Hamidun News
BitNet b1.58: как тернарное квантование позволяет запустить 27B-модель без GPU
Source : Habr AI. Collage: Hamidun News.
◐ Écouter l'article

Il y a quelques années, l'idée de faire tourner un modèle de 27 milliards de paramètres sur un ordinateur portable ordinaire sans GPU semblait absurde. En 2024–2025, c'est devenu réalité — grâce à une quantification non conventionnelle : au lieu d'approximer les poids, le réseau est construit littéralement sur deux ou trois valeurs discrètes.

Qu'est-ce que la quantification non conventionnelle

La quantification standard réduit la précision des poids selon l'échelle float32 → INT8 → INT4 → INT2, en conservant une plage numérique continue. L'approche non conventionnelle est plus radicale : les poids ne prennent que les valeurs {-1, 0, 1} — c'est la quantification ternaire. Microsoft Research a développé la famille BitNet, dans laquelle chaque poids est stocké en moyenne sur 1,58 bit.

  • BitNet — architecture avec des poids en 1 bit lors de l'entraînement, proposée par Microsoft Research en 2023
  • BitNet b1.58 — version ternaire avec des poids {-1, 0, 1}, en moyenne 1,58 bit par paramètre, publiée en mars 2024
  • Gemma 27B au format ternaire occupe 6–7 Go et fonctionne sur un ordinateur portable uniquement avec CPU
  • llama.cpp prend en charge les formats GGUF à 1 bit depuis mars 2024
  • Les multiplications sont remplacées par des additions et des soustractions — sans charge sur les unités FP du processeur

Pourquoi ce n'est pas la même chose que INT4

La quantification classique INT4 est une compression post-entraînement : un modèle float32 prêt est « compressé » après l'entraînement, et la qualité baisse inévitablement, surtout pour les petites tailles. La quantification non conventionnelle fonctionne différemment : le réseau est entraîné dès le départ de sorte que les poids se positionnent dans des emplacements discrets. Cela change fondamentalement la nature des pertes.

«

Un modèle avec des poids {-1, 0, 1}, lorsqu'il est correctement entraîné, est comparable à son équivalent pleine précision en termes de perplexité, tout en nécessitant 3 à 5 fois moins de RAM », affirme le rapport technique de Microsoft Research sur BitNet b1.58.

Selon les benchmarks ouverts, l'écart avec la ligne de base float16 pour les modèles à partir de 7B est de 1–3 % sur la plupart des tâches — un prix acceptable pour que le modèle tienne dans la RAM d'un ordinateur portable ordinaire.

Ce qui tourne sur un ordinateur portable en ce moment

L'exemple le plus illustratif est celui des modèles de classe 27B sur un MacBook avec 32 Go de mémoire unifiée ou sur un ordinateur portable Windows avec un processeur standard sans GPU discret. La vitesse de génération sur Apple M2 Pro pour un modèle ternaire de 27B est d'environ 10–15 tokens par seconde — suffisant pour la plupart des tâches pratiques.

Une nuance importante : la quantification non conventionnelle fonctionne mieux sur des modèles entraînés depuis le début dans le mode correspondant. Convertir rétroactivement un modèle déjà terminé — comme Llama 3 — en ternaire sans baisse de qualité notable est difficile : il faut soit un ajustement fin, soit une distillation via un enseignant ternaire.

Ce que cela signifie

La quantification ternaire et à 1 bit déplace la frontière de l'accessibilité : les modèles de langage complets de 27B et plus ne nécessitent plus de matériel de niveau serveur. Pour les scénarios d'entreprise avec des exigences de confidentialité des données, c'est particulièrement pertinent — l'inférence locale sans cloud devient techniquement et économiquement réalisable.

Questions fréquentes

Comment faire tourner un modèle ternaire sans GPU ?

Les modèles ternaires et à 1 bit au format GGUF s'exécutent via llama.cpp sur un processeur standard. 16–32 Go de RAM suffisent pour des modèles de 7B à 27B — aucun GPU n'est requis.

En quoi

BitNet b1.58 diffère-t-il de la quantification INT4 ?

BitNet b1.58 est entraîné avec des poids ternaires depuis le début, plutôt que de les obtenir à la suite d'une compression post-entraînement. Cela offre une qualité plus prévisible et élimine complètement les opérations de multiplication de l'inférence.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?

Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).

Qu'en pensez-vous ?
Chargement des commentaires…