BitNet b1.58: как тернарное квантование позволяет запустить 27B-модель без GPU
Несколько лет назад запуск 27B-модели без мощной видеокарты был невозможен. Теперь — реальность: тернарное квантование, где каждый вес принимает одно из трёх значений {-1, 0, 1}, сжимает нейросеть до ~1.58 бита на параметр. Никаких операций умножения в инференсе — только сложения и вычитания, которые вытягивает любой процессор.
Procesado por IA desde Habr AI; editado por Hamidun News
Hace algunos años, la idea de ejecutar un modelo de 27 mil millones de parámetros en un portátil normal sin GPU parecía absurda. En 2024–2025, esto se convirtió en realidad — gracias a la cuantización no convencional: en lugar de aproximar los pesos, la red se construye literalmente sobre dos o tres valores discretos.
Qué es la cuantización no convencional
La cuantización estándar reduce la precisión de los pesos a lo largo de la escala float32 → INT8 → INT4 → INT2, manteniendo un rango numérico continuo. El enfoque no convencional es más radical: los pesos toman únicamente los valores {-1, 0, 1} — esto es la cuantización ternaria. Microsoft Research desarrolló la familia BitNet, en la que cada peso se almacena con un promedio de 1,58 bits.
- BitNet — arquitectura con pesos de 1 bit durante el entrenamiento, propuesta por Microsoft Research en 2023
- BitNet b1.58 — versión ternaria con pesos {-1, 0, 1}, con un promedio de 1,58 bits por parámetro, publicada en marzo de 2024
- Gemma 27B en formato ternario ocupa 6–7 GB y funciona en un portátil solo con CPU
- llama.cpp admite formatos GGUF de 1 bit desde marzo de 2024
- Las multiplicaciones se sustituyen por sumas y restas — sin carga en las unidades FP del procesador
Por qué esto no es lo mismo que INT4
La cuantización clásica INT4 es una compresión posterior al entrenamiento: un modelo float32 listo se "comprime" después del entrenamiento, y la calidad inevitablemente disminuye, especialmente en tamaños pequeños. La cuantización no convencional funciona de manera diferente: la red se entrena desde el principio para que los pesos se sitúen en posiciones discretas. Esto cambia fundamentalmente la naturaleza de las pérdidas.
"Un modelo con pesos {-1, 0, 1}, cuando se entrena correctamente, es
comparable a su equivalente de precisión completa en perplejidad, requiriendo 3 a 5 veces menos RAM", se afirma en el informe técnico de Microsoft Research sobre BitNet b1.58.
Según los benchmarks abiertos, la diferencia con la línea de base float16 para modelos a partir de 7B es del 1–3% en la mayoría de las tareas — un precio aceptable para que el modelo quepa en la RAM de un portátil común.
Qué se ejecuta en un portátil ahora mismo
El ejemplo más ilustrativo son los modelos de la clase 27B en un MacBook con 32 GB de memoria unificada o en un portátil Windows con un procesador estándar sin GPU discreta. La velocidad de generación en Apple M2 Pro para un modelo ternario de 27B es de aproximadamente 10–15 tokens por segundo — suficiente para la mayoría de las tareas prácticas.
Un matiz importante: la cuantización no convencional funciona mejor en modelos entrenados desde cero en el modo correspondiente. "Ternarizar" retroactivamente un modelo ya terminado — como Llama 3 — sin una caída perceptible en la calidad es difícil: requiere ajuste fino o destilación a través de un maestro ternario.
Qué significa esto
La cuantización ternaria y de 1 bit desplaza la frontera de la accesibilidad: los modelos de lenguaje completos de 27B y superiores dejan de requerir hardware de nivel servidor. Para escenarios empresariales con requisitos de privacidad de datos, esto es especialmente relevante — la inferencia local sin nube se vuelve técnica y económicamente viable.
Preguntas frecuentes
¿Cómo ejecutar un modelo ternario sin GPU?
Los modelos ternarios y de 1 bit en formato GGUF se ejecutan mediante llama.cpp en un procesador estándar. Con 16–32 GB de RAM es suficiente para modelos de 7B a 27B — no se necesita GPU.
¿En qué se diferencia BitNet b1.58 de la cuantización INT4?
BitNet b1.58 se entrena con pesos ternarios desde el principio, en lugar de obtenerlos como resultado de la compresión posterior al entrenamiento. Esto proporciona una calidad más predecible y elimina completamente las operaciones de multiplicación de la inferencia.
¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?
Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.