Neurohive→ original

Bonsai 27B от PrismML: модель Qwen3-27B впервые запустили на смартфоне

PrismML, стартап исследователей Caltech, представил Bonsai 27B — первую 27-миллиардную языковую модель, запущенную прямо на смартфоне. В основе — 1-битные и тернарные веса модели Qwen3.6-27B: сжатие в 9.4–14.2 раза при сохранении 90–95% качества. Тернарная версия (5.9 ГБ) работает на ноутбуке со скоростью ~26 токенов/с, а 1-битная умещается в 3.9 ГБ и запускается на телефоне.

Procesado por IA desde Neurohive; editado por Hamidun News
Bonsai 27B от PrismML: модель Qwen3-27B впервые запустили на смартфоне
Fuente: Neurohive. Collage: Hamidun News.
◐ Escuchar artículo

La startup PrismML, fundada por investigadores del Instituto Tecnológico de California (Caltech), ha presentado Bonsai 27B — el primer modelo de lenguaje de 27 mil millones de parámetros del mundo ejecutado con éxito en un smartphone. La tecnología se basa en pesos de 1 bit y ternarios, que permiten comprimir Qwen3.6-27B entre 9,4 y 14,2 veces conservando el 90–95% de la calidad original.

Cómo Funciona Bonsai 27B

Bonsai 27B no es una arquitectura nueva, sino una versión extremadamente optimizada del modelo de código abierto Qwen3.6-27B de Alibaba. PrismML lanzó dos variantes con diferentes grados de cuantización: ternaria (los pesos toman valores de –1, 0 o +1) y binaria (solo –1 y +1). Este método se denomina cuantización post-entrenamiento — los pesos originales se comprimen después del entrenamiento, sin reentrenamiento desde cero.

Parámetros específicos de las dos versiones:

  • Versión ternaria: 5,9 GB, velocidad de aproximadamente 26 tokens por segundo en un portátil estándar
  • Versión de 1 bit (binaria): 3,9 GB, cabe en la RAM de un smartphone
  • Tasa de compresión de pesos: 9,4–14,2 veces respecto al original
  • Retención de calidad: 90–95% del Qwen3.6-27B completo
  • Desarrollador: PrismML (fundada por investigadores de Caltech)

El Qwen3.6-27B original en formato fp16 pesa más de 50 GB y requiere una GPU de servidor. La versión de 1 bit de Bonsai 27B es 13 veces más pequeña.

Por Qué los Pesos de 1 Bit Cambian las Reglas

En los modelos de lenguaje estándar, cada parámetro se almacena en 16 o 32 bits. Pasar a una representación de 1 bit significa que un «peso» es literalmente un cero o un uno. Esto reduce radicalmente el uso de memoria y acelera la inferencia en dispositivos sin GPU dedicada.

Según la publicación de PrismML, fue precisamente este enfoque el que hizo posible ejecutar el modelo en un smartphone común sin conexión a la nube — algo que hace apenas un año se consideraba imposible para modelos a escala de 27 mil millones de parámetros. Anteriormente, los LLMs móviles estaban limitados a modelos de 1–7 mil millones de parámetros: Gemma 2B de Google o Phi-3.5-mini de Microsoft.

«Bonsai 27B demuestra que la frontera entre la computación en la nube y la computación en el borde está desapareciendo rápidamente», señala el anuncio oficial de

PrismML.

Ambas variantes del modelo se han publicado en acceso abierto en Hugging Face, y los desarrolladores pueden empezar a experimentar ahora mismo.

Qué Significa Esto

Ejecutar un modelo de 27 mil millones de parámetros en un smartphone es un umbral tecnológico importante: los potentes modelos de lenguaje podrán funcionar en miles de millones de dispositivos existentes sin infraestructura en la nube, con total privacidad de datos y en modo sin conexión. Con este resultado, PrismML ha confirmado que la cuantización de 1 bit ha pasado de ser una idea académica a una herramienta práctica.

Preguntas Frecuentes

¿Se puede ejecutar Bonsai 27B en un iPhone o Android?

La versión de 1 bit con un peso de 3,9 GB funciona en un smartphone común sin conexión a la nube — esto es exactamente lo que PrismML demostró en su anuncio.

¿En qué se diferencia Bonsai 27B de Qwen3.6-27B?

Bonsai 27B es Qwen3.6-27B con pesos extremadamente comprimidos. PrismML aplicó cuantización de 1 bit y ternaria, reduciendo el tamaño del modelo entre 9,4 y 14,2 veces conservando el 90–95% de la calidad original.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?

Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).

¿Qué te parece?
Cargando comentarios…