Bonsai 27B от PrismML: модель Qwen3-27B впервые запустили на смартфоне
PrismML, стартап исследователей Caltech, представил Bonsai 27B — первую 27-миллиардную языковую модель, запущенную прямо на смартфоне. В основе — 1-битные и тернарные веса модели Qwen3.6-27B: сжатие в 9.4–14.2 раза при сохранении 90–95% качества. Тернарная версия (5.9 ГБ) работает на ноутбуке со скоростью ~26 токенов/с, а 1-битная умещается в 3.9 ГБ и запускается на телефоне.
Procesado por IA desde Neurohive; editado por Hamidun News
La startup PrismML, fundada por investigadores del Instituto Tecnológico de California (Caltech), ha presentado Bonsai 27B — el primer modelo de lenguaje de 27 mil millones de parámetros del mundo ejecutado con éxito en un smartphone. La tecnología se basa en pesos de 1 bit y ternarios, que permiten comprimir Qwen3.6-27B entre 9,4 y 14,2 veces conservando el 90–95% de la calidad original.
Cómo Funciona Bonsai 27B
Bonsai 27B no es una arquitectura nueva, sino una versión extremadamente optimizada del modelo de código abierto Qwen3.6-27B de Alibaba. PrismML lanzó dos variantes con diferentes grados de cuantización: ternaria (los pesos toman valores de –1, 0 o +1) y binaria (solo –1 y +1). Este método se denomina cuantización post-entrenamiento — los pesos originales se comprimen después del entrenamiento, sin reentrenamiento desde cero.
Parámetros específicos de las dos versiones:
- Versión ternaria: 5,9 GB, velocidad de aproximadamente 26 tokens por segundo en un portátil estándar
- Versión de 1 bit (binaria): 3,9 GB, cabe en la RAM de un smartphone
- Tasa de compresión de pesos: 9,4–14,2 veces respecto al original
- Retención de calidad: 90–95% del Qwen3.6-27B completo
- Desarrollador: PrismML (fundada por investigadores de Caltech)
El Qwen3.6-27B original en formato fp16 pesa más de 50 GB y requiere una GPU de servidor. La versión de 1 bit de Bonsai 27B es 13 veces más pequeña.
Por Qué los Pesos de 1 Bit Cambian las Reglas
En los modelos de lenguaje estándar, cada parámetro se almacena en 16 o 32 bits. Pasar a una representación de 1 bit significa que un «peso» es literalmente un cero o un uno. Esto reduce radicalmente el uso de memoria y acelera la inferencia en dispositivos sin GPU dedicada.
Según la publicación de PrismML, fue precisamente este enfoque el que hizo posible ejecutar el modelo en un smartphone común sin conexión a la nube — algo que hace apenas un año se consideraba imposible para modelos a escala de 27 mil millones de parámetros. Anteriormente, los LLMs móviles estaban limitados a modelos de 1–7 mil millones de parámetros: Gemma 2B de Google o Phi-3.5-mini de Microsoft.
«Bonsai 27B demuestra que la frontera entre la computación en la nube y la computación en el borde está desapareciendo rápidamente», señala el anuncio oficial de
PrismML.
Ambas variantes del modelo se han publicado en acceso abierto en Hugging Face, y los desarrolladores pueden empezar a experimentar ahora mismo.
Qué Significa Esto
Ejecutar un modelo de 27 mil millones de parámetros en un smartphone es un umbral tecnológico importante: los potentes modelos de lenguaje podrán funcionar en miles de millones de dispositivos existentes sin infraestructura en la nube, con total privacidad de datos y en modo sin conexión. Con este resultado, PrismML ha confirmado que la cuantización de 1 bit ha pasado de ser una idea académica a una herramienta práctica.
Preguntas Frecuentes
¿Se puede ejecutar Bonsai 27B en un iPhone o Android?
La versión de 1 bit con un peso de 3,9 GB funciona en un smartphone común sin conexión a la nube — esto es exactamente lo que PrismML demostró en su anuncio.
¿En qué se diferencia Bonsai 27B de Qwen3.6-27B?
Bonsai 27B es Qwen3.6-27B con pesos extremadamente comprimidos. PrismML aplicó cuantización de 1 bit y ternaria, reduciendo el tamaño del modelo entre 9,4 y 14,2 veces conservando el 90–95% de la calidad original.
¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?
Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.