Bonsai 27B от PrismML: модель Qwen3-27B впервые запустили на смартфоне
PrismML, стартап исследователей Caltech, представил Bonsai 27B — первую 27-миллиардную языковую модель, запущенную прямо на смартфоне. В основе — 1-битные и тернарные веса модели Qwen3.6-27B: сжатие в 9.4–14.2 раза при сохранении 90–95% качества. Тернарная версия (5.9 ГБ) работает на ноутбуке со скоростью ~26 токенов/с, а 1-битная умещается в 3.9 ГБ и запускается на телефоне.
Traité par IA depuis Neurohive ; édité par Hamidun News
La startup PrismML, fondée par des chercheurs du California Institute of Technology, a présenté Bonsai 27B — le premier modèle de langage à 27 milliards de paramètres au monde à avoir été exécuté avec succès sur un smartphone. La technologie repose sur des poids à 1 bit et ternaires, qui permettent de compresser Qwen3.6-27B de 9,4 à 14,2 fois tout en conservant 90 à 95 % de la qualité originale.
Comment Fonctionne Bonsai 27B
Bonsai 27B n'est pas une nouvelle architecture, mais une version extrêmement optimisée du modèle open source Qwen3.6-27B d'Alibaba. PrismML a publié deux variantes avec différents degrés de quantification : ternaire (les poids prennent les valeurs –1, 0 ou +1) et binaire (uniquement –1 et +1). Cette méthode est appelée quantification post-entraînement — les poids originaux sont compressés après l'entraînement, sans ré-entraînement depuis le début.
Paramètres spécifiques des deux versions :
- Version ternaire : 5,9 Go, vitesse d'environ 26 tokens par seconde sur un ordinateur portable standard
- Version 1 bit (binaire) : 3,9 Go, tient dans la RAM d'un smartphone
- Taux de compression des poids : 9,4–14,2 fois par rapport à l'original
- Rétention de qualité : 90–95 % du Qwen3.6-27B complet
- Développeur : PrismML (fondé par des chercheurs de Caltech)
Le Qwen3.6-27B original au format fp16 pèse plus de 50 Go et nécessite un GPU de serveur. La version 1 bit de Bonsai 27B est 13 fois plus petite.
Pourquoi les Poids à 1 Bit Changent la Donne
Dans les modèles de langage standard, chaque paramètre est stocké sur 16 ou 32 bits. Passer à une représentation à 1 bit signifie qu'un « poids » est littéralement un zéro ou un un. Cela réduit radicalement l'empreinte mémoire et accélère l'inférence sur des appareils sans GPU dédié.
Selon la publication de PrismML, c'est précisément cette approche qui a permis d'exécuter le modèle sur un smartphone ordinaire sans connexion au cloud — ce qui était considéré comme impossible il y a encore un an pour des modèles à l'échelle de 27 milliards de paramètres. Auparavant, les LLMs mobiles étaient limités à des modèles de 1 à 7 milliards de paramètres : Gemma 2B de Google ou Phi-3.5-mini de Microsoft.
«
Bonsai 27B montre que la frontière entre l'informatique cloud et l'informatique en périphérie s'efface rapidement », indique l'annonce officielle de PrismML.
Les deux variantes du modèle ont été publiées en accès libre sur Hugging Face, et les développeurs peuvent commencer à expérimenter dès maintenant.
Ce Que Cela Signifie
Faire fonctionner un modèle à 27 milliards de paramètres sur un smartphone constitue un seuil technologique important : de puissants modèles de langage pourront fonctionner sur des milliards d'appareils existants sans infrastructure cloud, avec une confidentialité totale des données et en mode hors ligne. Avec ce résultat, PrismML a confirmé que la quantification à 1 bit est passée d'une idée académique à un outil pratique.
Foire Aux Questions
Bonsai 27B peut-il fonctionner sur un iPhone ou Android ?
La version 1 bit pesant 3,9 Go fonctionne sur un smartphone ordinaire sans connexion au cloud — c'est exactement ce que PrismML a démontré dans son annonce.
En quoi Bonsai 27B diffère-t-il de Qwen3.6-27B ?
Bonsai 27B est Qwen3.6-27B avec des poids extrêmement compressés. PrismML a appliqué une quantification à 1 bit et ternaire, réduisant la taille du modèle de 9,4 à 14,2 fois tout en conservant 90 à 95 % de la qualité originale.
Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?
Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).
L'essentiel de l'IA — une fois par semaine
Sept actus qui ont vraiment compté, choisies à la main. Sans bruit ni communiqués.
C'est fait ! Vérifiez votre boîte mail pour la confirmation.