Bonsai 27B от PrismML: модель Qwen3-27B впервые запустили на смартфоне
PrismML, стартап исследователей Caltech, представил Bonsai 27B — первую 27-миллиардную языковую модель, запущенную прямо на смартфоне. В основе — 1-битные и тернарные веса модели Qwen3.6-27B: сжатие в 9.4–14.2 раза при сохранении 90–95% качества. Тернарная версия (5.9 ГБ) работает на ноутбуке со скоростью ~26 токенов/с, а 1-битная умещается в 3.9 ГБ и запускается на телефоне.
AI-обработка оригинала Neurohive; редакция Hamidun News
Стартап PrismML, основанный исследователями Калтехского технологического института, представил Bonsai 27B — первую в мире 27-миллиардную языковую модель, успешно запущенную на смартфоне. В основе технологии — 1-битные и тернарные веса, позволяющие сжать Qwen3.6-27B в 9.4–14.2 раза при сохранении 90–95% исходного качества.
Как устроена Bonsai 27B
Bonsai 27B — не новая архитектура, а экстремально оптимизированная версия открытой модели Qwen3.6-27B от Alibaba. PrismML выпустил два варианта с разной степенью квантизации: тернарный (веса принимают значения –1, 0 или +1) и бинарный (только –1 и +1). Такой метод называется пост-тренировочной квантизацией — оригинальные веса сжимаются уже после обучения, без переобучения с нуля.
Конкретные параметры двух версий:
- Тернарная версия: 5.9 ГБ, скорость около 26 токенов в секунду на стандартном ноутбуке
- 1-битная (бинарная) версия: 3.9 ГБ, помещается в RAM смартфона
- Степень сжатия весов: 9.4–14.2 раза относительно оригинала
- Сохранение качества: 90–95% от полной Qwen3.6-27B
- Разработчик: PrismML (основан исследователями Caltech)
Оригинальная Qwen3.6-27B в формате fp16 весит свыше 50 ГБ и требует серверного GPU. Bonsai 27B в 1-битном варианте — в 13 раз меньше.
Почему 1-битные веса меняют правила
В стандартных языковых моделях каждый параметр хранится в 16 или 32 битах. Переход к 1-битному представлению означает, что «вес» — это буквально ноль или единица. Это радикально сокращает объём памяти и ускоряет инференс на устройствах без специализированного GPU.
Согласно публикации PrismML, именно этот подход позволил запустить модель на обычном смартфоне без облачного подключения — то, что ещё год назад считалось нереальным для моделей масштаба 27 миллиардов параметров. Прежде мобильные LLM ограничивались моделями в 1–7 миллиардов параметров: Gemma 2B от Google или Phi-3.5-mini от Microsoft.
«Bonsai 27B показывает, что граница между облачными и edge-вычислениями стремительно стирается», — говорится в официальном анонсе
PrismML.
Оба варианта модели опубликованы в открытый доступ на Hugging Face, разработчики могут экспериментировать уже сейчас.
Что это значит
Запуск 27-миллиардной модели на смартфоне — важный технологический порог: мощные языковые модели смогут работать на миллиардах существующих устройств без облачной инфраструктуры, с полной приватностью данных и в офлайн-режиме. PrismML своим результатом подтвердила, что 1-битная квантизация превратилась из академической идеи в практический инструмент.
Частые вопросы
Можно ли запустить Bonsai 27B на iPhone или Android?
1-битная версия весом 3.9 ГБ работает на обычном смартфоне без подключения к облаку — именно это продемонстрировала PrismML в своём анонсе.
Чем Bonsai 27B отличается от Qwen3.6-27B?
Bonsai 27B — это Qwen3.6-27B с экстремально сжатыми весами. PrismML применила 1-битную и тернарную квантизацию, уменьшив размер модели в 9.4–14.2 раза при сохранении 90–95% качества оригинала.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.