Neurohive→ оригинал

Bonsai 27B от PrismML: модель Qwen3-27B впервые запустили на смартфоне

PrismML, стартап исследователей Caltech, представил Bonsai 27B — первую 27-миллиардную языковую модель, запущенную прямо на смартфоне. В основе — 1-битные и тернарные веса модели Qwen3.6-27B: сжатие в 9.4–14.2 раза при сохранении 90–95% качества. Тернарная версия (5.9 ГБ) работает на ноутбуке со скоростью ~26 токенов/с, а 1-битная умещается в 3.9 ГБ и запускается на телефоне.

AI-обработка оригинала Neurohive; редакция Hamidun News
Bonsai 27B от PrismML: модель Qwen3-27B впервые запустили на смартфоне
Источник: Neurohive. Коллаж: Hamidun News.
◐ Слушать статью

Стартап PrismML, основанный исследователями Калтехского технологического института, представил Bonsai 27B — первую в мире 27-миллиардную языковую модель, успешно запущенную на смартфоне. В основе технологии — 1-битные и тернарные веса, позволяющие сжать Qwen3.6-27B в 9.4–14.2 раза при сохранении 90–95% исходного качества.

Как устроена Bonsai 27B

Bonsai 27B — не новая архитектура, а экстремально оптимизированная версия открытой модели Qwen3.6-27B от Alibaba. PrismML выпустил два варианта с разной степенью квантизации: тернарный (веса принимают значения –1, 0 или +1) и бинарный (только –1 и +1). Такой метод называется пост-тренировочной квантизацией — оригинальные веса сжимаются уже после обучения, без переобучения с нуля.

Конкретные параметры двух версий:

  • Тернарная версия: 5.9 ГБ, скорость около 26 токенов в секунду на стандартном ноутбуке
  • 1-битная (бинарная) версия: 3.9 ГБ, помещается в RAM смартфона
  • Степень сжатия весов: 9.4–14.2 раза относительно оригинала
  • Сохранение качества: 90–95% от полной Qwen3.6-27B
  • Разработчик: PrismML (основан исследователями Caltech)

Оригинальная Qwen3.6-27B в формате fp16 весит свыше 50 ГБ и требует серверного GPU. Bonsai 27B в 1-битном варианте — в 13 раз меньше.

Почему 1-битные веса меняют правила

В стандартных языковых моделях каждый параметр хранится в 16 или 32 битах. Переход к 1-битному представлению означает, что «вес» — это буквально ноль или единица. Это радикально сокращает объём памяти и ускоряет инференс на устройствах без специализированного GPU.

Согласно публикации PrismML, именно этот подход позволил запустить модель на обычном смартфоне без облачного подключения — то, что ещё год назад считалось нереальным для моделей масштаба 27 миллиардов параметров. Прежде мобильные LLM ограничивались моделями в 1–7 миллиардов параметров: Gemma 2B от Google или Phi-3.5-mini от Microsoft.

«Bonsai 27B показывает, что граница между облачными и edge-вычислениями стремительно стирается», — говорится в официальном анонсе

PrismML.

Оба варианта модели опубликованы в открытый доступ на Hugging Face, разработчики могут экспериментировать уже сейчас.

Что это значит

Запуск 27-миллиардной модели на смартфоне — важный технологический порог: мощные языковые модели смогут работать на миллиардах существующих устройств без облачной инфраструктуры, с полной приватностью данных и в офлайн-режиме. PrismML своим результатом подтвердила, что 1-битная квантизация превратилась из академической идеи в практический инструмент.

Частые вопросы

Можно ли запустить Bonsai 27B на iPhone или Android?

1-битная версия весом 3.9 ГБ работает на обычном смартфоне без подключения к облаку — именно это продемонстрировала PrismML в своём анонсе.

Чем Bonsai 27B отличается от Qwen3.6-27B?

Bonsai 27B — это Qwen3.6-27B с экстремально сжатыми весами. PrismML применила 1-битную и тернарную квантизацию, уменьшив размер модели в 9.4–14.2 раза при сохранении 90–95% качества оригинала.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…