Neurohive→ original

Bonsai 27B от PrismML: модель Qwen3-27B впервые запустили на смартфоне

PrismML, стартап исследователей Caltech, представил Bonsai 27B — первую 27-миллиардную языковую модель, запущенную прямо на смартфоне. В основе — 1-битные и тернарные веса модели Qwen3.6-27B: сжатие в 9.4–14.2 раза при сохранении 90–95% качества. Тернарная версия (5.9 ГБ) работает на ноутбуке со скоростью ~26 токенов/с, а 1-битная умещается в 3.9 ГБ и запускается на телефоне.

Processado por IA de Neurohive; editado por Hamidun News
Bonsai 27B от PrismML: модель Qwen3-27B впервые запустили на смартфоне
Fonte: Neurohive. Colagem: Hamidun News.
◐ Ouvir artigo

A startup PrismML, fundada por pesquisadores do Instituto de Tecnologia da Califórnia (Caltech), apresentou o Bonsai 27B — o primeiro modelo de linguagem de 27 bilhões de parâmetros do mundo a ser executado com sucesso em um smartphone. A tecnologia é baseada em pesos de 1 bit e ternários, que permitem comprimir o Qwen3.6-27B de 9,4 a 14,2 vezes, mantendo 90–95% da qualidade original.

Como Funciona o Bonsai 27B

O Bonsai 27B não é uma nova arquitetura, mas uma versão extremamente otimizada do modelo de código aberto Qwen3.6-27B da Alibaba. A PrismML lançou duas variantes com diferentes graus de quantização: ternária (os pesos assumem os valores –1, 0 ou +1) e binária (apenas –1 e +1). Esse método é chamado de quantização pós-treinamento — os pesos originais são comprimidos após o treinamento, sem retreinamento do zero.

Parâmetros específicos das duas versões:

  • Versão ternária: 5,9 GB, velocidade de aproximadamente 26 tokens por segundo em um laptop padrão
  • Versão de 1 bit (binária): 3,9 GB, cabe na RAM de um smartphone
  • Taxa de compressão dos pesos: 9,4–14,2 vezes em relação ao original
  • Retenção de qualidade: 90–95% do Qwen3.6-27B completo
  • Desenvolvedor: PrismML (fundada por pesquisadores do Caltech)

O Qwen3.6-27B original no formato fp16 pesa mais de 50 GB e requer uma GPU de servidor. A versão de 1 bit do Bonsai 27B é 13 vezes menor.

Por Que os Pesos de 1 Bit Mudam as Regras

Nos modelos de linguagem padrão, cada parâmetro é armazenado em 16 ou 32 bits. A transição para uma representação de 1 bit significa que um "peso" é literalmente um zero ou um. Isso reduz radicalmente o uso de memória e acelera a inferência em dispositivos sem GPU dedicada.

De acordo com a publicação da PrismML, foi exatamente essa abordagem que tornou possível executar o modelo em um smartphone comum sem conexão à nuvem — algo que há apenas um ano era considerado impossível para modelos na escala de 27 bilhões de parâmetros. Anteriormente, os LLMs móveis estavam limitados a modelos de 1–7 bilhões de parâmetros: o Gemma 2B do Google ou o Phi-3.5-mini da Microsoft.

"O

Bonsai 27B mostra que a fronteira entre a computação em nuvem e a computação de borda está desaparecendo rapidamente", afirma o anúncio oficial da PrismML.

Ambas as variantes do modelo foram publicadas em acesso aberto no Hugging Face, e os desenvolvedores já podem começar a experimentar.

O Que Isso Significa

Executar um modelo de 27 bilhões de parâmetros em um smartphone é um marco tecnológico importante: modelos de linguagem poderosos poderão funcionar em bilhões de dispositivos existentes sem infraestrutura de nuvem, com total privacidade de dados e em modo offline. Com esse resultado, a PrismML confirmou que a quantização de 1 bit passou de uma ideia acadêmica para uma ferramenta prática.

Perguntas Frequentes

O Bonsai 27B pode rodar em um iPhone ou Android?

A versão de 1 bit com 3,9 GB funciona em um smartphone comum sem conexão à nuvem — foi exatamente isso que a PrismML demonstrou em seu anúncio.

Como o Bonsai 27B difere do Qwen3.6-27B?

O Bonsai 27B é o Qwen3.6-27B com pesos extremamente comprimidos. A PrismML aplicou quantização de 1 bit e ternária, reduzindo o tamanho do modelo de 9,4 a 14,2 vezes, mantendo 90–95% da qualidade original.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…