Bonsai 27B от PrismML: модель Qwen3-27B впервые запустили на смартфоне
PrismML, стартап исследователей Caltech, представил Bonsai 27B — первую 27-миллиардную языковую модель, запущенную прямо на смартфоне. В основе — 1-битные и тернарные веса модели Qwen3.6-27B: сжатие в 9.4–14.2 раза при сохранении 90–95% качества. Тернарная версия (5.9 ГБ) работает на ноутбуке со скоростью ~26 токенов/с, а 1-битная умещается в 3.9 ГБ и запускается на телефоне.
Processado por IA de Neurohive; editado por Hamidun News
A startup PrismML, fundada por pesquisadores do Instituto de Tecnologia da Califórnia (Caltech), apresentou o Bonsai 27B — o primeiro modelo de linguagem de 27 bilhões de parâmetros do mundo a ser executado com sucesso em um smartphone. A tecnologia é baseada em pesos de 1 bit e ternários, que permitem comprimir o Qwen3.6-27B de 9,4 a 14,2 vezes, mantendo 90–95% da qualidade original.
Como Funciona o Bonsai 27B
O Bonsai 27B não é uma nova arquitetura, mas uma versão extremamente otimizada do modelo de código aberto Qwen3.6-27B da Alibaba. A PrismML lançou duas variantes com diferentes graus de quantização: ternária (os pesos assumem os valores –1, 0 ou +1) e binária (apenas –1 e +1). Esse método é chamado de quantização pós-treinamento — os pesos originais são comprimidos após o treinamento, sem retreinamento do zero.
Parâmetros específicos das duas versões:
- Versão ternária: 5,9 GB, velocidade de aproximadamente 26 tokens por segundo em um laptop padrão
- Versão de 1 bit (binária): 3,9 GB, cabe na RAM de um smartphone
- Taxa de compressão dos pesos: 9,4–14,2 vezes em relação ao original
- Retenção de qualidade: 90–95% do Qwen3.6-27B completo
- Desenvolvedor: PrismML (fundada por pesquisadores do Caltech)
O Qwen3.6-27B original no formato fp16 pesa mais de 50 GB e requer uma GPU de servidor. A versão de 1 bit do Bonsai 27B é 13 vezes menor.
Por Que os Pesos de 1 Bit Mudam as Regras
Nos modelos de linguagem padrão, cada parâmetro é armazenado em 16 ou 32 bits. A transição para uma representação de 1 bit significa que um "peso" é literalmente um zero ou um. Isso reduz radicalmente o uso de memória e acelera a inferência em dispositivos sem GPU dedicada.
De acordo com a publicação da PrismML, foi exatamente essa abordagem que tornou possível executar o modelo em um smartphone comum sem conexão à nuvem — algo que há apenas um ano era considerado impossível para modelos na escala de 27 bilhões de parâmetros. Anteriormente, os LLMs móveis estavam limitados a modelos de 1–7 bilhões de parâmetros: o Gemma 2B do Google ou o Phi-3.5-mini da Microsoft.
"O
Bonsai 27B mostra que a fronteira entre a computação em nuvem e a computação de borda está desaparecendo rapidamente", afirma o anúncio oficial da PrismML.
Ambas as variantes do modelo foram publicadas em acesso aberto no Hugging Face, e os desenvolvedores já podem começar a experimentar.
O Que Isso Significa
Executar um modelo de 27 bilhões de parâmetros em um smartphone é um marco tecnológico importante: modelos de linguagem poderosos poderão funcionar em bilhões de dispositivos existentes sem infraestrutura de nuvem, com total privacidade de dados e em modo offline. Com esse resultado, a PrismML confirmou que a quantização de 1 bit passou de uma ideia acadêmica para uma ferramenta prática.
Perguntas Frequentes
O Bonsai 27B pode rodar em um iPhone ou Android?
A versão de 1 bit com 3,9 GB funciona em um smartphone comum sem conexão à nuvem — foi exatamente isso que a PrismML demonstrou em seu anúncio.
Como o Bonsai 27B difere do Qwen3.6-27B?
O Bonsai 27B é o Qwen3.6-27B com pesos extremamente comprimidos. A PrismML aplicou quantização de 1 bit e ternária, reduzindo o tamanho do modelo de 9,4 a 14,2 vezes, mantendo 90–95% da qualidade original.
Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?
Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.