Thinking Machines Lab выпустила Inkling-Small: открытая MoE-модель 276B превзошла учителя
Thinking Machines Lab выпустила Inkling-Small — открытую мультимодальную MoE-модель с 276B параметрами (12B активных). Это четверть размера исходного Inkling (975B), но на SWE-bench Verified она набирает 80,2% против 77,6% у «учителя», а на HLE — 31,6% против 29,7%. Контекст — 1M токенов, поддержка текста, изображений и аудио. Веса под Apache 2.0 на Hugging Face; минимальный запуск — одна карта B300 в режиме NVFP4.
Processado por IA de MarkTechPost; editado por Hamidun News
A Thinking Machines Lab lançou em 2 de agosto de 2026 os pesos do Inkling-Small — um modelo multimodal baseado na arquitetura Mixture-of-Experts com 276 bilhões de parâmetros totais e 12 bilhões de parâmetros ativos. Com um tamanho quatro vezes menor que o Inkling original (975B totais, 41B ativos), o novo modelo supera o antecessor na maioria dos principais benchmarks de codificação e raciocínio.
Como o Inkling-Small se diferencia do Inkling
O Inkling-Small é um decoder-transformer de 42 camadas com uma camada MoE esparsa em vez do FFN padrão. Cada token é roteado para 6 dos 256 especialistas, mais 2 especialistas compartilhados sempre ativos. A atenção é construída como um híbrido de camadas locais e globais.
O modelo é nativamente multimodal e não requer um encoder separado:
- 276B parâmetros totais, 12B ativos durante a inferência
- Janela de contexto — 1M tokens com nível de "esforço" de pensamento ajustável
- Entrada: texto, imagens (patches de 40×40 pixels via hMLP de quatro camadas) e áudio (espectrogramas dMel, WAV 16 kHz, até 2 minutos)
- Formatos numéricos: BF16, MXFP8 e NVFP4
- Licença Apache 2.0, pesos publicados no Hugging Face
Como executar o Inkling-Small
O checkpoint BF16 requer no mínimo 600 GB de VRAM total — equivalente a 4× NVIDIA B300 ou 8× NVIDIA H200. A versão quantizada NVFP4 reduz o requisito para 180 GB: o modo W4A4 funciona em uma única placa B300 (arquitetura SM100+ obrigatória), W4A16 — em duas H200.
Os runtimes suportados são SGLang, vLLM, TokenSpeed, Unsloth e Hugging Face Transformers. O caminho via uma única GPU tira o modelo de 276B da categoria "apenas para grandes laboratórios": startups podem alugar uma única instância B300, e empresas com clusters H200 existentes dispensam novas aquisições. Setores regulados — finanças, saúde, seguros, telecom — ganham uma opção de pesos privados sem dependência de API externa.
Em quais testes o Inkling-Small superou o Inkling
O Inkling-Small superou o "professor" na maioria dos principais testes. No Humanity's Last Exam (versão textual) obtém 31,6% contra 29,7% do Inkling. SWE-bench Verified — 80,2% contra 77,6% (harness bash-only). Toolathlon Verified — 54,4% contra 45,5%. GPQA Diamond — 89,5%, AIME 2026 — 95,5%, ARC-AGI-2 — 40,1% contra 36,5%. Terminal-Bench 2.1 — 64,7%.
Duas regressões evidentes: SimpleQA Verified cai para 20,6% em relação a 43,9% do Inkling, Tau 3 Banking — para 15,5% em relação a 23,7%. Os resultados multimodais se mantêm próximos ao professor: MMMU Pro — 74,0%, VoiceBench — 90,1%, MMAU — 77,0%, segundo Artificial Analysis, Scale AI e ARC Prize.
"O modelo não cria vantagem significativa em comparação com o ecossistema de pesos abertos existente", resume a
Thinking Machines Lab no model card do Inkling-Small, recomendando adicionar moderação downstream — como o Llama Guard — em aplicações voltadas ao consumidor.
O que isso significa
O Inkling-Small demonstra que a destilação direcionada com o professor Inkling e duas semanas de treinamento RL em codificação agêntica permitem que um modelo compacto supere um predecessor maior. Os pesos abertos sob Apache 2.0 tornam o agente de 276B disponível para implantação própria — e ampliam o conjunto de empresas que podem construir produtos sem dependência de APIs fechadas.
Perguntas Frequentes
Quanta VRAM é necessária para o Inkling-Small?
No mínimo 180 GB de VRAM no modo quantizado NVFP4 em uma única placa B300 (SM100+). A precisão completa BF16 requer 600 GB no total — por exemplo, 4× NVIDIA B300 ou 8× NVIDIA H200.
Em que o Inkling-Small é melhor que o Inkling original?
Em seis benchmarks principais: SWE-bench Verified (80,2% vs 77,6%), GPQA Diamond (89,5%), AIME 2026 (95,5%), ARC-AGI-2 (40,1% vs 36,5%), Toolathlon Verified (54,4% vs 45,5%) e HLE — 31,6% contra 29,7%. Fica atrás no SimpleQA Verified (20,6% vs 43,9%) e Tau 3 Banking (15,5% vs 23,7%).
Quer parar de ler sobre IA e começar a usar?
AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.