MarkTechPost→ original

Thinking Machines Lab выпустила Inkling-Small: открытая MoE-модель 276B превзошла учителя

Thinking Machines Lab выпустила Inkling-Small — открытую мультимодальную MoE-модель с 276B параметрами (12B активных). Это четверть размера исходного Inkling (975B), но на SWE-bench Verified она набирает 80,2% против 77,6% у «учителя», а на HLE — 31,6% против 29,7%. Контекст — 1M токенов, поддержка текста, изображений и аудио. Веса под Apache 2.0 на Hugging Face; минимальный запуск — одна карта B300 в режиме NVFP4.

Processado por IA de MarkTechPost; editado por Hamidun News
Thinking Machines Lab выпустила Inkling-Small: открытая MoE-модель 276B превзошла учителя
Fonte: MarkTechPost. Colagem: Hamidun News.
◐ Ouvir artigo

A Thinking Machines Lab lançou em 2 de agosto de 2026 os pesos do Inkling-Small — um modelo multimodal baseado na arquitetura Mixture-of-Experts com 276 bilhões de parâmetros totais e 12 bilhões de parâmetros ativos. Com um tamanho quatro vezes menor que o Inkling original (975B totais, 41B ativos), o novo modelo supera o antecessor na maioria dos principais benchmarks de codificação e raciocínio.

Como o Inkling-Small se diferencia do Inkling

O Inkling-Small é um decoder-transformer de 42 camadas com uma camada MoE esparsa em vez do FFN padrão. Cada token é roteado para 6 dos 256 especialistas, mais 2 especialistas compartilhados sempre ativos. A atenção é construída como um híbrido de camadas locais e globais.

O modelo é nativamente multimodal e não requer um encoder separado:

  • 276B parâmetros totais, 12B ativos durante a inferência
  • Janela de contexto — 1M tokens com nível de "esforço" de pensamento ajustável
  • Entrada: texto, imagens (patches de 40×40 pixels via hMLP de quatro camadas) e áudio (espectrogramas dMel, WAV 16 kHz, até 2 minutos)
  • Formatos numéricos: BF16, MXFP8 e NVFP4
  • Licença Apache 2.0, pesos publicados no Hugging Face

Como executar o Inkling-Small

O checkpoint BF16 requer no mínimo 600 GB de VRAM total — equivalente a 4× NVIDIA B300 ou 8× NVIDIA H200. A versão quantizada NVFP4 reduz o requisito para 180 GB: o modo W4A4 funciona em uma única placa B300 (arquitetura SM100+ obrigatória), W4A16 — em duas H200.

Os runtimes suportados são SGLang, vLLM, TokenSpeed, Unsloth e Hugging Face Transformers. O caminho via uma única GPU tira o modelo de 276B da categoria "apenas para grandes laboratórios": startups podem alugar uma única instância B300, e empresas com clusters H200 existentes dispensam novas aquisições. Setores regulados — finanças, saúde, seguros, telecom — ganham uma opção de pesos privados sem dependência de API externa.

Em quais testes o Inkling-Small superou o Inkling

O Inkling-Small superou o "professor" na maioria dos principais testes. No Humanity's Last Exam (versão textual) obtém 31,6% contra 29,7% do Inkling. SWE-bench Verified — 80,2% contra 77,6% (harness bash-only). Toolathlon Verified — 54,4% contra 45,5%. GPQA Diamond — 89,5%, AIME 2026 — 95,5%, ARC-AGI-2 — 40,1% contra 36,5%. Terminal-Bench 2.1 — 64,7%.

Duas regressões evidentes: SimpleQA Verified cai para 20,6% em relação a 43,9% do Inkling, Tau 3 Banking — para 15,5% em relação a 23,7%. Os resultados multimodais se mantêm próximos ao professor: MMMU Pro — 74,0%, VoiceBench — 90,1%, MMAU — 77,0%, segundo Artificial Analysis, Scale AI e ARC Prize.

"O modelo não cria vantagem significativa em comparação com o ecossistema de pesos abertos existente", resume a

Thinking Machines Lab no model card do Inkling-Small, recomendando adicionar moderação downstream — como o Llama Guard — em aplicações voltadas ao consumidor.

O que isso significa

O Inkling-Small demonstra que a destilação direcionada com o professor Inkling e duas semanas de treinamento RL em codificação agêntica permitem que um modelo compacto supere um predecessor maior. Os pesos abertos sob Apache 2.0 tornam o agente de 276B disponível para implantação própria — e ampliam o conjunto de empresas que podem construir produtos sem dependência de APIs fechadas.

Perguntas Frequentes

Quanta VRAM é necessária para o Inkling-Small?

No mínimo 180 GB de VRAM no modo quantizado NVFP4 em uma única placa B300 (SM100+). A precisão completa BF16 requer 600 GB no total — por exemplo, 4× NVIDIA B300 ou 8× NVIDIA H200.

Em que o Inkling-Small é melhor que o Inkling original?

Em seis benchmarks principais: SWE-bench Verified (80,2% vs 77,6%), GPQA Diamond (89,5%), AIME 2026 (95,5%), ARC-AGI-2 (40,1% vs 36,5%), Toolathlon Verified (54,4% vs 45,5%) e HLE — 31,6% contra 29,7%. Fica atrás no SimpleQA Verified (20,6% vs 43,9%) e Tau 3 Banking (15,5% vs 23,7%).

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Quer parar de ler sobre IA e começar a usar?

AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.

O que você acha?
Carregando comentários…