MarkTechPost→ original

Thinking Machines Lab выпустила Inkling-Small: открытая MoE-модель 276B превзошла учителя

Thinking Machines Lab выпустила Inkling-Small — открытую мультимодальную MoE-модель с 276B параметрами (12B активных). Это четверть размера исходного Inkling (975B), но на SWE-bench Verified она набирает 80,2% против 77,6% у «учителя», а на HLE — 31,6% против 29,7%. Контекст — 1M токенов, поддержка текста, изображений и аудио. Веса под Apache 2.0 на Hugging Face; минимальный запуск — одна карта B300 в режиме NVFP4.

Traité par IA depuis MarkTechPost ; édité par Hamidun News
Thinking Machines Lab выпустила Inkling-Small: открытая MoE-модель 276B превзошла учителя
Source : MarkTechPost. Collage: Hamidun News.
◐ Écouter l'article

Thinking Machines Lab a publié le 2 août 2026 les poids d'Inkling-Small — un modèle multimodal reposant sur l'architecture Mixture-of-Experts avec 276 milliards de paramètres au total et 12 milliards de paramètres actifs. Quatre fois plus petit que l'Inkling original (975B au total, 41B actifs), le nouveau modèle le surpasse sur la plupart des principaux benchmarks en codage et en raisonnement.

En quoi Inkling-Small diffère-t-il d'Inkling

Inkling-Small est un decoder-transformer à 42 couches avec une couche MoE creuse à la place du FFN standard. Chaque token est acheminé vers 6 des 256 experts, plus 2 experts partagés toujours actifs. L'attention est construite comme un hybride de couches locales et globales.

Le modèle est nativement multimodal et ne nécessite pas d'encoder séparé :

  • 276B paramètres au total, 12B actifs lors de l'inférence
  • Fenêtre de contexte — 1M tokens avec un niveau d'« effort » de raisonnement réglable
  • Entrée : texte, images (patches de 40×40 pixels via un hMLP à quatre couches) et audio (spectrogrammes dMel, WAV 16 kHz, jusqu'à 2 minutes)
  • Formats numériques : BF16, MXFP8 et NVFP4
  • Licence Apache 2.0, poids publiés sur Hugging Face

Comment exécuter Inkling-Small

Le checkpoint BF16 nécessite au minimum 600 Go de VRAM au total — soit 4× NVIDIA B300 ou 8× NVIDIA H200. La version quantifiée NVFP4 abaisse le seuil à 180 Go : le mode W4A4 fonctionne sur une seule carte B300 (architecture SM100+ requise), W4A16 — sur deux H200.

Les runtimes pris en charge sont SGLang, vLLM, TokenSpeed, Unsloth et Hugging Face Transformers. La voie via une seule GPU sort le modèle de 276B de la catégorie « réservé aux grands laboratoires » : les startups peuvent louer une seule instance B300, et les entreprises disposant de clusters H200 évitent de nouveaux achats. Les secteurs réglementés — finance, santé, assurance, télécoms — disposent d'une option à poids privés sans dépendance vis-à-vis d'une API externe.

Sur quels tests Inkling-Small a surpassé Inkling

Inkling-Small a surpassé le « professeur » sur la plupart des tests clés. Sur Humanity's Last Exam (version textuelle), il obtient 31,6 % contre 29,7 % pour Inkling. SWE-bench Verified — 80,2 % contre 77,6 % (harness bash uniquement). Toolathlon Verified — 54,4 % contre 45,5 %. GPQA Diamond — 89,5 %, AIME 2026 — 95,5 %, ARC-AGI-2 — 40,1 % contre 36,5 %. Terminal-Bench 2.1 — 64,7 %.

Deux régressions notables : SimpleQA Verified chute à 20,6 % contre 43,9 % pour Inkling, Tau 3 Banking — à 15,5 % contre 23,7 %. Les résultats multimodaux restent proches du professeur : MMMU Pro — 74,0 %, VoiceBench — 90,1 %, MMAU — 77,0 %, selon Artificial Analysis, Scale AI et ARC Prize.

«

Le modèle ne crée pas d'avantage significatif par rapport à l'écosystème de poids ouverts existant », résume Thinking Machines Lab dans la fiche modèle d'Inkling-Small, recommandant d'ajouter une modération en aval — comme Llama Guard — dans les applications grand public.

Ce que cela signifie

Inkling-Small démontre que la distillation ciblée avec le professeur Inkling et deux semaines d'entraînement RL sur le codage agentique permettent à un modèle compact de surpasser un prédécesseur plus grand. Les poids ouverts sous Apache 2.0 rendent l'agent de 276B accessible au déploiement autonome — et élargissent le cercle des entreprises capables de construire des produits sans dépendance aux APIs fermées.

Foire aux questions

De quelle quantité de VRAM a-t-on besoin pour

Inkling-Small ?

Au minimum 180 Go de VRAM en mode quantifié NVFP4 sur une seule carte B300 (SM100+). La précision complète BF16 requiert 600 Go au total — par exemple, 4× NVIDIA B300 ou 8× NVIDIA H200.

En quoi

Inkling-Small est-il meilleur que l'Inkling original ?

Sur six benchmarks clés : SWE-bench Verified (80,2 % vs 77,6 %), GPQA Diamond (89,5 %), AIME 2026 (95,5 %), ARC-AGI-2 (40,1 % vs 36,5 %), Toolathlon Verified (54,4 % vs 45,5 %) et HLE — 31,6 % contre 29,7 %. Il est en retrait sur SimpleQA Verified (20,6 % vs 43,9 %) et Tau 3 Banking (15,5 % vs 23,7 %).

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?

AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.

Qu'en pensez-vous ?
Chargement des commentaires…