Thinking Machines Lab выпустила Inkling-Small: открытая MoE-модель 276B превзошла учителя
Thinking Machines Lab выпустила Inkling-Small — открытую мультимодальную MoE-модель с 276B параметрами (12B активных). Это четверть размера исходного Inkling (975B), но на SWE-bench Verified она набирает 80,2% против 77,6% у «учителя», а на HLE — 31,6% против 29,7%. Контекст — 1M токенов, поддержка текста, изображений и аудио. Веса под Apache 2.0 на Hugging Face; минимальный запуск — одна карта B300 в режиме NVFP4.
Procesado por IA desde MarkTechPost; editado por Hamidun News
Thinking Machines Lab publicó el 2 de agosto de 2026 los pesos de Inkling-Small — un modelo multimodal basado en la arquitectura Mixture-of-Experts con 276 mil millones de parámetros totales y 12 mil millones de parámetros activos. Con un tamaño cuatro veces menor que el Inkling original (975B totales, 41B activos), el nuevo modelo lo supera en la mayoría de los principales benchmarks de codificación y razonamiento.
En qué se diferencia Inkling-Small de Inkling
Inkling-Small es un decoder-transformer de 42 capas con una capa MoE dispersa en lugar del FFN estándar. Cada token se enruta hacia 6 de los 256 expertos más 2 expertos compartidos siempre activos. La atención se construye como un híbrido de capas locales y globales.
El modelo es nativamente multimodal y no requiere un encoder separado:
- 276B parámetros totales, 12B activos durante la inferencia
- Ventana de contexto — 1M tokens con nivel de «esfuerzo» de razonamiento ajustable
- Entrada: texto, imágenes (parches de 40×40 píxeles a través de un hMLP de cuatro capas) y audio (espectrogramas dMel, WAV 16 kHz, hasta 2 minutos)
- Formatos numéricos: BF16, MXFP8 y NVFP4
- Licencia Apache 2.0, pesos publicados en Hugging Face
Cómo ejecutar Inkling-Small
El checkpoint BF16 requiere un mínimo de 600 GB de VRAM total — equivalente a 4× NVIDIA B300 u 8× NVIDIA H200. La versión cuantizada NVFP4 reduce el umbral a 180 GB: el modo W4A4 funciona en una sola tarjeta B300 (arquitectura SM100+ requerida), W4A16 — en dos H200.
Los runtimes compatibles son SGLang, vLLM, TokenSpeed, Unsloth y Hugging Face Transformers. La vía de una sola GPU saca al modelo de 276B de la categoría «solo para grandes laboratorios»: las startups pueden alquilar una sola instancia B300, y las empresas con clústeres H200 existentes evitan nuevas adquisiciones. Los sectores regulados — finanzas, salud, seguros, telecomunicaciones — obtienen una opción de pesos privados sin dependencia de API externas.
En qué pruebas Inkling-Small superó a Inkling
Inkling-Small superó al «profesor» en la mayoría de las pruebas clave. En Humanity's Last Exam (versión textual) obtiene un 31,6% frente al 29,7% de Inkling. SWE-bench Verified — 80,2% frente al 77,6% (harness solo bash). Toolathlon Verified — 54,4% frente al 45,5%. GPQA Diamond — 89,5%, AIME 2026 — 95,5%, ARC-AGI-2 — 40,1% frente al 36,5%. Terminal-Bench 2.1 — 64,7%.
Dos regresiones claras: SimpleQA Verified cae al 20,6% desde el 43,9% de Inkling, Tau 3 Banking — al 15,5% desde el 23,7%. Los resultados multimodales se mantienen cerca del profesor: MMMU Pro — 74,0%, VoiceBench — 90,1%, MMAU — 77,0%, según Artificial Analysis, Scale AI y ARC Prize.
«El modelo no crea una ventaja significativa en comparación con el ecosistema de pesos abiertos existente», resume
Thinking Machines Lab en la tarjeta de modelo de Inkling-Small, recomendando añadir moderación downstream — como Llama Guard — en aplicaciones de consumo.
Qué significa esto
Inkling-Small demuestra que la destilación dirigida con el profesor Inkling y dos semanas de entrenamiento RL en codificación agéntica permiten a un modelo compacto superar a un predecesor más grande. Los pesos abiertos bajo Apache 2.0 ponen al agente de 276B al alcance del despliegue propio — y amplían el círculo de empresas que pueden crear productos sin depender de APIs cerradas.
Preguntas frecuentes
¿Cuánta VRAM se necesita para Inkling-Small?
Un mínimo de 180 GB de VRAM en modo cuantizado NVFP4 en una sola tarjeta B300 (SM100+). La precisión completa BF16 requiere 600 GB en total — por ejemplo, 4× NVIDIA B300 u 8× NVIDIA H200.
¿En qué es mejor Inkling-Small que el Inkling original?
En seis benchmarks clave: SWE-bench Verified (80,2% vs 77,6%), GPQA Diamond (89,5%), AIME 2026 (95,5%), ARC-AGI-2 (40,1% vs 36,5%), Toolathlon Verified (54,4% vs 45,5%) y HLE — 31,6% frente al 29,7%. Se queda por detrás en SimpleQA Verified (20,6% vs 43,9%) y Tau 3 Banking (15,5% vs 23,7%).
¿Quieres dejar de leer sobre IA y empezar a usarla?
AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.