MarkTechPost→ оригинал

Thinking Machines Lab выпустила Inkling-Small: открытая MoE-модель 276B превзошла учителя

Thinking Machines Lab выпустила Inkling-Small — открытую мультимодальную MoE-модель с 276B параметрами (12B активных). Это четверть размера исходного Inkling (975B), но на SWE-bench Verified она набирает 80,2% против 77,6% у «учителя», а на HLE — 31,6% против 29,7%. Контекст — 1M токенов, поддержка текста, изображений и аудио. Веса под Apache 2.0 на Hugging Face; минимальный запуск — одна карта B300 в режиме NVFP4.

AI-обработка оригинала MarkTechPost; редакция Hamidun News
Thinking Machines Lab выпустила Inkling-Small: открытая MoE-модель 276B превзошла учителя
Источник: MarkTechPost. Коллаж: Hamidun News.
◐ Слушать статью

Thinking Machines Lab 2 августа 2026 года открыла веса Inkling-Small — мультимодальной модели на архитектуре Mixture-of-Experts с 276 миллиардами суммарных параметров и 12 миллиардами активных. При размере в четыре раза меньше исходного Inkling (975B суммарных, 41B активных) новая модель превосходит его на большинстве ключевых бенчмарков по кодингу и рассуждениям.

Чем Inkling-Small отличается от Inkling

Inkling-Small — 42-слойный декодер-трансформер с разреженным MoE-слоем вместо стандартных FFN. Каждый токен маршрутизируется к 6 из 256 экспертов плюс к 2 общим экспертам, активным постоянно. Внимание строится как гибрид локальных и глобальных слоёв.

Модель нативно мультимодальна и не требует отдельного энкодера:

  • 276B суммарных параметров, 12B активных при инференсе
  • Контекстное окно — 1M токенов с настраиваемым уровнем «усилия» мышления
  • Ввод: текст, изображения (патчи 40×40 пикселей через четырёхслойный hMLP) и аудио (dMel-спектрограммы, WAV 16 кГц, до 2 минут)
  • Числовые форматы: BF16, MXFP8 и NVFP4
  • Лицензия Apache 2.0, веса опубликованы на Hugging Face

Как запустить Inkling-Small

Контрольная точка BF16 требует минимум 600 ГБ суммарной видеопамяти — это 4× NVIDIA B300 или 8× NVIDIA H200. Квантованная версия NVFP4 снижает порог до 180 ГБ: режим W4A4 работает на одной карте B300 (требуется архитектура SM100+), W4A16 — на двух H200.

Поддерживаемые рантаймы — SGLang, vLLM, TokenSpeed, Unsloth и Hugging Face Transformers. Путь через одну GPU выводит 276B-модель из категории «только для крупных лабораторий»: стартапы могут арендовать один B300-инстанс, компании с имеющимися H200-кластерами обходятся без новых закупок. Регулируемые отрасли — финансы, здравоохранение, страхование, телеком — получают опцию с приватными весами без зависимости от внешнего API.

На каких тестах Inkling-Small обогнала Inkling

Inkling-Small превзошла «учителя» на большинстве ключевых тестов. На Humanity's Last Exam (текстовая версия) она набирает 31,6% против 29,7% у Inkling. SWE-bench Verified — 80,2% против 77,6% (bash-only харнесс). Toolathlon Verified — 54,4% против 45,5%. GPQA Diamond — 89,5%, AIME 2026 — 95,5%, ARC-AGI-2 — 40,1% против 36,5%. Terminal-Bench 2.1 — 64,7%.

Два явных регресса: SimpleQA Verified падает до 20,6% с 43,9% у Inkling, Tau 3 Banking — до 15,5% с 23,7%. Мультимодальные показатели держатся рядом с учителем: MMMU Pro — 74,0%, VoiceBench — 90,1%, MMAU — 77,0%, по данным Artificial Analysis, Scale AI и ARC Prize.

«Модель не создаёт существенного превосходства по сравнению с существующей экосистемой открытых весов», — резюмирует

Thinking Machines Lab в карте Inkling-Small, рекомендуя добавлять нижестоящую модерацию — например, Llama Guard — в потребительских приложениях.

Что это значит

Inkling-Small демонстрирует: направленная дистилляция с учителем Inkling и двухнедельное RL-обучение на агентном кодинге позволяют компактной модели обходить более крупного предшественника. Открытые веса под Apache 2.0 делают 276B-агент доступным для самостоятельного развёртывания — и расширяют круг компаний, которые могут строить продукты без зависимости от закрытых API.

Частые вопросы

Сколько видеопамяти нужно для Inkling-Small?

Минимум 180 ГБ VRAM в квантованном режиме NVFP4 на одной карте B300 (SM100+). Полная точность BF16 требует 600 ГБ суммарно — например, 4× NVIDIA B300 или 8× NVIDIA H200.

Чем Inkling-Small лучше исходного Inkling?

На шести ключевых бенчмарках: SWE-bench Verified (80,2% vs 77,6%), GPQA Diamond (89,5%), AIME 2026 (95,5%), ARC-AGI-2 (40,1% vs 36,5%), Toolathlon Verified (54,4% vs 45,5%) и HLE — 31,6% против 29,7%. Уступает на SimpleQA Verified (20,6% vs 43,9%) и Tau 3 Banking (15,5% vs 23,7%).

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…