Together AI везёт девять исследовательских работ на конференцию ICML 2026 в Сеуле
Together AI показала на ICML 2026 в Сеуле девять исследовательских работ — от агентных фреймворков до GPU-ядер. ThunderAgent ускоряет инференс агентов в 3,6 раза, Aurora (адаптивное спекулятивное декодирование) уже работает в продакшене как ATLAS-спекулятор, а Untied Ulysses держит контекст 5 миллионов токенов на одном узле. Компания подчёркивает: выигрыш на одном уровне стека бесполезен без остальных.
AI-обработка оригинала Together AI Blog; редакция Hamidun News
Together AI объявила 30 июня 2026 года, что девять исследовательских работ компании и её партнёров приняли на конференцию ICML 2026 в Сеуле — доклады представлены на стенде B714 и охватывают весь стек ИИ-инфраструктуры, от агентов до GPU-ядер.
Как устроен стек исследований
Together AI подчёркивает: фронтирный ИИ не строится на одном уровне. Выигрыш в одном слое бесполезен, если соседние слои не успевают за ним. Компания разложила девять работ по пяти уровням стека — от агентов на самом верху до GPU-ядер в основании — и показала, как каждый уровень питает следующий, а продакшен-нагрузки платформы Together указывают, какую исследовательскую задачу решать дальше.
ICML (International Conference on Machine Learning) — одна из ведущих мировых конференций по машинному обучению наравне с NeurIPS и ICLR, и попадание статьи в её программу традиционно считается сильным сигналом качества исследования в отрасли. В 2026 году конференция проходит в Сеуле, где у Together AI будет собственный стенд B714 для встреч с участниками.
Что нового в агентах и обучении моделей
Три работы посвящены агентам, которые делают реальную работу и оцениваются на задачах, которые нельзя «прикинуться» решёнными. DSGym — фреймворк для оценки и обучения агентов по данным: более 1 000 задач в 10+ доменах под единым API. ThunderAgent ускоряет инференс агентов до 3,6 раза. TTT-Discover — открытая модель, которая, по заявлению авторов, превосходит лучший человеческий результат в своей категории задач.
Ещё две работы — про то, как превратить базовую модель в «рассуждателя» даже там, где нет готового эталона ответа, по которому можно свериться. RARO обучает модель без верификатора и даёт 25% побед в сравнении с базовым вариантом. V1 добавляет до 10% правильных ответов. Обе работы решают одну и ту же практическую проблему: как улучшать модель на задачах, где правильность ответа нельзя проверить простым сравнением со «словарём правильных ответов».
Как ускоряют инференс и GPU-ядра
На уровне алгоритмической оптимизации Aurora реализует адаптивное спекулятивное декодирование — технику, при которой более лёгкая модель заранее «предугадывает» несколько токенов, а основная модель их проверяет, что ускоряет генерацию текста. Алгоритм Aurora подстраивается под живой трафик и даёт ускорение до 1,25 раза. По словам Together AI, эта же линия исследований уже работает в продакшене платформы под именем ATLAS-спекулятор — то есть путь от статьи на ICML до реального сервиса здесь занял не годы, а один цикл разработки.
Ключевые факты по системному и аппаратному уровням:
- Untied Ulysses держит контекст 5 миллионов токенов на одном вычислительном узле
- Opportunistic Expert Activation (OEA) ускоряет декодирование MoE-моделей до 39%
- ParallelKernelBench — набор из 87 задач на мульти-GPU ядра, фундамент стека, где сырое железо превращается в полезную скорость
- Всего на ICML 2026 приняты 9 работ Together AI и партнёров
- Компания представляет их на стенде B714 в Сеуле
Зачем это компании
Together AI прямо связывает исследования с продакшеном: наработки по Aurora уже используются в её платформе как ATLAS-спекулятор. Логика цикла, которую описывает компания, такова — результаты исследований становятся частью платформы Together, а продакшен-нагрузки на этой платформе показывают, какую исследовательскую задачу решать следующей.
Что это значит
ICML 2026 показывает, что борьба за более быстрый и дешёвый ИИ-инференс идёт не только на уровне самих моделей, но и на уровне агентных фреймворков, алгоритмов декодирования и GPU-ядер — и такие компании, как Together AI, выстраивают исследования сразу по всему этому стеку, а не в одной точке.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.