Together AI Blog→ original

Together AI présente neuf articles de recherche à la conférence ICML 2026 à Séoul

Together AI a présenté neuf articles de recherche à ICML 2026 à Séoul — des frameworks d'agents aux kernels GPU. ThunderAgent accélère l'inférence des agents de 3,6 fois, Aurora (décodage spéculatif adaptatif) s'exécute déjà en production en tant que ATLAS-speculator, et Untied Ulysses maintient un contexte de 5 millions de tokens sur un seul nœud. L'entreprise souligne : les gains à un niveau de pile sont inutiles sans le reste.

Traité par IA depuis Together AI Blog ; édité par Hamidun News
Together AI présente neuf articles de recherche à la conférence ICML 2026 à Séoul
Source : Together AI Blog. Collage: Hamidun News.
◐ Écouter l'article

Together AI a annoncé le 30 juin 2026 que neuf articles de recherche de l'entreprise et de ses partenaires ont été acceptés à la conférence ICML 2026 à Séoul — les présentations se tiendront au stand B714 et couvriront toute la pile d'infrastructure d'IA, des agents aux cœurs de GPU.

Comment la pile de recherche est organisée

Together AI souligne : l'IA de frontière n'est pas construite à un seul niveau. Une victoire dans une couche est inutile si les couches voisines ne peuvent pas la suivre. L'entreprise a disposé neuf articles sur cinq niveaux de la pile — des agents tout en haut aux cœurs de GPU à la base — et a montré comment chaque niveau alimente le suivant, avec les charges de travail de production de Together indiquant quel défi de recherche résoudre ensuite.

ICML (Conférence internationale sur l'apprentissage automatique) est l'une des principales conférences mondiales sur l'apprentissage automatique aux côtés de NeurIPS et ICLR, et l'acceptation d'un article dans son programme est traditionnellement considérée comme un signal fort de la qualité de la recherche dans l'industrie. En 2026, la conférence se tient à Séoul, où Together AI aura son propre stand B714 pour rencontrer les participants.

Quoi de nouveau dans les agents et l'entraînement des modèles

Trois articles sont consacrés aux agents qui font du vrai travail et sont évalués sur des tâches qui ne peuvent pas être "prétendues" comme étant résolues. DSGym est un framework pour évaluer et entraîner des agents sur des données : plus de 1 000 tâches dans 10+ domaines sous une seule API. ThunderAgent accélère l'inférence des agents jusqu'à 3,6 fois. TTT-Discover est un modèle ouvert qui, selon les auteurs, dépasse les meilleurs résultats humains dans sa catégorie de tâches.

Deux autres articles abordent la façon de transformer un modèle de base en un "raisonneur" même lorsqu'il n'y a pas de réponse de référence prête à vérifier. RARO entraîne un modèle sans vérificateur et donne 25% de gains par rapport à la baseline. V1 ajoute jusqu'à 10% de réponses correctes. Les deux articles résolvent le même problème pratique : comment améliorer un modèle sur les tâches où la correction de la réponse ne peut pas être vérifiée par simple comparaison avec un "dictionnaire de réponses correctes".

Comment l'inférence et les cœurs de GPU sont accélérés

Au niveau de l'optimisation algorithmique, Aurora implémente le décodage spéculatif adaptatif — une technique dans laquelle un modèle plus léger pré-suppose plusieurs tokens tandis que le modèle principal les vérifie, accélérant la génération de texte. Aurora s'adapte au trafic en direct et fournit jusqu'à 1,25x d'accélération. Selon Together AI, cette même ligne de recherche fonctionne déjà en production sur leur plateforme sous le nom ATLAS-speculateur — c'est-à-dire que le chemin d'un article à l'ICML vers un service réel a pris non pas des années mais un cycle de développement.

Faits clés aux niveaux système et matériel :

  • Untied Ulysses maintient un contexte de 5 millions de tokens sur un seul nœud de calcul
  • Opportunistic Expert Activation (OEA) accélère le décodage des modèles MoE jusqu'à 39%
  • ParallelKernelBench est un ensemble de 87 tâches sur noyaux multi-GPU, la base de la pile où le matériel brut devient une vitesse utile
  • Un total de 9 articles de Together AI et partenaires sont acceptés à ICML 2026
  • L'entreprise les présente au stand B714 à Séoul

Pourquoi cela importe pour l'entreprise

Together AI lie directement la recherche à la production : les progrès d'Aurora sont déjà utilisés sur sa plateforme sous le nom ATLAS-speculateur. La logique du cycle décrite par l'entreprise est celle-ci — les résultats de recherche deviennent partie de la plateforme Together, et les charges de travail de production sur cette plateforme indiquent quel défi de recherche résoudre ensuite.

Ce que cela signifie

ICML 2026 montre que la course pour une inférence d'IA plus rapide et moins chère ne se fait pas seulement au niveau des modèles eux-mêmes, mais aussi au niveau des frameworks d'agents, des algorithmes de décodage et des cœurs de GPU — et des entreprises comme Together AI construisent la recherche sur toute cette pile à la fois, plutôt que sur un seul point.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?

AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.

Qu'en pensez-vous ?
Chargement des commentaires…