Together AI Blog→ original

Together AI leva nove trabalhos de pesquisa para a conferência ICML 2026 em Seul

Together AI apresentou nove trabalhos de pesquisa em ICML 2026 em Seul — de frameworks de agentes a kernels de GPU. ThunderAgent acelera a inferência de agentes em 3,6 vezes, Aurora (decodificação especulativa adaptativa) já funciona em produção como ATLAS-speculator, e Untied Ulysses mantém contexto de 5 milhões de tokens em um único nó. A empresa enfatiza: ganhos em um nível de pilha são inúteis sem o resto.

Processado por IA de Together AI Blog; editado por Hamidun News
Together AI leva nove trabalhos de pesquisa para a conferência ICML 2026 em Seul
Fonte: Together AI Blog. Colagem: Hamidun News.
◐ Ouvir artigo

A Together AI anunciou em 30 de junho de 2026 que nove artigos de pesquisa da empresa e de seus parceiros foram aceitos na conferência ICML 2026 em Seul — as apresentações serão realizadas no estande B714 e cobrem toda a pilha de infraestrutura de IA, desde agentes até núcleos de GPU.

Como a pilha de pesquisa é organizada

A Together AI enfatiza: a IA de fronteira não é construída em um único nível. Uma vitória em uma camada é inútil se as camadas vizinhas não conseguem acompanhá-la. A empresa distribuiu nove artigos em cinco níveis da pilha — desde agentes no topo até núcleos de GPU na base — e mostrou como cada nível alimenta o próximo, com cargas de trabalho de produção da Together indicando qual desafio de pesquisa resolver a seguir.

ICML (Conferência Internacional sobre Aprendizado de Máquina) é uma das principais conferências mundiais de aprendizado de máquina ao lado de NeurIPS e ICLR, e ter um artigo aceito em seu programa é tradicionalmente considerado um forte sinal de qualidade de pesquisa na indústria. Em 2026, a conferência é realizada em Seul, onde Together AI terá seu próprio estande B714 para se encontrar com os participantes.

O que há de novo em agentes e treinamento de modelos

Três artigos são dedicados a agentes que fazem trabalho real e são avaliados em tarefas que não podem ser "fingidas" como resolvidas. DSGym é um framework para avaliar e treinar agentes em dados: mais de 1.000 tarefas em 10+ domínios sob uma única API. ThunderAgent acelera a inferência de agentes em até 3,6 vezes. TTT-Discover é um modelo aberto que, de acordo com os autores, supera os melhores resultados humanos em sua categoria de tarefas.

Mais dois artigos abordam como transformar um modelo base em um "raciocador" mesmo onde não há resposta de referência pronta para verificar. RARO treina um modelo sem um verificador e oferece 25% de melhoria em relação à baseline. V1 adiciona até 10% de respostas corretas. Ambos os artigos resolvem o mesmo problema prático: como melhorar um modelo em tarefas onde a correção da resposta não pode ser verificada por simples comparação com um "dicionário de respostas corretas".

Como a inferência e os núcleos de GPU são acelerados

No nível de otimização algorítmica, Aurora implementa decodificação especulativa adaptativa — uma técnica na qual um modelo mais leve pre-adivinha vários tokens enquanto o modelo principal os verifica, acelerando a geração de texto. Aurora se adapta ao tráfego ao vivo e fornece aceleração de até 1,25x. De acordo com Together AI, essa mesma linha de pesquisa já está funcionando em produção em sua plataforma sob o nome ATLAS-especulador — ou seja, o caminho de um artigo no ICML para um serviço real levou não anos mas um ciclo de desenvolvimento.

Fatos-chave nos níveis de sistema e hardware:

  • Untied Ulysses mantém um contexto de 5 milhões de tokens em um único nó de computação
  • Opportunistic Expert Activation (OEA) acelera a decodificação do modelo MoE em até 39%
  • ParallelKernelBench é um conjunto de 87 tarefas em núcleos multi-GPU, a fundação da pilha onde hardware bruto se torna velocidade útil
  • Um total de 9 artigos de Together AI e parceiros são aceitos no ICML 2026
  • A empresa os apresenta no estande B714 em Seul

Por que isso importa para a empresa

A Together AI vincula diretamente a pesquisa à produção: os avanços de Aurora já são usados em sua plataforma como ATLAS-especulador. A lógica do ciclo que a empresa descreve é esta — os resultados de pesquisa se tornam parte da plataforma Together, e as cargas de trabalho de produção nessa plataforma mostram qual desafio de pesquisa resolver a seguir.

O que isto significa

ICML 2026 mostra que a corrida por inferência de IA mais rápida e barata não é apenas no nível dos próprios modelos, mas também no nível de frameworks de agentes, algoritmos de decodificação e núcleos de GPU — e empresas como Together AI estão construindo pesquisa em toda essa pilha de uma vez, em vez de em um único ponto.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Quer parar de ler sobre IA e começar a usar?

AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.

O que você acha?
Carregando comentários…