Together AI lleva nueve trabajos de investigación a la conferencia ICML 2026 en Seúl
Together AI presentó nueve trabajos de investigación en ICML 2026 en Seúl — de frameworks de agentes a kernels de GPU. ThunderAgent acelera la inferencia de agentes en 3,6 veces, Aurora (decodificación especulativa adaptativa) ya se ejecuta en producción como ATLAS-speculator, y Untied Ulysses mantiene contexto de 5 millones de tokens en un solo nodo. La empresa enfatiza: las ganancias en un nivel de pila son inútiles sin el resto.
Procesado por IA desde Together AI Blog; editado por Hamidun News
Together AI anunció el 30 de junio de 2026 que nueve artículos de investigación de la compañía y sus socios fueron aceptados en la conferencia ICML 2026 en Seúl — las presentaciones se realizarán en el stand B714 y cubrirán toda la pila de infraestructura de IA, desde agentes hasta núcleos de GPU.
Cómo se organiza la pila de investigación
Together AI enfatiza: la IA de frontera no se construye en un solo nivel. Una ganancia en una capa es inútil si las capas vecinas no pueden seguirle el ritmo. La compañía distribuyó nueve artículos a través de cinco niveles de la pila — desde agentes en la parte superior hasta núcleos de GPU en la base — y mostró cómo cada nivel alimenta el siguiente, con las cargas de trabajo de producción de Together indicando qué desafío de investigación resolver a continuación.
ICML (Conferencia Internacional sobre Aprendizaje Automático) es una de las principales conferencias mundiales de aprendizaje automático junto con NeurIPS e ICLR, y que un artículo entre en su programa se considera tradicionalmente una fuerte señal de calidad de investigación en la industria. En 2026, la conferencia se realiza en Seúl, donde Together AI tendrá su propio stand B714 para reuniones con participantes.
Qué hay de nuevo en agentes y entrenamiento de modelos
Tres artículos se dedican a agentes que realizan trabajo real y se evalúan en tareas que no pueden "pretender" estar resueltas. DSGym es un marco para evaluar y entrenar agentes en datos: más de 1,000 tareas en 10+ dominios bajo una única API. ThunderAgent acelera la inferencia de agentes hasta 3.6 veces. TTT-Discover es un modelo abierto que, según los autores, supera los mejores resultados humanos en su categoría de tareas.
Dos artículos más abordan cómo convertir un modelo base en un "razonador" incluso donde no hay respuesta de referencia lista para verificar. RARO entrena un modelo sin verificador y da 25% de ganancias en comparación con la línea de base. V1 añade hasta 10% de respuestas correctas. Ambos artículos resuelven el mismo problema práctico: cómo mejorar un modelo en tareas donde la corrección de la respuesta no puede verificarse por simple comparación con un "diccionario de respuestas correctas".
Cómo se aceleran la inferencia y los núcleos de GPU
En el nivel de optimización algorítmica, Aurora implementa decodificación especulativa adaptativa — una técnica en la que un modelo más ligero predigre varios tokens mientras que el modelo principal los verifica, acelerando la generación de texto. Aurora se ajusta al tráfico en vivo y proporciona una aceleración de hasta 1.25x. Según Together AI, esta misma línea de investigación ya está funcionando en producción en su plataforma bajo el nombre ATLAS-speculador — es decir, el camino de un artículo en ICML a un servicio real tomó no años sino un ciclo de desarrollo.
Hechos clave a nivel de sistema y hardware:
- Untied Ulysses sostiene un contexto de 5 millones de tokens en un único nodo de cálculo
- Opportunistic Expert Activation (OEA) acelera la decodificación del modelo MoE hasta 39%
- ParallelKernelBench es un conjunto de 87 tareas en núcleos multi-GPU, la base de la pila donde el hardware bruto se convierte en velocidad útil
- Un total de 9 artículos de Together AI y socios se aceptan en ICML 2026
- La compañía los presenta en el stand B714 en Seúl
Por qué esto importa a la compañía
Together AI vincula directamente la investigación a la producción: los avances de Aurora ya se utilizan en su plataforma como ATLAS-speculador. La lógica del ciclo que describe la compañía es esta — los resultados de investigación se convierten en parte de la plataforma Together, y las cargas de trabajo de producción en esa plataforma muestran qué desafío de investigación resolver a continuación.
Lo que esto significa
ICML 2026 muestra que la carrera por una inferencia de IA más rápida y barata no es solo a nivel de los modelos mismos, sino también a nivel de marcos de agentes, algoritmos de decodificación y núcleos de GPU — y compañías como Together AI están construyendo investigación a través de toda esta pila a la vez, en lugar de en un solo punto.
¿Quieres dejar de leer sobre IA y empezar a usarla?
AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.