Together AI lança MiniMax M3 com contexto de 1 milhão de tokens e suporte multimodal
A Together AI tornou-se a parceira oficial de nuvem da MiniMax para o lançamento do M3, com contexto de até 1 milhão de tokens e multimodalidade nativa. A equipe da Together escreveu kernels específicos de atenção esparsa e um gateway de pré-processamento em Rust: a taxa de transferência cresceu entre 81% e 125%, dependendo da carga. Após o lançamento dos pesos abertos, o modelo ficará disponível como API para desenvolvedores diretamente na plataforma da Together AI.
Processado por IA de Together AI Blog; editado por Hamidun News
Together AI Lançou MiniMax M3 com Contexto de 1 Milhão de Tokens e Multimodalidade
Together AI anunciou uma parceria com MiniMax e lançou o modelo M3 em produção — com contexto de até um milhão de tokens, multimodalidade nativa e aceleração de inferência de até 125%.
O Que é MiniMax M3
MiniMax M3 é o modelo principal da empresa, criado para tarefas de agentes do mundo real: documentos longos, bases de código, imagens, invocações de ferramentas — tudo em um contexto. Os modelos anteriores lutaram com contextos longos devido à complexidade quadrática da autoatenção. M3 resolve esse problema de uma maneira fundamentalmente diferente.
No centro da arquitetura está MiniMax Sparse Attention (MSA), um mecanismo de atenção esparsa por blocos. Cada token de consulta atende apenas a um número limitado de blocos KV-cache relevantes em vez da sequência inteira. Por isso, a complexidade computacional não cresce mais quadraticamente com o comprimento do contexto.
Comparado com M2.7: a aceleração de preenchimento é 9x, a aceleração de decodificação é 15x. Características principais do M3:
- Janela de contexto — até 1 milhão de tokens
- Multimodalidade nativa: texto, código, imagens
- Suporte para cenários de agentes e invocações de ferramentas
- Resultados competitivos em tarefas de programação
Como Together AI Preparou a Infraestrutura
Lançar tal modelo em produção sem perder eficiência é não trivial. MSA assume dois estágios ao calcular atenção: primeiro, calcular relevância para selecionar blocos KV, depois atenção densa entre tokens de consulta e blocos selecionados. Implementações padrão não lidam bem com isso.
O time de engenharia da Together AI escreveu quatro otimizações principais:
- Kernel de atenção esparsa KV-Block-Major — um kernel CUDA para atenção esparsa sobre blocos de KV-cache com reorganização de memória específica para MSA
- Decodificação MSA paginada — integração de atenção paginada para decodificação com contexto de um milhão de tokens sem fragmentação de memória
- Kernel de pontuação de índice otimizado — cálculo de relevância acelerado para seleção de blocos KV em cada etapa de decodificação
- Gateway multimodal baseado em Rust — uma porta de pré-processamento para imagens e entradas mistas com latência mínima
No total, essas otimizações forneceram ganhos de throughput de 81% a 125% em vários níveis de carga — as medições foram realizadas na NVIDIA B200.
O Que Vem Depois
MiniMax M3 já está disponível através da Together AI como serviço em nuvem. Nos próximos dias, pesos abertos serão lançados — após o que o modelo pode ser implantado independentemente ou usado como um endpoint de API na plataforma Together diretamente.
"Lançar M3 em produção confirma
Together AI como a plataforma preferida para modelos que impõem demandas reais no nível do sistema," — do blog oficial da empresa.
O Que Isso Significa
A capacidade da Together AI de implantar um modelo com contexto de 1M-tokens 81–125% mais eficiente do que uma abordagem padrão é um sinal competitivo para o mercado. Para desenvolvedores, significa acesso rápido a um poderoso agente multimodal através de uma API simples sem precisar trabalhar através dos detalhes arquiteturais do MSA você mesmo.
Quer parar de ler sobre IA e começar a usar?
AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.