Together AI Blog→ original

Together AI lança MiniMax M3 com contexto de 1 milhão de tokens e suporte multimodal

A Together AI tornou-se a parceira oficial de nuvem da MiniMax para o lançamento do M3, com contexto de até 1 milhão de tokens e multimodalidade nativa. A equipe da Together escreveu kernels específicos de atenção esparsa e um gateway de pré-processamento em Rust: a taxa de transferência cresceu entre 81% e 125%, dependendo da carga. Após o lançamento dos pesos abertos, o modelo ficará disponível como API para desenvolvedores diretamente na plataforma da Together AI.

Processado por IA de Together AI Blog; editado por Hamidun News
Together AI lança MiniMax M3 com contexto de 1 milhão de tokens e suporte multimodal
Fonte: Together AI Blog. Colagem: Hamidun News.
◐ Ouvir artigo

Together AI Lançou MiniMax M3 com Contexto de 1 Milhão de Tokens e Multimodalidade

Together AI anunciou uma parceria com MiniMax e lançou o modelo M3 em produção — com contexto de até um milhão de tokens, multimodalidade nativa e aceleração de inferência de até 125%.

O Que é MiniMax M3

MiniMax M3 é o modelo principal da empresa, criado para tarefas de agentes do mundo real: documentos longos, bases de código, imagens, invocações de ferramentas — tudo em um contexto. Os modelos anteriores lutaram com contextos longos devido à complexidade quadrática da autoatenção. M3 resolve esse problema de uma maneira fundamentalmente diferente.

No centro da arquitetura está MiniMax Sparse Attention (MSA), um mecanismo de atenção esparsa por blocos. Cada token de consulta atende apenas a um número limitado de blocos KV-cache relevantes em vez da sequência inteira. Por isso, a complexidade computacional não cresce mais quadraticamente com o comprimento do contexto.

Comparado com M2.7: a aceleração de preenchimento é 9x, a aceleração de decodificação é 15x. Características principais do M3:

  • Janela de contexto — até 1 milhão de tokens
  • Multimodalidade nativa: texto, código, imagens
  • Suporte para cenários de agentes e invocações de ferramentas
  • Resultados competitivos em tarefas de programação

Como Together AI Preparou a Infraestrutura

Lançar tal modelo em produção sem perder eficiência é não trivial. MSA assume dois estágios ao calcular atenção: primeiro, calcular relevância para selecionar blocos KV, depois atenção densa entre tokens de consulta e blocos selecionados. Implementações padrão não lidam bem com isso.

O time de engenharia da Together AI escreveu quatro otimizações principais:

  • Kernel de atenção esparsa KV-Block-Major — um kernel CUDA para atenção esparsa sobre blocos de KV-cache com reorganização de memória específica para MSA
  • Decodificação MSA paginada — integração de atenção paginada para decodificação com contexto de um milhão de tokens sem fragmentação de memória
  • Kernel de pontuação de índice otimizado — cálculo de relevância acelerado para seleção de blocos KV em cada etapa de decodificação
  • Gateway multimodal baseado em Rust — uma porta de pré-processamento para imagens e entradas mistas com latência mínima

No total, essas otimizações forneceram ganhos de throughput de 81% a 125% em vários níveis de carga — as medições foram realizadas na NVIDIA B200.

O Que Vem Depois

MiniMax M3 já está disponível através da Together AI como serviço em nuvem. Nos próximos dias, pesos abertos serão lançados — após o que o modelo pode ser implantado independentemente ou usado como um endpoint de API na plataforma Together diretamente.

"Lançar M3 em produção confirma

Together AI como a plataforma preferida para modelos que impõem demandas reais no nível do sistema," — do blog oficial da empresa.

O Que Isso Significa

A capacidade da Together AI de implantar um modelo com contexto de 1M-tokens 81–125% mais eficiente do que uma abordagem padrão é um sinal competitivo para o mercado. Para desenvolvedores, significa acesso rápido a um poderoso agente multimodal através de uma API simples sem precisar trabalhar através dos detalhes arquiteturais do MSA você mesmo.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Quer parar de ler sobre IA e começar a usar?

AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.

O que você acha?
Carregando comentários…