LLM с квадриллионом параметров: когда ждать — и почему ответ «никогда»
На Habr вышла аналитика о будущем масштабирования LLM: модели на квадриллион (10^15) параметров не появятся — физика против. Сегодня GPT-4 содержит ~1,76 трлн параметров, до квадриллиона ещё в 700–1000 раз. Для обучения такой модели нужно 20 квадриллионов токенов — столько текстовых данных в мире просто не существует. Плюс только хранение весов займёт ~125 ТБ.
Processado por IA de Habr AI; editado por Hamidun News
Modelos com um quatrilhão de parâmetros (10^15) não aparecerão em um futuro próximo — limitações físicas e computacionais tornam essa escala praticamente inalcançável no paradigma atual.
Quão longe estamos de um quatrilhão hoje?
Estamos mil vezes mais longe desse número cobiçado do que parece. Os melhores modelos de linguagem de 2025–2026 operam na faixa de centenas de bilhões a alguns trilhões de parâmetros. De acordo com analistas da SemiAnalysis, o GPT-4 é construído sobre uma arquitetura Mixture of Experts com um total de pesos de aproximadamente 1,76 trilhão; o Gemini Ultra do Google tem cerca de 1,56 trilhão. Para chegar a um quatrilhão (10^15), a escala precisaria crescer mais 700–1.000 vezes.
- A faixa dos modelos frontier hoje: ~100 bilhões — ~2 trilhões de parâmetros
- Um quatrilhão (10^15) é 700–1.000 vezes maior que o GPT-4
- O treinamento do GPT-4, segundo estimativas de analistas, custou mais de US$ 100 milhões
- O treinamento do Llama 2 70B, de acordo com a documentação técnica da Meta, exigiu ~539 MWh
- Apenas armazenar os pesos de um modelo 1Q no formato int4 ocuparia aproximadamente 125 TB
Por que um crescimento de 1.000 vezes não é simplesmente uma questão
de "esperar"?
Um modelo com um quatrilhão de parâmetros não requer apenas mais dinheiro — requer uma física fundamentalmente diferente.
As GPUs flagship da NVIDIA H100/H200 armazenam 80–192 GB de memória por placa. Mesmo na quantização agressiva de 1 bit, um modelo 1Q exigiria ~125 TB apenas para os pesos — sem ativações, gradientes ou otimizador. No formato padrão BF16, isso já equivale a ~2 petabytes. Tal volume requer a construção de uma infraestrutura fundamentalmente diferente, que nenhuma empresa no mundo possui atualmente.
"Vemos retornos decrescentes do escalonamento puro de parâmetros — dados e eficiência computacional importam mais do que o tamanho bruto", — de acordo com as publicações de pesquisa da equipe
DeepMind sobre a otimização Chinchilla.
O consumo de energia se soma ao desafio físico. Estima-se que o treinamento de um modelo 1Q com a eficiência atual dos chips exigiria dezenas a centenas de TWh — comparável ao consumo anual de energia elétrica de um país europeu médio.
Por que não há dados suficientes para um quatrilhão?
De acordo com a pesquisa do DeepMind (Hoffmann et al., 2022), para o treinamento com compute ótimo, um modelo precisa ser treinado em aproximadamente 20 tokens por parâmetro. Portanto, um modelo 1Q precisaria ser treinado em 20 quatrilhões de tokens. De acordo com diversas estimativas de pesquisa, todo o texto digitalizado da internet equivale a aproximadamente 10^13–10^14 tokens — de 200 a 2.000 vezes menos do que o necessário.
Dados sintéticos aliviam parcialmente a restrição, mas não em escala de mil vezes e não sem degradação de qualidade na geração em loop. Em outras palavras, mesmo que a infraestrutura computacional existisse — não haveria com que alimentar tal modelo.
O que isso significa
LLMs com um quatrilhão de parâmetros não são uma questão de tempo e financiamento, mas de limitações fundamentais: física dos semicondutores, volume dos dados existentes e retornos decrescentes do escalonamento. O progresso da indústria não caminha em direção a "um modelo enorme único", mas a arquiteturas mais eficientes — Mixture of Experts, Retrieval-Augmented Generation e sistemas agênticos especializados.
Perguntas frequentes
Qual é o tamanho do maior LLM aberto hoje?
A partir de 2026, o maior modelo totalmente aberto continua sendo o Grok-1 da xAI — 314 bilhões de parâmetros em arquitetura Mixture of Experts, lançado em acesso aberto em março de 2024. Modelos frontier fechados dos principais laboratórios, segundo estimativas de analistas da SemiAnalysis, superam 1 trilhão de parâmetros.
Os computadores quânticos ajudarão no treinamento desses modelos?
Computadores quânticos são eficazes para uma classe restrita de tarefas — fatorização e simulação molecular —, mas não para multiplicação de matrizes, sobre a qual o treinamento de transformers é construído. No futuro previsível, os sistemas quânticos não substituirão GPUs e TPUs nas tarefas de treinamento de LLM.
*A Meta é reconhecida como organização extremista e é proibida na Rússia.
Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?
Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.