Habr AI→ original

LLM с квадриллионом параметров: когда ждать — и почему ответ «никогда»

На Habr вышла аналитика о будущем масштабирования LLM: модели на квадриллион (10^15) параметров не появятся — физика против. Сегодня GPT-4 содержит ~1,76 трлн параметров, до квадриллиона ещё в 700–1000 раз. Для обучения такой модели нужно 20 квадриллионов токенов — столько текстовых данных в мире просто не существует. Плюс только хранение весов займёт ~125 ТБ.

Procesado por IA desde Habr AI; editado por Hamidun News
LLM с квадриллионом параметров: когда ждать — и почему ответ «никогда»
Fuente: Habr AI. Collage: Hamidun News.
◐ Escuchar artículo

Los modelos con un cuatrillón de parámetros (10^15) no aparecerán en el futuro previsible: las limitaciones físicas y computacionales hacen que esta escala sea prácticamente inalcanzable en el paradigma actual.

¿A qué distancia estamos de un cuatrillón hoy?

Estamos mil veces más lejos de ese codiciado número de lo que parece. Los mejores modelos de lenguaje de 2025–2026 operan en el rango de cientos de miles de millones a unos pocos billones de parámetros. Según los analistas de SemiAnalysis, GPT-4 está construido sobre una arquitectura Mixture of Experts con un número total de pesos de aproximadamente 1,76 billones; Gemini Ultra de Google tiene alrededor de 1,56 billones. Para alcanzar un cuatrillón (10^15), la escala necesitaría crecer unas 700–1.000 veces más.

  • El rango de los modelos frontier hoy: ~100 mil millones — ~2 billones de parámetros
  • Un cuatrillón (10^15) supera el volumen de GPT-4 en 700–1.000 veces
  • El entrenamiento de GPT-4, según estimaciones de analistas, costó más de 100 millones de dólares
  • El entrenamiento de Llama 2 70B, según la documentación técnica de Meta, requirió ~539 MWh
  • Solo almacenar los pesos de un modelo 1Q en formato int4 ocuparía aproximadamente 125 TB

¿Por qué un crecimiento de 1.000 veces no es simplemente cuestión de "esperar"?

Un modelo con un cuatrillón de parámetros no requiere simplemente más dinero: exige una física fundamentalmente diferente.

Las GPU insignia de NVIDIA H100/H200 almacenan 80–192 GB de memoria por tarjeta. Incluso con una cuantización agresiva de 1 bit, un modelo 1Q necesitaría ~125 TB solo para los pesos, sin activaciones, gradientes ni optimizador. En el formato estándar BF16, eso ya equivale a ~2 petabytes. Semejante volumen requiere construir una infraestructura fundamentalmente diferente que ninguna empresa en el mundo posee actualmente.

"Vemos rendimientos decrecientes del escalado puro del número de

parámetros: los datos y la eficiencia computacional importan más que el tamaño bruto", según las publicaciones de investigación del equipo de DeepMind sobre la optimización de Chinchilla.

El consumo de energía se suma al desafío físico. Se estima que el entrenamiento de un modelo 1Q con la eficiencia actual de los chips requeriría decenas o cientos de TWh, comparable al consumo anual de electricidad de un país europeo medio.

¿Por qué no hay suficientes datos para un cuatrillón?

Según la investigación de DeepMind (Hoffmann et al., 2022), para un entrenamiento óptimo en términos computacionales, un modelo necesita entrenarse con aproximadamente 20 tokens por parámetro. Por lo tanto, un modelo 1Q necesitaría entrenarse con 20 cuatrillones de tokens. Según diversas estimaciones de investigación, todo el texto digitalizado de internet equivale a aproximadamente 10^13–10^14 tokens, entre 200 y 2.000 veces menos de lo necesario.

Los datos sintéticos alivian parcialmente la limitación, pero no a escala de mil veces y no sin degradación de calidad en la generación en bucle. En otras palabras, incluso si existiera la infraestructura computacional, no habría con qué alimentar tal modelo.

Qué significa esto

Los LLM con un cuatrillón de parámetros no son una cuestión de tiempo y financiación, sino de limitaciones fundamentales: la física de los semiconductores, el volumen de datos existentes y los rendimientos decrecientes del escalado. El progreso del sector no avanza hacia "un modelo enorme único", sino hacia arquitecturas más eficientes: Mixture of Experts, Retrieval-Augmented Generation y sistemas agénticos especializados.

Preguntas frecuentes

¿Cuál es el tamaño del mayor LLM abierto hoy?

A partir de 2026, el mayor modelo totalmente abierto sigue siendo Grok-1 de xAI: 314 mil millones de parámetros en arquitectura Mixture of Experts, publicado en acceso abierto en marzo de 2024. Los modelos frontier cerrados de los principales laboratorios, según las estimaciones de los analistas de SemiAnalysis, superan el billón de parámetros.

¿Ayudarán las computadoras cuánticas en el entrenamiento de estos modelos?

Las computadoras cuánticas son eficaces para una clase restringida de tareas —factorización y simulación molecular—, pero no para la multiplicación de matrices, sobre la que se basa el entrenamiento de transformers. En el futuro previsible, los sistemas cuánticos no reemplazarán a las GPU y TPU en las tareas de entrenamiento de LLM.

*Meta está reconocida como organización extremista y está prohibida en Rusia.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?

Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).

¿Qué te parece?
Cargando comentarios…