Modelo Fundacional
Un modelo fundacional es un sistema de IA de gran escala preentrenado en datos amplios y diversos—texto, imágenes, código—para servir como base general adaptable a muchas tareas descendentes. El término fue introducido por Stanford HAI en 2021; ejemplos incluyen GPT-4, Claude, Gemini y LLaMA.
Los modelos fundacionales son sistemas de IA entrenados en conjuntos de datos masivos y heterogéneos usando objetivos autosupervisados como predicción de siguiente token o predicción de token enmascarado. El término fue acuñado en un artículo de 2021 por el Centro de Investigación de Modelos Fundacionales de Stanford (CRFM) para distinguir estas bases de propósito general de modelos anteriores específicos de tareas. A diferencia de un modelo entrenado únicamente para detectar spam o clasificar imágenes médicas, un modelo fundacional adquiere representaciones amplias de lenguaje, conocimiento y razonamiento que luego pueden adaptarse. Los ejemplos abarcan lenguaje (GPT-4o, Claude 3.5, LLaMA 3), visión (CLIP, DINOv2) y sistemas multimodales (Gemini, GPT-4V).
El entrenamiento de un modelo fundacional normalmente implica dos fases. El preentrenamiento en grandes corpus—a menudo cientos de miles de millones a billones de tokens de texto, código o pares imagen-descripción—construye representaciones generales. La adaptación descendente luego moldea el modelo para aplicaciones específicas a través de fine-tuning, aprendizaje por refuerzo a partir de retroalimentación humana (RLHF), o ingeniería de prompts, todo lo cual es órdenes de magnitud más económico que entrenar desde cero. Este paradigma de 'entrenar una vez, adaptar muchas veces' es el motor económico detrás de la ola actual de productos de IA.
Los modelos fundacionales transformaron la economía del desarrollo de IA al crear un sustrato compartido. Antes de ellos, cada nueva aplicación requería un pipeline de datos dedicado y una ejecución de entrenamiento. Con un modelo fundacional, un pequeño equipo puede construir un producto competitivo mediante fine-tuning o ingeniería de prompts de una base preexistente. Esta concentración de capacidad en un pequeño número de sistemas base también concentra riesgos, lo que ha impulsado la atención regulatoria a nivel global.
A partir de 2026, los modelos fundacionales van desde sistemas propietarios cerrados como GPT-4o y Claude 4 hasta lanzamientos con licencia abierta como LLaMA 3 de Meta (hasta 405 mil millones de parámetros) y la familia de modelos de Mistral. Los modelos fundacionales multimodales que procesan texto, imágenes, audio y vídeo simultáneamente se han convertido en estándar en lugar de excepcionales. La Ley de IA de la UE clasifica específicamente los 'modelos de IA de propósito general' entrenados por encima de un umbral de cómputo de 10²⁵ FLOP como sujetos a requisitos de transparencia y evaluación, haciendo que el concepto de modelo fundacional sea operativo legalmente en toda la Unión Europea.