Modelos

Foundation Model

Um foundation model é um sistema de IA de grande escala pré-treinado em dados amplos e diversos—texto, imagens, código—para servir como uma base de propósito geral adaptável a muitas tarefas subsequentes. O termo foi introduzido pelo Stanford HAI em 2021; exemplos incluem GPT-4, Claude, Gemini e LLaMA.

Foundation models são sistemas de IA treinados em conjuntos de dados massivos e heterogêneos usando objetivos de aprendizado auto-supervisionado, como previsão do próximo token ou previsão de token mascarado. O termo foi cunhado em um artigo de 2021 do Stanford Center for Research on Foundation Models (CRFM) para distinguir essas bases de propósito geral de modelos anteriores específicos de tarefas. Diferentemente de um modelo treinado unicamente para detectar spam ou classificar imagens médicas, um foundation model adquire representações amplas de linguagem, conhecimento e raciocínio que podem então ser adaptadas. Os exemplos abrangem linguagem (GPT-4o, Claude 3.5, LLaMA 3), visão (CLIP, DINOv2) e sistemas multimodais (Gemini, GPT-4V).

O treinamento de um foundation model tipicamente envolve duas fases. Pré-treinamento em corpora grandes—frequentemente centenas de bilhões a trilhões de tokens de texto, código ou pares imagem-legenda—constrói representações gerais. A adaptação subsequente então molda o modelo para aplicações específicas através de fine-tuning, aprendizado por reforço a partir de feedback humano (RLHF) ou prompt engineering, todos os quais são ordens de magnitude mais baratos do que treinar do zero. Este paradigma 'treinar uma vez, adaptar muitas vezes' é o motor econômico por trás da onda atual de produtos de IA.

Foundation models mudaram a economia do desenvolvimento de IA ao criar um substrato compartilhado. Antes deles, cada nova aplicação exigia um pipeline de dados dedicado e uma execução de treinamento. Com um foundation model, um pequeno time pode construir um produto competitivo através de fine-tuning ou prompting de uma base pré-existente. Esta concentração de capacidade em um pequeno número de sistemas base também concentra riscos, o que tem impulsionado a atenção regulatória globalmente.

A partir de 2026, foundation models variam desde sistemas proprietários fechados como GPT-4o e Claude 4 até lançamentos com licença aberta como LLaMA 3 do Meta (até 405 bilhões de parâmetros) e a família de modelos da Mistral. Modelos foundation multimodais que processam texto, imagens, áudio e vídeo simultaneamente tornaram-se padrão em vez de exceção. O AI Act da UE classifica especificamente 'modelos de IA de propósito geral' treinados acima de um limite de computação de 10²⁵ FLOPs como sujeitos a requisitos de transparência e avaliação, tornando o conceito de foundation model legalmente operativo em toda a União Europeia.

Exemplo

Uma empresa constrói um chatbot de atendimento ao cliente através de fine-tuning de um foundation model como LLaMA 3 no seu próprio histórico de tickets de suporte, adquirindo conhecimento de domínio sem treinar um modelo do zero.

Termos relacionados

Últimas notícias sobre o tema

← Glossário