Modelos

Pequeno Modelo de Linguagem (SLM)

Um pequeno modelo de linguagem (SLM) é um modelo de linguagem com uma contagem de parâmetros compacta—tipicamente 1 a 13 bilhões de parâmetros—otimizado para inferência eficiente em dispositivos de consumidor, hardware de borda ou servidores de GPU única, em vez de deployments em grandes data centers.

Pequenos modelos de linguagem (SLMs) são modelos de linguagem projetados para fornecer compreensão e geração de texto úteis dentro de orçamentos de computação e memória apertados. Embora nenhum limite de parâmetro rigoroso defina a categoria, modelos na faixa de aproximadamente 1 a 13 bilhões de parâmetros são comumente descritos como pequenos em relação aos sistemas frontier que excedem 100 bilhões de parâmetros. Exemplos proeminentes incluem as famílias Phi-3 e Phi-4 da Microsoft (3,8B a 14B de parâmetros), Gemma 2 do Google (variantes de 2B e 9B), os modelos on-device do Apple que potencializam o Apple Intelligence (estimados em 3B de parâmetros) e os níveis 1B e 3B do LLaMA 3.2 do Meta.

SLMs atingem desempenho competitivo relativo ao seu tamanho através de várias técnicas. Dados de treinamento curados de alta qualidade—texto sintético estilo livro, código e exemplos de raciocínio estruturado—podem superar dados extraídos da web ruidosamente para modelos do mesmo tamanho, uma descoberta divulgada pela pesquisa Phi da Microsoft a partir de 2023. A destilação de conhecimento transfere representações de um modelo professor maior para um aluno menor, comprimindo capacidade. A quantização pós-treinamento reduz a precisão numérica de floats de 16 bits para inteiros de 4 bits ou 8 bits, cortando a pegada de memória por 2–4x com perda mínima de acurácia. Arquiteturas eficientes como atenção de consulta agrupada e atenção de janela deslizante reduzem ainda mais o custo de inferência.

A significância prática dos SLMs é flexibilidade de deployment e privacidade de dados. Executar inferência localmente elimina latência de ida e volta de API, evita transmitir dados sensíveis do usuário para servidores externos, remove dependência de conectividade com a internet e elimina custos de API por token em escala. Essas propriedades importam para aplicações corporativas com restrições de governança de dados, aplicações de consumidor em móveis e computadores pessoais, cenários sensíveis a latência como assistência de digitação em tempo real e casos de uso em regiões com infraestrutura de conectividade limitada.

Em 2026, cada desenvolvedor de IA maior envia SLMs como produtos de primeira classe. Apple Intelligence executa tarefas de linguagem em iPhones e Macs usando modelos on-device sem enviar prompts para a nuvem. Os modelos Phi-4 da Microsoft estão integrados em ferramentas de desenvolvedor e Windows Copilot. A lacuna de qualidade entre SLMs e modelos grandes se fechou substancialmente para tarefas estruturadas—sumarização, extração de informação, conclusão de código, classificação—enquanto raciocínio multi-etapa complexo e conhecimento de mundo amplo ainda favorecem sistemas maiores. SLMs on-device também permitem personalização através de fine-tuning local em dados de usuário sem qualquer dado deixar o dispositivo.

Exemplo

Uma empresa de software de saúde deploya um SLM de 7 bilhões de parâmetros em servidores hospitalares para extrair dados estruturados de notas clínicas, mantendo todos os registros de pacientes no local e atendendo requisitos HIPAA sem chamadas de API em nuvem.

Termos relacionados

Últimas notícias sobre o tema

← Glossário