Modèles

Petit Modèle de Langage (SLM)

Un petit modèle de langage (SLM) est un modèle de langage avec un nombre de paramètres limité—typiquement 1 à 13 milliards de paramètres—optimisé pour l'inférence efficace sur des appareils grand public, du matériel edge ou des serveurs à GPU unique, plutôt que pour des déploiements en grands centres de données.

Les petits modèles de langage (SLM) sont des modèles de langage conçus pour offrir une compréhension et une génération utiles de texte dans des budgets stricts de calcul et de mémoire. Bien qu'aucune limite de paramètres stricte ne définisse la catégorie, les modèles dans la plage d'environ 1 à 13 milliards de paramètres sont généralement décrits comme petits par rapport aux systèmes de frontière qui dépassent les 100 milliards de paramètres. Les exemples éminents incluent les familles Microsoft Phi-3 et Phi-4 (3,8 à 14 milliards de paramètres), le Gemma 2 de Google (variantes 2B et 9B), les modèles sur appareil d'Apple alimentant Apple Intelligence (estimés à 3 milliards de paramètres), et les tiers 1B et 3B du LLaMA 3.2 de Meta.

Les SLM réalisent des performances compétitives par rapport à leur taille grâce à plusieurs techniques. Les données d'entraînement curées de haute qualité—texte synthétique de style manuel, code et exemples de raisonnement structuré—peuvent surpasser les données web bruyamment grattées pour les modèles de même taille, un constat publicisé par la recherche Phi de Microsoft à partir de 2023. La distillation des connaissances transfère les représentations d'un modèle enseignant plus grand à un modèle étudiant plus petit, comprimant la capacité. La quantification après entraînement réduit la précision numérique de 16 bits flottants à 4 bits ou 8 bits entiers, réduisant l'empreinte mémoire de 2–4x avec une perte de précision minimale. Les architectures efficaces comme l'attention à requête groupée et l'attention fenêtre glissante réduisent davantage le coût d'inférence.

La signification pratique des SLM est la flexibilité de déploiement et la confidentialité des données. L'exécution de l'inférence localement élimine la latence des appels d'API, évite de transmettre des données utilisateur sensibles à des serveurs externes, supprime la dépendance à la connectivité Internet, et élimine les coûts d'API par token à l'échelle. Ces propriétés importent pour les applications d'entreprise avec des contraintes de gouvernance des données, les applications de consommateurs sur les ordinateurs mobiles et personnels, les scénarios sensibles à la latence comme l'assistance à la saisie en temps réel, et les cas d'usage dans les régions avec une infrastructure de connectivité limitée.

En 2026, chaque développeur d'IA majeur expédie les SLM en tant que produits de première classe. Apple Intelligence exécute des tâches de langage sur les iPhones et les Macs en utilisant des modèles sur appareil sans envoyer d'invites vers le cloud. Les modèles Phi-4 de Microsoft sont intégrés dans les outils de développeurs et Copilot Windows. L'écart de qualité entre les SLM et les grands modèles a considérablement diminué pour les tâches structurées—résumé, extraction d'informations, complément de code, classification—tandis que le raisonnement multi-étapes complexe et les connaissances générales étendues favorisent toujours les systèmes plus grands. Les SLM sur appareil permettent également la personnalisation par fine-tuning local sur les données utilisateur sans que les données ne quittent l'appareil.

Exemple

Une entreprise de logiciels de santé déploie un SLM de 7 milliards de paramètres sur des serveurs d'hôpital pour extraire des données structurées à partir de notes cliniques, gardant tous les dossiers des patients sur site et respectant les exigences HIPAA sans appels d'API cloud.

Termes liés

Dernières actualités sur le sujet

← Glossaire