Échantillonnage Top-p (Nucleus)
L'échantillonnage Top-p (nucleus) est une stratégie de décodage qui restreint la sélection de jetons au plus petit ensemble de jetons dont la probabilité cumulative atteint un seuil p, adaptant dynamiquement la taille du pool de candidats à la confiance du modèle à chaque étape de génération.
L'échantillonnage Top-p, aussi appelé échantillonnage nucleus, est une stratégie de décodage introduite par Holtzman et al. dans « The Curious Case of Neural Text Degeneration » (ICLR 2020). À chaque étape de génération, les jetons sont triés par probabilité décroissante et le nucleus est défini comme le plus petit préfixe de cette liste triée dont la probabilité cumulative est d'au moins p. Le jeton suivant est tiré en échantillonnant à partir du nucleus après renormalisation de ses probabilités pour qu'elles totalisent 1.
L'avantage clé par rapport à l'échantillonnage top-k fixe est l'adaptabilité. Quand le modèle est très confiant — par exemple, après l'invite « The chemical symbol for gold is » — le nucleus peut contenir seulement un ou deux jetons, gardant la génération déterministe et précise. Quand le modèle fait face à une véritable ambiguïté — comme le mot suivant dans une histoire ouverte — le nucleus s'étend à des douzaines ou des centaines de candidats, permettant une diversité créative. Une valeur top-k fixe ne peut pas atteindre cet équilibre : un petit k est trop restrictif dans des contextes incertains, tandis qu'un grand k admet trop de jetons improbables quand le modèle est confiant. L'hyperparamètre p est généralement défini entre 0.9 et 0.95 pour une utilisation générale.
L'échantillonnage Top-p est important car il réduit empiriquement la répétition dégénérée et l'incohérence qui affectent le décodage glouton et basé sur la température pure, tout en empêchant l'échantillonnage de la queue extrême de la distribution où les jetons incohérents ou hallucinés se regroupent. Il est généralement combiné avec la température : la température remodèle d'abord la distribution de logits, puis l'échantillonnage Top-p sélectionne à partir du nucleus résultant. Ensemble, ils fournissent deux leviers complémentaires — la diversité globale et la troncature de queue — qui peuvent être réglés indépendamment.
Le Top-p est un paramètre standard dans pratiquement toutes les API de modèles de langage en production et les frameworks d'inférence en 2026, y compris OpenAI, l'API Claude d'Anthropic, Google Gemini, vLLM, et Hugging Face Transformers. La recherche a exploré des alternatives telles que l'échantillonnage min-p (suppression des jetons dont la probabilité tombe en dessous d'une fraction de la probabilité du jeton supérieur) et l'échantillonnage top-a, chacun offrant des comportements de troncature de queue légèrement différents. Malgré ces variantes, le Top-p reste l'approche dominante en raison de sa simplicité et de son comportement empirique bien compris entre les familles de modèles.