Inférence

Température

La température est un hyperparamètre scalaire qui divise les logits d'un modèle de langage avant l'étape softmax, contrôlant le caractère aléatoire de la sortie : les valeurs inférieures à 1.0 affûtent la distribution vers les jetons de haute probabilité ; les valeurs supérieures à 1.0 l'aplatissent, augmentant la diversité.

La température est un paramètre de contrôle utilisé lors de l'échantillonnage de jetons dans les modèles de langage. Elle est appliquée en divisant tous les scores de logits par la valeur de température T avant que la fonction softmax les convertisse en une distribution de probabilité sur le vocabulaire. Quand T = 1.0, le modèle échantillonne selon sa distribution apprise sans modification. Quand T < 1.0, la distribution devient plus nette, concentrant la masse de probabilité sur les jetons les plus probables. Quand T > 1.0, la distribution s'aplatit, donnant aux jetons de faible probabilité une plus grande chance d'être sélectionnés.

L'effet mathématique est direct : donné un vecteur de logits z, la softmax mise à l'échelle de température est calculée comme softmax(z / T). Quand T s'approche de 0, la distribution s'effondre en un vecteur one-hot à l'argmax — équivalent au décodage glouton, sélectionnant toujours le jeton le plus probable. Quand T augmente vers l'infini, la distribution converge vers l'uniforme sur tout le vocabulaire. En pratique, les températures entre 0.0 et 2.0 couvrent presque tous les comportements utiles ; les valeurs supérieures à 1.5 tendent à produire une sortie lexicalement incohérente pour la plupart des familles de modèles actuels.

La température est importante car le même modèle sous-jacent peut servir des cas d'utilisation qualitativement différents grâce à ce seul paramètre. La génération de code et la réponse à des questions factuelles bénéficient de températures basses (0.0–0.3) pour maximiser la précision et la reproductibilité. L'écriture créative, le brainstorming et le dialogue ouvert bénéficient de températures plus élevées (0.7–1.2) pour produire des sorties variées et surprenantes. Définir la température trop haut introduit de l'incohérence ; la définir trop bas produit un texte répétitif et trop conservateur qui ne reflète pas la pleine gamme de connaissances du modèle.

Chaque grande API de modèle de langage — OpenAI, Anthropic, Google, Mistral, Meta — expose la température comme un paramètre de première classe. Des recherches publiées en 2024–2025 ont examiné l'interaction entre la température et le raisonnement chain-of-thought, trouvant que les tâches logiques multi-étapes bénéficient d'une température très basse pour maintenir la cohérence, tandis que les méthodes basées sur des ensembles telles que la self-consistency échantillonnent délibérément plusieurs complétions à température élevée et les agrègent. Certains frameworks d'inférence implémentent également l'ajustement de la température au sein d'une seule génération, réduisant progressivement la température à mesure que la sortie progresse vers une conclusion.

Exemple

Un chatbot de support client est déployé avec température=0.1 pour produire des réponses précises et prévisibles aux questions de politique, tandis que le même modèle de base alimentant un outil d'écriture créative fonctionne à température=1.1 pour générer des continuations d'histoires variées et inventives.

Termes liés

Dernières actualités sur le sujet

← Glossaire