Temperature
Temperature é um hiperparâmetro escalar que divide os logits de um modelo de linguagem antes do passo softmax, controlando a aleatoriedade da saída: valores abaixo de 1,0 aguçam a distribuição em direção a tokens de alta probabilidade; valores acima de 1,0 a achatam, aumentando a diversidade.
Temperature é um parâmetro de controle usado durante a amostragem de tokens em modelos de linguagem. É aplicado dividindo todos os scores de logit pela temperatura T antes da função softmax converter esses valores em uma distribuição de probabilidade sobre o vocabulário. Quando T = 1,0, o modelo amostra de acordo com sua distribuição aprendida sem modificação. Quando T < 1,0, a distribuição se torna mais aguçada, concentrando a massa de probabilidade nos tokens mais prováveis. Quando T > 1,0, a distribuição se achata, dando aos tokens de menor probabilidade uma chance maior de serem selecionados.
O efeito matemático é direto: dado um vetor de logit z, a softmax em escala de temperatura é computada como softmax(z / T). Conforme T se aproxima de 0, a distribuição colapsa para um vetor one-hot no argmax — equivalente a decodificação gulosa, sempre selecionando o único token mais provável. Conforme T aumenta em direção ao infinito, a distribuição converge para uniforme em todo o vocabulário. Na prática, temperaturas entre 0,0 e 2,0 cobrem quase todo o comportamento útil; valores acima de 1,5 tendem a produzir saída lexicamente incoerente para a maioria das famílias de modelo atual.
Temperature importa porque o mesmo modelo base pode servir casos de uso qualitativamente diferentes através desse parâmetro único. Geração de código e resposta a perguntas factuais se beneficiam de temperaturas baixas (0,0–0,3) para maximizar acurácia e reprodutibilidade. Escrita criativa, brainstorming, e diálogo aberto se beneficiam de temperaturas mais altas (0,7–1,2) para produzir saídas variadas e surpreendentes. Definir temperature muito alta introduz incoerência; defini-la muito baixa produz texto repetitivo e excessivamente conservador que falha em refletir toda a gama de conhecimento do modelo.
Todas as APIs de modelo de linguagem principais — OpenAI, Anthropic, Google, Mistral, Meta — expõem temperature como um parâmetro de primeira classe. Pesquisa publicada em 2024–2025 examinou a interação entre temperature e raciocínio chain-of-thought, encontrando que tarefas lógicas multi-passo se beneficiam de temperature muito baixa para manter consistência, enquanto métodos baseados em conjunto como auto-consistência deliberadamente amostram múltiplas completações de alta temperature e as agregam. Alguns frameworks de inferência também implementam annealing de temperature dentro de uma única geração, reduzindo gradualmente a temperature conforme a saída progride em direção a uma conclusão.