Negócios

Economia de Tokens (Preços de API)

Economia de tokens é o modelo de preços que governa o acesso comercial a modelos de linguagem de IA via API, onde os usuários são cobrados por token — aproximadamente 3 a 4 caracteres de texto — com taxas separadas para entrada (prompt) e saída (texto gerado).

Economia de tokens descreve a estrutura de custo que governa o acesso comercial a grandes modelos de linguagem através de APIs. Um token é a unidade atômica de texto que um modelo processa: aproximadamente 0,75 palavras, ou 3 a 4 caracteres, em inglês. Os provedores cobram separadamente por tokens de entrada (o prompt e qualquer contexto enviado para o modelo) e tokens de saída (a resposta gerada), com saída normalmente precificada 2 a 4 vezes mais alta porque a geração autorregressiva é mais intensiva em computação do que uma única passagem para frente sobre a entrada.

O preço é cotado por milhão de tokens. O GPT-4 da OpenAI foi lançado em março de 2023 a aproximadamente $30 por milhão de tokens de entrada; em meados de 2025, modelos comparáveis ou mais capazes da OpenAI, Anthropic e Google estavam disponíveis por $1 a $15 por milhão de tokens. Essa compressão foi impulsionada pela pressão competitiva e ganhos de eficiência de hardware. As dimensões de preço adicionais incluem caching de prompt — cobrança de uma fração das taxas normais para contexto já armazenado no servidor — inferência em lote (trabalhos assíncronos com aproximadamente 50% de desconto) e contratos de volume escalonado. O comprimento da janela de contexto também afeta o custo, já que entradas mais longas consomem mais tokens mesmo quando o conteúdo semântico não é alterado.

A economia de tokens molda diretamente a economia de unidade de produtos nativos de IA. Um chatbot de suporte ao cliente processando milhares de conversas diariamente pode gastar quantias vastamente diferentes dependendo do design do prompt, seleção de modelo e estratégia de caching. Os praticantes usam técnicas como compressão de prompt, windowing de contexto e roteamento de modelo — direcionando consultas simples para modelos mais baratos e complexas para modelos premium — para controlar custos sem degradar a qualidade.

A partir de 2026, o mercado se segmentou ainda mais. Os modelos de fronteira (GPT-5, Claude 4, Gemini 2 Ultra) comandam taxas premium para capacidade máxima, enquanto modelos de peso aberto auto-hospedados em nuvens de GPU oferecem custo marginal quase zero por token. Planos de assinatura com taxa fixa para usuários individuais coexistem com contratos empresariais pagos por token. Os provedores publicam cada vez mais preços separados para casos de uso de contexto longo e para inferência em modo de raciocínio, onde o modelo gera cadeias internas estendidas de pensamento antes de produzir uma resposta, consumindo tokens adicionais no processo.

Exemplo

Um desenvolvedor construindo uma ferramenta de revisão de contrato roteia consultas de classificação curtas para um modelo de $0,10 por milhão de tokens e tarefas de análise de cláusulas detalhadas para um modelo de $3 por milhão de tokens, reduzindo o custo médio por consulta em aproximadamente 80% comparado com o uso do modelo premium para tudo.

Termos relacionados

← Glossário