Economía de Tokens (Precios de API)
La economía de tokens es el modelo de precios que rige el acceso comercial a modelos de lenguaje de IA a través de API, donde a los usuarios se les cobra por token — aproximadamente 3–4 caracteres de texto — con tasas separadas para entrada (prompt) y salida (texto generado).
La economía de tokens describe la estructura de costos que rige el acceso comercial a modelos de lenguaje grandes a través de APIs. Un token es la unidad atómica de texto que procesa un modelo: aproximadamente 0,75 palabras, o 3–4 caracteres, en inglés. Los proveedores cobran por separado para tokens de entrada (el prompt y cualquier contexto enviado al modelo) y tokens de salida (la respuesta generada), con la salida típicamente valorada 2–4× más alta porque la generación autorregresiva es más intensiva en poder de computación que un único pase hacia adelante sobre la entrada.
Los precios se cotizan por millón de tokens. El GPT-4 de OpenAI se lanzó en marzo de 2023 a aproximadamente $30 por millón de tokens de entrada; a mediados de 2025, modelos comparables o más capaces de OpenAI, Anthropic y Google estaban disponibles por $1–$15 por millón de tokens. Esta compresión fue impulsada por presión competitiva y ganancias en eficiencia del hardware. Las dimensiones de precios adicionales incluyen almacenamiento en caché de prompts — cobrar una fracción de las tasas normales para el contexto ya almacenado del lado del servidor — inferencia por lotes (trabajos asincrónico con aproximadamente 50% de descuento) y contratos de volumen escalonados. La longitud de la ventana de contexto también afecta el costo, ya que las entradas más largas consumen más tokens incluso cuando el contenido semántico no cambia.
La economía de tokens moldea directamente la economía unitaria de productos nativos de IA. Un chatbot de atención al cliente que procesa miles de conversaciones diarias puede gastar cantidades vastamente diferentes dependiendo del diseño del prompt, la selección del modelo y la estrategia de almacenamiento en caché. Los profesionales utilizan técnicas como compresión de prompts, ventaneo de contexto y enrutamiento de modelos — dirigiendo consultas simples a modelos más baratos y las complejas a modelos premium — para controlar el costo sin degradar la calidad.
A partir de 2026, el mercado se ha segmentado aún más. Los modelos frontera (GPT-5, Claude 4, Gemini 2 Ultra) cobran tasas premium para máxima capacidad, mientras que modelos de pesos abiertos auto-alojados en nubes GPU ofrecen costo marginal prácticamente cero por token. Los planes de suscripción de tasa fija para usuarios individuales coexisten con contratos empresariales de pago por token. Los proveedores cada vez más publican precios separados para casos de uso de contexto largo e inferencia en modo razonamiento, donde el modelo genera cadenas extendidas de pensamiento interno antes de producir una respuesta, consumiendo tokens adicionales en el proceso.