Servicio de Modelos
Servicio de Modelos es la capa de infraestructura que despliega un modelo de ML entrenado para manejar solicitudes de predicción en tiempo real o por lotes, administrando escalado, equilibrio de carga, versionamiento y confiabilidad en producción. Cierra la brecha entre un artefacto de modelo entrenado sin conexión y un endpoint de API activo y consultable.
El Servicio de Modelos abarca el hardware, software y procesos operacionales necesarios para exponer la capacidad de inferencia de un modelo entrenado como un servicio confiable y escalable. Los componentes principales son el runtime de servicio (el proceso que carga pesos y ejecuta pasadas hacia adelante), la capa de API (endpoints HTTP/REST o gRPC), una cola de solicitudes y programador, lógica de escalado automático y un registro de modelos para versionamiento y reversión. Para LLMs, el runtime de servicio también administra el caché KV—las claves de atención almacenadas y valores para secuencias en progreso—que puede consumir la mayoría de la memoria GPU.
Un artefacto de modelo se carga en aceleradores mediante un runtime de servicio como NVIDIA Triton Inference Server, TensorRT-LLM, vLLM o una pila proprietaria de un proveedor. El runtime maneja batching, asignación de memoria y ejecución de kernel. Un gateway de API al frente dirige el tráfico, aplica límites de velocidad y autentica solicitudes. Kubernetes u orquestación equivalente administra escalado horizontal—girar réplicas adicionales bajo carga y desmontarlas cuando el tráfico disminuye—y maneja actualizaciones progresivas cuando se despliega una nueva versión del modelo sin tiempo de inactividad. Observabilidad (percentiles de latencia, tasas de error, utilización de GPU, profundidad de cola) alimenta decisiones de escalado automático y alertas.
El servicio a menudo es el centro de costo dominante para un producto de IA en producción en relación con los costos de entrenamiento amortizados durante la vida útil del producto. Las decisiones sobre selección de hardware, profundidad de cuantización, estrategia de batching, factor de replicación y si usar instancias spot o bajo demanda determinan directamente los costos operacionales y los SLAs de latencia. Un modelo que no puede servirse confiable y económicamente a escala no tiene valor de producto práctico independientemente de su desempeño en benchmarks.
A partir de 2026, el panorama incluye plataformas de servicio de ML en la nube de propósito general (AWS SageMaker, Google Vertex AI, Azure ML), runtimes de código abierto especializados en LLM (vLLM, Ollama, LMDeploy) y APIs proprietarias completamente administradas (OpenAI, Anthropic Claude API, Google Gemini API). El servicio Multi-LoRA—hospedar un modelo base único con cientos de capas de adaptadores fine-tuned intercambiadas por solicitud—ha madurado, permitiendo a empresas servir muchas variantes especializadas al costo de hardware de un despliegue base.