Sirviendo LLM: vLLM, TGI, KV-cache, procesamiento por lotes
El entrenamiento enseña a un modelo a predecir el siguiente token. Servir es todo lo que sucede cuando los usuarios realmente lo llaman: programar miles de solicitudes simultáneas, aumentar los tensores de caché KV a medida que las secuencias se alargan, agrupar formas incompatibles sin desperdiciar RAM de GPU y saturar núcleos tensoriales bajo SLO de latencia real. Marcos como vLLM (PaggedAttention) y Inferencia de generación de texto (TGI) existen porque los bucles ingenuos de PyTorch no pueden manejar la carga de producción.