Servicio de modelos: desde una computadora portátil hasta 10 000 solicitudes por segundo
Entrenar un modelo es una cosa. Hacer que responda en 50 ms a 1k RPS es otra. Servir es ingeniería: cargar el modelo una vez al inicio, preprocesamiento eficiente, procesamiento por lotes de GPU, escalado horizontal. Un mal servicio significa que una GPU permanece inactiva el 95% del tiempo, o latencias de dos segundos.