Service de modèles : du notebook à 10 000 requêtes par seconde
Former un modèle est une chose. Le faire répondre dans un délai de 50 ms sous 1 000 RPS en est une autre. Le service, c'est l'ingénierie : chargez le modèle une fois au démarrage, prétraitement efficace, traitement par lots GPU, mise à l'échelle horizontale. Un mauvais service signifie qu'un GPU reste inactif 95 % du temps, soit une latence de deux secondes.