Servir des LLM : vLLM, TGI, KV-cache, batching
La formation enseigne un modèle pour prédire le prochain jeton. Le service est tout ce qui se passe lorsque les utilisateurs l'appellent : planifier des milliers de requêtes simultanées, augmenter les tenseurs de cache KV à mesure que les séquences s'allongent, regrouper des formes incompatibles sans gaspiller de RAM GPU et saturer les cœurs de tenseurs sous des SLO de latence réelle. Des frameworks tels que vLLM (PagedAttention) et Text Generation Inference (TGI) existent car les boucles PyTorch naïves ne peuvent pas gérer la charge de production.