Servir des LLM : vLLM, TGI, KV-cache, batching

La formation enseigne un modèle pour prédire le prochain jeton. Le service est tout ce qui se passe lorsque les utilisateurs l'appellent : planifier des milliers de requêtes simultanées, augmenter les tenseurs de cache KV à mesure que les séquences s'allongent, regrouper des formes incompatibles sans gaspiller de RAM GPU et saturer les cœurs de tenseurs sous des SLO de latence réelle. Des frameworks tels que vLLM (PagedAttention) et Text Generation Inference (TGI) existent car les boucles PyTorch naïves ne peuvent pas gérer la charge de production.

Full content is available with a subscription.
Get full access to all courses on the platform for one year with a single payment.
Unlike other platforms that charge per course, here you get everything for one price, and after one year of use there will be no automatic charge for the following year.