Обслуживание LLM: vLLM, TGI, KV-кэш, пакетная обработка
Обучение учит модель прогнозировать следующий токен. Обслуживание — это все, что происходит, когда пользователи на самом деле его вызывают: планирование тысяч одновременных запросов, увеличение тензоров KV-кэша по мере удлинения последовательностей, пакетная обработка несовместимых фигур без потери оперативной памяти графического процессора и насыщение тензорных ядер при SLO с реальной задержкой. Такие платформы, как vLLM (PagedAttention) и Text Generation Inference (TGI), существуют потому, что простые циклы PyTorch не могут справиться с рабочей нагрузкой.