Сервинг моделей: от ноутбука к 10 000 запросов в секунду
Обучить модель — одно. Сделать так чтобы она отвечала за 50ms под нагрузкой 1000 RPS (запросов в секунду) — совсем другое. Сервинг в ML — это инженерная задача: загрузка модели один раз при старте, эффективная предобработка, управление батчами для GPU (графического процессора), горизонтальное масштабирование. Неправильный сервинг: графический процессор (GPU) простаивает 95% времени или ответы по 2 секунды.