Сервинг моделей: от ноутбука к 10 000 запросов в секунду

Обучить модель — одно. Сделать так чтобы она отвечала за 50ms под нагрузкой 1000 RPS (запросов в секунду) — совсем другое. Сервинг в ML — это инженерная задача: загрузка модели один раз при старте, эффективная предобработка, управление батчами для GPU (графического процессора), горизонтальное масштабирование. Неправильный сервинг: графический процессор (GPU) простаивает 95% времени или ответы по 2 секунды.

Full content is available with a subscription.
Get full access to all courses on the platform for one year with a single payment.
Unlike other platforms that charge per course, here you get everything for one price, and after one year of use there will be no automatic charge for the following year.