Cuantización e inferencia más rápida: GPTQ, AWQ, decodificación especulativa

Para servir un modelo de 70B en FP16 se necesitan aproximadamente 140 GB de memoria GPU solo para pesos, antes del caché KV, activaciones o procesamiento por lotes. Cuantización asigna pesos de alta precisión a menos bits (INT8, INT4, incluso inferiores), de modo que el mismo modelo se adapta a hardware más barato y se ejecuta más rápido en núcleos tensoriales creados para matemáticas de enteros. Esta lección recorre los métodos de cuantificación post-entrenamiento (PTQ) utilizados en producción (GPTQ y AWQ) y la decodificación especulativa, un truco complementario que acelera la generación sin cambiar los pesos.

Full content is available with a subscription.
Get full access to all courses on the platform for one year with a single payment.
Unlike other platforms that charge per course, here you get everything for one price, and after one year of use there will be no automatic charge for the following year.