Cuantización e inferencia más rápida: GPTQ, AWQ, decodificación especulativa
Para servir un modelo de 70B en FP16 se necesitan aproximadamente 140 GB de memoria GPU solo para pesos, antes del caché KV, activaciones o procesamiento por lotes. Cuantización asigna pesos de alta precisión a menos bits (INT8, INT4, incluso inferiores), de modo que el mismo modelo se adapta a hardware más barato y se ejecuta más rápido en núcleos tensoriales creados para matemáticas de enteros. Esta lección recorre los métodos de cuantificación post-entrenamiento (PTQ) utilizados en producción (GPTQ y AWQ) y la decodificación especulativa, un truco complementario que acelera la generación sin cambiar los pesos.