Quantification et inférence plus rapide : GPTQ, AWQ, décodage spéculatif
La gestion d'un modèle 70B dans FP16 nécessite environ 140 Go de mémoire GPU uniquement pour les pondérations, avant le cache KV, les activations ou le traitement par lots. La Quantisation mappe les poids de haute précision sur moins de bits (INT8, INT4, encore plus bas), de sorte que le même modèle s'adapte à du matériel moins cher et fonctionne plus rapidement sur des cœurs tenseurs conçus pour les mathématiques entières. Cette leçon présente les méthodes de quantification post-formation (PTQ) utilisées en production (GPTQ et AWQ) et le décodage spéculatif, une astuce complémentaire qui accélère la génération sans modifier les poids.