LoRA и QLoRA: математика, выбор ранга и практика
LoRA — это метод, который демократизировал тонкую настройку LLM. До этого для тонкой настройки модели 7B требовалось ~112 ГБ памяти графического процессора — 14 A100. С QLoRA та же задача выполняется на одном потребительском графическом процессоре емкостью 24 ГБ. В этом уроке объясняется математический трюк, который делает это возможным, как выбрать ключевой гиперпараметр (ранг) и как использовать его на практике.