Lois d'échelle : paramètres, données et calcul

Pourquoi GPT-4 en sait-il plus que GPT-2 ? Pourquoi Llama 3 8B surpasse-t-il les modèles d'il y a deux ans avec 10 fois plus de paramètres ? La réponse réside dans les lois d'échelle : des formules empiriques qui prédisent comment la qualité d'un modèle dépend de trois nombres : le nombre de paramètres dont il dispose, la quantité de données sur lesquelles il s'est entraîné et la quantité de calcul dépensée.

Full content is available with a subscription.
Get full access to all courses on the platform for one year with a single payment.
Unlike other platforms that charge per course, here you get everything for one price, and after one year of use there will be no automatic charge for the following year.