Optimizadores: cómo una red neuronal alcanza el mínimo

Todos los optimizadores resuelven el mismo problema: actualizar los pesos para que la pérdida disminuya. La diferencia es cómo usan el degradado. SGD es directo: un paso opuesto al gradiente. El impulso añade inercia: recuerda pasos pasados. Adam es adaptativo: escala el paso por parámetro del historial de gradientes. Esa adaptabilidad es la razón por la que Adam es el predeterminado para los transformadores.

Full content is available with a subscription.
Get full access to all courses on the platform for one year with a single payment.
Unlike other platforms that charge per course, here you get everything for one price, and after one year of use there will be no automatic charge for the following year.