Comment les modèles apprennent réellement, de la descente de gradient classique à Adam
Adam combine deux idées : le momentum pour le gradient moyen, et une mise à l'échelle façon RMSProp pour le gradient moyen au carré. Il corrige ensuite le biais de démarrage, car ces moyennes mobiles partent de zéro.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Adam