Adam

Comment les modèles apprennent réellement, de la descente de gradient classique à Adam

Adam combine deux idées : le momentum pour le gradient moyen, et une mise à l'échelle façon RMSProp pour le gradient moyen au carré. Il corrige ensuite le biais de démarrage, car ces moyennes mobiles partent de zéro.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Adam
← RMSPropDescente de gradient stochastique et par mini-batch →