Adam vs AdamW

Comment les modèles apprennent réellement, de la descente de gradient classique à Adam

Adam et AdamW diffèrent dans leur façon de gérer la décroissance des poids. Adam mélange une pénalité L2 à la mise à jour adaptative du gradient. AdamW applique la décroissance des poids comme une étape de réduction séparée.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Adam vs AdamW
← Écrêtage du gradientRecherche du taux d'apprentissage →