Comment les modèles apprennent réellement, de la descente de gradient classique à Adam
Adam et AdamW diffèrent dans leur façon de gérer la décroissance des poids. Adam mélange une pénalité L2 à la mise à jour adaptative du gradient. AdamW applique la décroissance des poids comme une étape de réduction séparée.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Adam vs AdamW