Écrêtage du gradient

Comment les modèles apprennent réellement, de la descente de gradient classique à Adam

L'écrêtage du gradient limite l'ampleur que peut prendre une mise à jour. Si un batch produit un gradient énorme, l'écrêtage le réduit avant le pas de l'optimiseur.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Écrêtage du gradient
← Diagnostic de l'optimiseurAdam vs AdamW →