Adam vs AdamW

Cum învață de fapt modelele, de la coborârea pe gradient standard la Adam

Adam și AdamW diferă în modul în care gestionează scăderea ponderilor (weight decay). Adam amestecă o penalizare L2 în actualizarea adaptivă a gradientului. AdamW aplică scăderea ponderilor ca un pas separat de micșorare.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Adam vs AdamW
← Trunchierea gradientuluiIdentificatorul ratei de învățare →