Cum învață de fapt modelele, de la coborârea pe gradient standard la Adam
Adam și AdamW diferă în modul în care gestionează scăderea ponderilor (weight decay). Adam amestecă o penalizare L2 în actualizarea adaptivă a gradientului. AdamW aplică scăderea ponderilor ca un pas separat de micșorare.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Adam vs AdamW