Jak se modely reálně učí, od klasického gradientního sestupu po Adam
Adam a AdamW se liší v způsobu, jakým zacházejí s váhovým úbytkem. Adam přimíchává penaltu L2 do adaptivní aktualizace gradientu. AdamW aplikuje váhový úbytek jako samostatný krok zmenšování vah.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Adam vs AdamW