Adam vs AdamW

How models actually learn, from vanilla gradient descent to Adam

Adam і AdamW відрізняються тим, як вони обробляють weight decay. Adam змішує штраф L2 в адаптивне оновлення градієнта. AdamW застосовує weight decay як окремий крок стиснення.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Adam vs AdamW
← Обрізання градієнтівПошук швидкості навчання →