Adam vs. AdamW

Wie Modelle wirklich lernen, vom einfachen Gradientenabstieg bis zu Adam

Adam und AdamW unterscheiden sich darin, wie sie mit Weight Decay umgehen. Adam mischt eine L2-Strafe in das adaptive Gradienten-Update. AdamW wendet Weight Decay als separaten Schrumpfungsschritt an.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Adam vs. AdamW
← Gradient-ClippingLernraten-Finder →