Wie Modelle wirklich lernen, vom einfachen Gradientenabstieg bis zu Adam
Adam und AdamW unterscheiden sich darin, wie sie mit Weight Decay umgehen. Adam mischt eine L2-Strafe in das adaptive Gradienten-Update. AdamW wendet Weight Decay als separaten Schrumpfungsschritt an.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Adam vs. AdamW