Hoe modellen daadwerkelijk leren, van gewone gradient descent tot Adam
Adam en AdamW verschillen in hoe ze gewichtsverval behandelen. Adam mengt een L2-penalty in de adaptieve gradiëntupdate. AdamW past gewichtsverval toe als een aparte krimpstap.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Adam versus AdamW