Bagaimana model sebenarnya belajar, dari gradient descent dasar hingga Adam
Adam dan AdamW berbeda dalam cara mereka menangani weight decay. Adam mencampurkan penalti L2 ke dalam update gradien adaptif. AdamW menerapkan weight decay sebagai langkah penyusutan yang terpisah.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Adam vs AdamW