Adam 与 AdamW

模型究竟是如何学习的——从原始梯度下降到Adam

Adam 和 AdamW 的区别在于如何处理权重衰减。Adam 把 L2 惩罚项混入自适应梯度更新之中;AdamW 则把权重衰减作为一个单独的收缩步骤来执行。

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Adam 与 AdamW
← 梯度裁剪学习率查找器 →