模型究竟是如何学习的——从原始梯度下降到Adam
正则化通常被介绍成加到损失上的一个惩罚项。从几何上看,它改变的是哪些参数向量被认为是“便宜”的,哪些是“昂贵”的。这会改变整个优化问题的形状。下面反复出现两个符号:R(θ) 代表惩罚项,λ(lambda)设定它的权重有多强。
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ 正则化即几何