模型究竟是如何学习的——从原始梯度下降到Adam
凸损失有一个强大的保证:每一个局部最小值都是全局最小值。这让优化在概念上变得干净利落。许多经典的机器学习目标函数是凸的;深度网络的目标函数通常不是。
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.