随机梯度下降与小批量梯度下降

模型究竟是如何学习的——从原始梯度下降到Adam

全批量梯度下降在每次更新时用到全部训练样本;随机梯度下降走向另一个极端,每次只用一个样本。小批量梯度下降介于两者之间,用一小批样本,而这种折衷正是深度学习实际运行的方式。

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ 随机梯度下降与小批量梯度下降
← Adam实践中的凸性 →