模型究竟是如何学习的——从原始梯度下降到Adam
梯度累积在内存有限时模拟出更大的批量。它不在每个微批量之后就更新一次,而是把好几个微批量的梯度累加起来,再统一执行一次优化器更新。
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.