梯度累積

模型究竟是如何學習的,從原始梯度下降法到Adam

梯度累積在記憶體有限時模擬出更大的批量。它不在每個微批量之後就更新一次,而是把好幾個微批量的梯度累加起來,再統一執行一次最佳化器更新。

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ 梯度累積
← 批量大小縮放初始化與信號尺度 →