模型究竟是如何學習的,從原始梯度下降法到Adam
梯度累積在記憶體有限時模擬出更大的批量。它不在每個微批量之後就更新一次,而是把好幾個微批量的梯度累加起來,再統一執行一次最佳化器更新。
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.