模型究竟是如何學習的,從原始梯度下降法到Adam
全批量梯度下降法在每次更新時用到全部訓練樣本;隨機梯度下降法走向另一個極端,每次只用一個樣本。小批量梯度下降法介於兩者之間,用一小批樣本,而這種折衷正是深度學習實際運行的方式。
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.