模型究竟是如何學習的,從原始梯度下降法到Adam
動量給梯度下降法賦予了記憶。它不再只用當前這一步的梯度,而是保留最近梯度的移動平均,並朝著這個累積方向邁步。
這在兩方面都有幫助:它能平滑帶噪聲的梯度,也能沿著梯度反覆一致的方向積累速度。在一條狹窄的山谷裡,左右交替的橫向梯度會相互抵消;而在有用的方向上,反覆出現的梯度會不斷疊加。
保齡球不會忘記上一次的推力。一次推動讓它開始滾動,同方向的反覆推動會讓它越滾越快。小小的側向碰撞並不會立刻讓它掉頭。動量讓最佳化的表現不再像一個個孤立的步子,而更像帶有慣性的連續運動。你可以在下面親眼見證:先用 β = 0 跑一次普通下降,再提高 β 重新運行。左右來回的反彈會逐漸消退,路徑會沿著山谷積攢速度。