梯度

從第一性原理出發的多變量微積分

把 f 的所有偏導數收集到一個向量裡,就得到梯度,記作 ∇f(「grad f」)。深度學習中的每個最佳化器都依賴這個對象,所以它理應成為這門課的核心。

梯度不只是記賬。作為輸入空間中的向量,它有方向和長度,二者都有意義。它的方向是最陡上升方向:沿著 ∇f 指向前進,函數會以可能的最快速度上升。它的長度 ‖∇f‖ 正好就是這個上升有多陡。

想像自己站在霧中的長滿草的山丘上。梯度 ∇f 是指向斜坡最陡峭部分正上方的箭頭,它的長度告訴你這段攀爬有多麼折磨人。放下一個球並鬆手:它會沿著完全相反的方向滾落,走最快向下的路徑。

在機器學習中的應用站在損失曲面上,你想盡可能快地下坡。梯度 ∇L 指向最陡上升,所以你要減去它:w ← w − η∇L,這就是 SGD、Adam 和所有其他最佳化器背後的更新。反向傳播存在的原因只有一個:高效計算這個向量。
▶ 梯度
← 高階偏導數方向導數 →