How models actually learn, from vanilla gradient descent to Adam
Momentum дає градієнтному спуску пам’ять. Замість використання лише поточного градієнта, він зберігає ковзну середню нещодавніх градієнтів і робить крок у цьому накопиченому напрямку.
Це допомагає двома способами: згладжує шумні градієнти і набирає швидкість уздовж напрямків, де градієнти постійно погоджуються. Вздовж вузького яру градієнти вбік чергуються і скорочуються; уздовж корисного напрямку повторювані градієнти додаються.
Куля для боулінгу не забуває останнього поштовху. Один поштовх запускає її в рух, а повторювані поштовхи в тому самому напрямку нарощують швидкість. Маленькі бічні штовхання не миттєво розвертають її. Momentum змушує оптимізацію поводитися менше як окремі кроки, а більше як рух із інерцією. Подивися нижче: спочатку запусти звичайний спуск із β = 0, потім збільши β і запусти знову. Бічний рикошет згасає, а траєкторія набирає швидкість уздовж долини.