Моментум

How models actually learn, from vanilla gradient descent to Adam

Momentum дає градієнтному спуску пам’ять. Замість використання лише поточного градієнта, він зберігає ковзну середню нещодавніх градієнтів і робить крок у цьому накопиченому напрямку.

Це допомагає двома способами: згладжує шумні градієнти і набирає швидкість уздовж напрямків, де градієнти постійно погоджуються. Вздовж вузького яру градієнти вбік чергуються і скорочуються; уздовж корисного напрямку повторювані градієнти додаються.

Куля для боулінгу не забуває останнього поштовху. Один поштовх запускає її в рух, а повторювані поштовхи в тому самому напрямку нарощують швидкість. Маленькі бічні штовхання не миттєво розвертають її. Momentum змушує оптимізацію поводитися менше як окремі кроки, а більше як рух із інерцією. Подивися нижче: спочатку запусти звичайний спуск із β = 0, потім збільши β і запусти знову. Бічний рикошет згасає, а траєкторія набирає швидкість уздовж долини.

Де це в MLSGD з momentum залишається сильною базовою лінією для комп’ютерного зору та великомасштабного тренування. Навіть коли популярний Adam, розуміння momentum важливе, бо перший момент Adam — це momentum під іншою назвою.
▶ Моментум
← Обумовленість і зигзагRMSProp →