Momentum

Jak se modely reálně učí, od klasického gradientního sestupu po Adam

Momentum dává gradientnímu sestupu paměť. Místo používání pouze aktuálního gradientu si udržuje klouzavý průměr nedávných gradientů a provádí kroky v tomto nahromaděném směru.

To pomáhá dvěma způsoby: vyhlazuje šumivé gradienty a zvyšuje rychlost ve směrech, kde se gradienty opakovaně shodují. Napříč úzkou roklinou se střídavé boční gradienty ruší; podél užitečného směru se opakované gradienty sčítají.

Bowlingová koule nezapomene na poslední strčení. Jedno strčení ji uvede do pohybu a opakovaná strčení ve stejném směru zvyšují rychlost. Malá boční strčení ji okamžitě neotočí. Momentum způsobuje, že se optimalizace chová méně jako samostatné kroky a více jako pohyb se setrvačností. Sledujte to níže: nejprve spusťte obyčejný sestup s β = 0, potom zvyšte β a spusťte znovu. Odraz ze strany na stranu mizí a cesta získává rychlost podél údolí.

Kde se to v ML objevujeSGD s momentem (momentum) zůstává silným základem (baseline) pro počítačové vidění a trénování ve velkém měřítku. I když je Adam populární, porozumění momentu je důležité, protože první moment v Adamu je momentum pod jiným názvem.
▶ Momentum
← Podmíněnost a cik-cak pohybRMSProp →