Jak se modely reálně učí, od klasického gradientního sestupu po Adam
Momentum dává gradientnímu sestupu paměť. Místo používání pouze aktuálního gradientu si udržuje klouzavý průměr nedávných gradientů a provádí kroky v tomto nahromaděném směru.
To pomáhá dvěma způsoby: vyhlazuje šumivé gradienty a zvyšuje rychlost ve směrech, kde se gradienty opakovaně shodují. Napříč úzkou roklinou se střídavé boční gradienty ruší; podél užitečného směru se opakované gradienty sčítají.
Bowlingová koule nezapomene na poslední strčení. Jedno strčení ji uvede do pohybu a opakovaná strčení ve stejném směru zvyšují rychlost. Malá boční strčení ji okamžitě neotočí. Momentum způsobuje, že se optimalizace chová méně jako samostatné kroky a více jako pohyb se setrvačností. Sledujte to níže: nejprve spusťte obyčejný sestup s β = 0, potom zvyšte β a spusťte znovu. Odraz ze strany na stranu mizí a cesta získává rychlost podél údolí.