Jak se modely reálně učí, od klasického gradientního sestupu po Adam
Akumulace gradientu simuluje větší dávku (batch), když je paměť omezená. Místo provedení kroku po každém mikro-batchi sčítáte gradienty z několika mikro-batchů a poté provedete jeden krok optimizéru.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Akumulace gradientu