Akumulace gradientu

Jak se modely reálně učí, od klasického gradientního sestupu po Adam

Akumulace gradientu simuluje větší dávku (batch), když je paměť omezená. Místo provedení kroku po každém mikro-batchi sčítáte gradienty z několika mikro-batchů a poté provedete jeden krok optimizéru.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Akumulace gradientu
← Škálování velikosti dávkyInicializace a měřítko signálu →