Jak modele naprawdę się uczą — od zwykłego spadku gradientu po Adama
Akumulacja gradientu symuluje większy wsad, gdy pamięć jest ograniczona. Zamiast wykonywać krok po każdym mikro-wsadzie, dodajesz gradienty z kilku mikro-wsadów, a potem wykonujesz jeden krok optymalizatora.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Akumulacja gradientu