Akumulacja gradientu

Jak modele naprawdę się uczą — od zwykłego spadku gradientu po Adama

Akumulacja gradientu symuluje większy wsad, gdy pamięć jest ograniczona. Zamiast wykonywać krok po każdym mikro-wsadzie, dodajesz gradienty z kilku mikro-wsadów, a potem wykonujesz jeden krok optymalizatora.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Akumulacja gradientu
← Skalowanie rozmiaru wsaduInicjalizacja i skala sygnału →