Накопичення градієнтів

How models actually learn, from vanilla gradient descent to Adam

Накопичення градієнтів імітує більшу партію, коли пам’ять обмежена. Замість кроку після кожної мікропартії, ти додаєш градієнти з кількох мікропартій, потім робиш один крок оптимізатора.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Накопичення градієнтів
← Масштабування розміру партіїІніціалізація та масштаб сигналу →