Ініціалізація та масштаб сигналу

How models actually learn, from vanilla gradient descent to Adam

Оптимізація може зазнати невдачі ще до початку, якщо початковий масштаб неправильний. Якщо ваги занадто малі, сигнали і градієнти можуть зникнути. Якщо ваги занадто великі, активації і градієнти можуть вибухнути або насититися.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Ініціалізація та масштаб сигналу
← Накопичення градієнтівПошук гіперпараметрів →