How models actually learn, from vanilla gradient descent to Adam
Оптимізація може зазнати невдачі ще до початку, якщо початковий масштаб неправильний. Якщо ваги занадто малі, сигнали і градієнти можуть зникнути. Якщо ваги занадто великі, активації і градієнти можуть вибухнути або насититися.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Ініціалізація та масштаб сигналу