Jak modele naprawdę się uczą — od zwykłego spadku gradientu po Adama
Optymalizacja może zawieść, zanim się zacznie, jeśli początkowa skala jest błędna. Jeśli wagi są zbyt małe, sygnały i gradienty mogą zaniknąć. Jeśli wagi są zbyt duże, aktywacje i gradienty mogą eksplodować albo się nasycić.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Inicjalizacja i skala sygnału