Inicjalizacja i skala sygnału

Jak modele naprawdę się uczą — od zwykłego spadku gradientu po Adama

Optymalizacja może zawieść, zanim się zacznie, jeśli początkowa skala jest błędna. Jeśli wagi są zbyt małe, sygnały i gradienty mogą zaniknąć. Jeśli wagi są zbyt duże, aktywacje i gradienty mogą eksplodować albo się nasycić.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Inicjalizacja i skala sygnału
← Akumulacja gradientuPrzeszukiwanie hiperparametrów →