Jak se modely reálně učí, od klasického gradientního sestupu po Adam
Optimalizace může selhat ještě předtím, než začne, pokud je počáteční měřítko špatně nastaveno. Pokud jsou váhy příliš malé, signály a gradienty mohou vymizet. Pokud jsou váhy příliš velké, aktivace a gradienty mohou explodovat nebo saturovat.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Inicializace a měřítko signálu