Come i modelli imparano davvero, dalla discesa del gradiente vanilla ad Adam
L'ottimizzazione può fallire prima ancora di cominciare se la scala iniziale è sbagliata. Se i pesi sono troppo piccoli, segnali e gradienti possono svanire. Se i pesi sono troppo grandi, attivazioni e gradienti possono esplodere o saturare.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Inizializzazione e Scala del Segnale