Cum învață de fapt modelele, de la coborârea pe gradient standard la Adam
Optimizarea poate eșua înainte de a începe dacă scala inițială este greșită. Dacă ponderile sunt prea mici, semnalele și gradienții pot dispărea. Dacă ponderile sunt prea mari, activările și gradienții pot exploda sau satura.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Inițializarea și scala semnalului