Initialisierung & Signalskala

Wie Modelle wirklich lernen, vom einfachen Gradientenabstieg bis zu Adam

Optimierung kann scheitern, bevor sie überhaupt beginnt, wenn die anfängliche Skala falsch ist. Sind die Gewichte zu klein, können Signale und Gradienten verschwinden. Sind die Gewichte zu groß, können Aktivierungen und Gradienten explodieren oder sättigen.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Initialisierung & Signalskala
← GradientenakkumulationHyperparameter-Suche →