Wie Modelle wirklich lernen, vom einfachen Gradientenabstieg bis zu Adam
Adam kombiniert zwei Ideen: Momentum für den durchschnittlichen Gradienten und eine RMSProp-artige Skalierung für den durchschnittlichen quadrierten Gradienten. Anschließend korrigiert es die anfängliche Verzerrung, weil diese gleitenden Durchschnitte bei null beginnen.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Adam