Wie Modelle wirklich lernen, vom einfachen Gradientenabstieg bis zu Adam
Gradientenakkumulation simuliert einen größeren Batch, wenn der Speicher begrenzt ist. Statt nach jedem Mikro-Batch einen Schritt zu machen, addierst du die Gradienten mehrerer Mikro-Batches und führst dann einen einzigen Optimierer-Schritt aus.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Gradientenakkumulation