Gradientenakkumulation

Wie Modelle wirklich lernen, vom einfachen Gradientenabstieg bis zu Adam

Gradientenakkumulation simuliert einen größeren Batch, wenn der Speicher begrenzt ist. Statt nach jedem Mikro-Batch einen Schritt zu machen, addierst du die Gradienten mehrerer Mikro-Batches und führst dann einen einzigen Optimierer-Schritt aus.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Gradientenakkumulation
← Skalierung der Batch-GrößeInitialisierung & Signalskala →