Skalierung der Batch-Größe

Wie Modelle wirklich lernen, vom einfachen Gradientenabstieg bis zu Adam

Die Batch-Größe, geschrieben B, verändert das Rauschen in Gradientenschätzungen. Ein kleiner Batch liefert eine verrauschte, aber billige Schätzung. Ein großer Batch liefert eine ruhigere Schätzung, aber jedes Update kostet mehr.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Skalierung der Batch-Größe
← Mixed Precision & Loss ScalingGradientenakkumulation →