Wie Modelle wirklich lernen, vom einfachen Gradientenabstieg bis zu Adam
Die Batch-Größe, geschrieben B, verändert das Rauschen in Gradientenschätzungen. Ein kleiner Batch liefert eine verrauschte, aber billige Schätzung. Ein großer Batch liefert eine ruhigere Schätzung, aber jedes Update kostet mehr.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Skalierung der Batch-Größe