Scalatura della Batch Size

Come i modelli imparano davvero, dalla discesa del gradiente vanilla ad Adam

La batch size, scritta B, cambia il rumore nelle stime del gradiente. Una batch piccola dà una stima rumorosa ma economica. Una batch grande dà una stima più stabile, ma ogni aggiornamento costa di più.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Scalatura della Batch Size
← Precisione Mista e Loss ScalingAccumulazione del Gradiente →