Discesa del Gradiente Stocastica e Mini-Batch

Come i modelli imparano davvero, dalla discesa del gradiente vanilla ad Adam

La discesa del gradiente a batch completo usa ogni esempio di addestramento per calcolare ciascun aggiornamento; la discesa del gradiente stocastica va all'estremo opposto e ne usa solo uno. La discesa del gradiente mini-batch sta nel mezzo con un piccolo batch, ed è proprio questo compromesso su cui gira davvero il deep learning.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Discesa del Gradiente Stocastica e Mini-Batch
← AdamLa Convessità nella Pratica →