Accumulazione del Gradiente

Come i modelli imparano davvero, dalla discesa del gradiente vanilla ad Adam

La gradient accumulation simula una batch più grande quando la memoria è limitata. Invece di fare un passo dopo ogni micro-batch, sommi i gradienti di più micro-batch, poi compi un solo passo dell'ottimizzatore.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Accumulazione del Gradiente
← Scalatura della Batch SizeInizializzazione e Scala del Segnale →