Come i modelli imparano davvero, dalla discesa del gradiente vanilla ad Adam
La gradient accumulation simula una batch più grande quando la memoria è limitata. Invece di fare un passo dopo ogni micro-batch, sommi i gradienti di più micro-batch, poi compi un solo passo dell'ottimizzatore.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Accumulazione del Gradiente