Acúmulo de Gradiente

Como os modelos realmente aprendem, da descida do gradiente simples ao Adam

O acúmulo de gradiente simula um batch maior quando a memória é limitada. Em vez de dar um passo depois de cada micro-batch, você soma os gradientes de vários micro-batches e depois dá um único passo do otimizador.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Acúmulo de Gradiente
← Escalonamento do Tamanho do BatchInicialização & Escala do Sinal →