Como os modelos realmente aprendem, da descida do gradiente simples ao Adam
O acúmulo de gradiente simula um batch maior quando a memória é limitada. Em vez de dar um passo depois de cada micro-batch, você soma os gradientes de vários micro-batches e depois dá um único passo do otimizador.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Acúmulo de Gradiente