Como os modelos realmente aprendem, do gradiente descendente simples ao Adam
A acumulação de gradiente simula um batch maior quando a memória é limitada. Em vez de dar um passo depois de cada micro-batch, somas os gradientes de vários micro-batches, e depois dás um único passo de otimizador.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Acumulação de Gradiente