Acumulação de Gradiente

Como os modelos realmente aprendem, do gradiente descendente simples ao Adam

A acumulação de gradiente simula um batch maior quando a memória é limitada. Em vez de dar um passo depois de cada micro-batch, somas os gradientes de vários micro-batches, e depois dás um único passo de otimizador.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Acumulação de Gradiente
← Escalonamento do Tamanho de BatchInicialização e Escala de Sinal →