Escalonamento do Tamanho de Batch

Como os modelos realmente aprendem, do gradiente descendente simples ao Adam

O tamanho de batch, escrito B, muda o ruído nas estimativas de gradiente. Um batch pequeno dá uma estimativa ruidosa mas barata. Um batch grande dá uma estimativa mais estável, mas cada atualização custa mais.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Escalonamento do Tamanho de Batch
← Precisão Mista e Escalonamento de LossAcumulação de Gradiente →