Escalonamento do Tamanho do Batch

Como os modelos realmente aprendem, da descida do gradiente simples ao Adam

O tamanho do batch, escrito B, muda o ruído nas estimativas de gradiente. Um batch pequeno dá uma estimativa ruidosa, mas barata. Um batch grande dá uma estimativa mais estável, mas cada atualização custa mais.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Escalonamento do Tamanho do Batch
← Precisão Mista & Escalonamento da LossAcúmulo de Gradiente →