Como os modelos realmente aprendem, da descida do gradiente simples ao Adam
O tamanho do batch, escrito B, muda o ruído nas estimativas de gradiente. Um batch pequeno dá uma estimativa ruidosa, mas barata. Um batch grande dá uma estimativa mais estável, mas cada atualização custa mais.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Escalonamento do Tamanho do Batch