Como os modelos realmente aprendem, do gradiente descendente simples ao Adam
O tamanho de batch, escrito B, muda o ruído nas estimativas de gradiente. Um batch pequeno dá uma estimativa ruidosa mas barata. Um batch grande dá uma estimativa mais estável, mas cada atualização custa mais.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Escalonamento do Tamanho de Batch