GD Estocástico e por Mini-Batch

Como os modelos realmente aprendem, da descida do gradiente simples ao Adam

O gradiente descendente em batch completo usa todos os exemplos de treino para calcular cada atualização; o gradiente descendente estocástico vai para o outro extremo e usa apenas um. O gradiente descendente por mini-batch fica no meio, com um batch pequeno, e é esse meio-termo que o deep learning realmente usa na prática.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ GD Estocástico e por Mini-Batch
← AdamConvexidade na Prática →