Como os modelos realmente aprendem, da descida do gradiente simples ao Adam
O gradiente descendente em batch completo usa todos os exemplos de treino para calcular cada atualização; o gradiente descendente estocástico vai para o outro extremo e usa apenas um. O gradiente descendente por mini-batch fica no meio, com um batch pequeno, e é esse meio-termo que o deep learning realmente usa na prática.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ GD Estocástico e por Mini-Batch