Como os modelos realmente aprendem, do gradiente descendente simples ao Adam
O gradiente descendente em lote completo usa todos os exemplos de treino para calcular cada atualização; o gradiente descendente estocástico vai para o outro extremo e usa apenas um. O gradiente descendente por mini-batch fica no meio com um lote pequeno, e é esse compromisso que o deep learning realmente usa.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Gradiente Descendente Estocástico e por Mini-Batch