Adam vs AdamW

Como os modelos realmente aprendem, da descida do gradiente simples ao Adam

Adam e AdamW diferem na forma como lidam com o weight decay. O Adam mistura uma penalidade L2 na atualização adaptativa do gradiente. O AdamW aplica o weight decay como um passo de encolhimento separado.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Adam vs AdamW
← Clipping de GradienteLocalizador de Taxa de Aprendizado →