Como os modelos realmente aprendem, da descida do gradiente simples ao Adam
Adam e AdamW diferem na forma como lidam com o weight decay. O Adam mistura uma penalidade L2 na atualização adaptativa do gradiente. O AdamW aplica o weight decay como um passo de encolhimento separado.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Adam vs AdamW