Como os modelos realmente aprendem, do gradiente descendente simples ao Adam
O Adam e o AdamW diferem na forma como lidam com o decaimento de pesos. O Adam mistura uma penalização L2 na atualização adaptativa do gradiente. O AdamW aplica o decaimento de pesos como um passo de redução separado.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Adam vs AdamW