Adam vs AdamW

Como os modelos realmente aprendem, do gradiente descendente simples ao Adam

O Adam e o AdamW diferem na forma como lidam com o decaimento de pesos. O Adam mistura uma penalização L2 na atualização adaptativa do gradiente. O AdamW aplica o decaimento de pesos como um passo de redução separado.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Adam vs AdamW
← Recorte de GradienteLocalizador de Taxa de Aprendizagem →