Cómo aprenden realmente los modelos, del descenso por gradiente básico a Adam
Adam y AdamW difieren en cómo manejan la decadencia de pesos. Adam mezcla una penalización L2 dentro de la actualización adaptativa del gradiente. AdamW aplica la decadencia de pesos como un paso de reducción separado.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Adam vs AdamW