Come i modelli imparano davvero, dalla discesa del gradiente vanilla ad Adam
Adam e AdamW differiscono nel modo in cui gestiscono il weight decay. Adam mescola una penalità L2 dentro l'aggiornamento adattivo del gradiente. AdamW applica il weight decay come un passo di riduzione separato.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Adam vs AdamW