Adam vs AdamW

Jak modele naprawdę się uczą — od zwykłego spadku gradientu po Adama

Adam i AdamW różnią się sposobem obsługi zaniku wag. Adam wmieszuje karę L2 w adaptacyjną aktualizację gradientu. AdamW stosuje zanik wag jako osobny krok kurczenia.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Adam vs AdamW
← Przycinanie gradientuPoszukiwacz współczynnika uczenia →