Cách các mô hình thực sự học, từ gradient descent thuần túy đến Adam
Adam và AdamW khác nhau ở cách chúng xử lý suy giảm trọng số. Adam trộn một số hạng phạt L2 vào bước cập nhật gradient thích ứng. AdamW áp dụng suy giảm trọng số như một bước co lại riêng biệt.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Adam so với AdamW