Cắt gradient

Cách các mô hình thực sự học, từ gradient descent thuần túy đến Adam

Cắt gradient giới hạn độ lớn tối đa mà một bước cập nhật có thể đạt tới. Nếu một batch tạo ra một gradient khổng lồ, việc cắt sẽ thu nhỏ nó lại trước khi bộ tối ưu hóa thực hiện bước cập nhật.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Cắt gradient
← Chẩn đoán bộ tối ưu hóaAdam so với AdamW →