Akumulasi Gradien

Bagaimana model sebenarnya belajar, dari gradient descent dasar hingga Adam

Gradient accumulation mensimulasikan batch yang lebih besar ketika memori terbatas. Alih-alih melangkah setelah setiap micro-batch, Anda menjumlahkan gradien dari beberapa micro-batch, lalu mengambil satu langkah optimizer.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Akumulasi Gradien
← Penskalaan Batch SizeInisialisasi & Skala Sinyal →