Bagaimana model sebenarnya belajar, dari gradient descent dasar hingga Adam
Gradient accumulation mensimulasikan batch yang lebih besar ketika memori terbatas. Alih-alih melangkah setelah setiap micro-batch, Anda menjumlahkan gradien dari beberapa micro-batch, lalu mengambil satu langkah optimizer.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Akumulasi Gradien