Bagaimana model sebenarnya belajar, dari gradient descent dasar hingga Adam
Adam menggabungkan dua ide: momentum untuk rata-rata gradien, dan penskalaan bergaya RMSProp untuk rata-rata gradien-kuadrat. Ia kemudian mengoreksi bias di awal karena rata-rata bergerak itu dimulai dari nol.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Adam