勾配累積

モデルが実際にどう学習するか — 普通の勾配降下法からAdamまで

勾配累積は、メモリが限られているときに、より大きなバッチを模倣する手法だ。マイクロバッチのたびに更新するのではなく、複数のマイクロバッチの勾配を足し合わせてから、オプティマイザーのステップを1回だけ実行する。

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ 勾配累積
← バッチサイズのスケーリング初期化と信号のスケール →