初始化與信號尺度

模型究竟是如何學習的,從原始梯度下降法到Adam

如果初始尺度不對,最佳化甚至可能還沒開始就已經失敗。如果權重太小,信號和梯度可能會消失;如果權重太大,激活值和梯度則可能爆炸或飽和。

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ 初始化與信號尺度
← 梯度累積超參數搜索 →