Как моделите наистина се учат — от обикновено градиентно спускане до Adam
Натрупването на градиенти симулира по-голяма партида, когато паметта е ограничена. Вместо да правите стъпка след всяка микропартида, събирате градиентите от няколко микропартиди и едва тогава правите една стъпка на оптимизатора.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Натрупване на градиенти