Cum învață de fapt modelele, de la coborârea pe gradient standard la Adam
Acumularea gradientului simulează un batch mai mare atunci când memoria este limitată. În loc să faci un pas după fiecare micro-batch, aduni gradienții de la mai multe micro-batch-uri, apoi faci un singur pas al optimizatorului.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Acumularea gradientului