Cum învață de fapt modelele, de la coborârea pe gradient standard la Adam
Gradient descent cu batch complet folosește fiecare exemplu de antrenare pentru a calcula fiecare actualizare; gradient descent stohastic merge la cealaltă extremă și folosește doar unul. Gradient descent cu mini-batch se află la mijloc cu un batch mic, și pe acel compromis funcționează de fapt deep learning-ul.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ GD stocastic și pe mini-loturi