Cum învață de fapt modelele, de la coborârea pe gradient standard la Adam
Dimensiunea batch-ului, notată cu B, schimbă zgomotul din estimările gradientului. Un batch mic oferă o estimare zgomotoasă, dar ieftină. Un batch mare oferă o estimare mai stabilă, dar fiecare actualizare costă mai mult.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Scalarea dimensiunii batch-ului