Descente de gradient stochastique et par mini-batch

Comment les modèles apprennent réellement, de la descente de gradient classique à Adam

La descente de gradient en batch complet utilise chaque exemple d'entraînement pour calculer chaque mise à jour ; la descente de gradient stochastique va à l'autre extrême et n'en utilise qu'un seul. La descente de gradient par mini-batch se situe entre les deux, avec un petit batch, et c'est ce compromis qui fait réellement tourner le deep learning.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Descente de gradient stochastique et par mini-batch
← AdamLa convexité en pratique →