Comment les modèles apprennent réellement, de la descente de gradient classique à Adam
La descente de gradient en batch complet utilise chaque exemple d'entraînement pour calculer chaque mise à jour ; la descente de gradient stochastique va à l'autre extrême et n'en utilise qu'un seul. La descente de gradient par mini-batch se situe entre les deux, avec un petit batch, et c'est ce compromis qui fait réellement tourner le deep learning.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Descente de gradient stochastique et par mini-batch