Comment les modèles apprennent réellement, de la descente de gradient classique à Adam
L'accumulation de gradient simule un batch plus grand quand la mémoire est limitée. Au lieu de faire un pas après chaque micro-batch, vous additionnez les gradients de plusieurs micro-batches, puis vous effectuez un seul pas d'optimiseur.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Accumulation de gradient