Accumulation de gradient

Comment les modèles apprennent réellement, de la descente de gradient classique à Adam

L'accumulation de gradient simule un batch plus grand quand la mémoire est limitée. Au lieu de faire un pas après chaque micro-batch, vous additionnez les gradients de plusieurs micro-batches, puis vous effectuez un seul pas d'optimiseur.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Accumulation de gradient
← Mise à l'échelle de la taille de batchInitialisation et échelle du signal →