Mise à l'échelle de la taille de batch

Comment les modèles apprennent réellement, de la descente de gradient classique à Adam

La taille de batch, notée B, change le bruit dans les estimations du gradient. Un petit batch donne une estimation bruitée mais peu coûteuse. Un grand batch donne une estimation plus stable, mais chaque mise à jour coûte plus cher.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Mise à l'échelle de la taille de batch
← Précision mixte et mise à l'échelle de la perteAccumulation de gradient →