Précision mixte et mise à l'échelle de la perte

Comment les modèles apprennent réellement, de la descente de gradient classique à Adam

L'entraînement en précision mixte utilise des formats numériques plus petits pour gagner en vitesse et en mémoire. Plutôt que de stocker chaque calcul en pleine précision (les flottants 32 bits standard), de nombreuses opérations utilisent float16 ou bfloat16 : des formats 16 bits qui occupent moitié moins de mémoire en échange d'une précision réduite et, pour float16, d'une plage plus étroite de valeurs représentables.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Précision mixte et mise à l'échelle de la perte
← Moindres carrés alternésMise à l'échelle de la taille de batch →