Cómo aprenden realmente los modelos, del descenso por gradiente básico a Adam
El entrenamiento con precisión mixta usa formatos numéricos más pequeños por velocidad y memoria. En lugar de almacenar cada cálculo en precisión completa (los flotantes estándar de 32 bits), muchas operaciones usan float16 o bfloat16: formatos de 16 bits que ocupan la mitad de memoria a cambio de menos precisión y, en el caso de float16, un rango más estrecho de tamaños representables.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Precisión Mixta y Escalado de la Pérdida