Precisión Mixta y Escalado de la Pérdida

Cómo aprenden realmente los modelos, del descenso por gradiente básico a Adam

El entrenamiento con precisión mixta usa formatos numéricos más pequeños por velocidad y memoria. En lugar de almacenar cada cálculo en precisión completa (los flotantes estándar de 32 bits), muchas operaciones usan float16 o bfloat16: formatos de 16 bits que ocupan la mitad de memoria a cambio de menos precisión y, en el caso de float16, un rango más estrecho de tamaños representables.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Precisión Mixta y Escalado de la Pérdida
← Mínimos Cuadrados AlternantesEscalado del Tamaño de Lote →