Inicialización y Escala de la Señal

Cómo aprenden realmente los modelos, del descenso por gradiente básico a Adam

La optimización puede fallar antes de empezar si la escala inicial está mal. Si los pesos son demasiado pequeños, las señales y los gradientes pueden desvanecerse. Si los pesos son demasiado grandes, las activaciones y los gradientes pueden explotar o saturarse.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Inicialización y Escala de la Señal
← Acumulación de GradienteBúsqueda de Hiperparámetros →