Cómo aprenden realmente los modelos, del descenso por gradiente básico a Adam
La optimización puede fallar antes de empezar si la escala inicial está mal. Si los pesos son demasiado pequeños, las señales y los gradientes pueden desvanecerse. Si los pesos son demasiado grandes, las activaciones y los gradientes pueden explotar o saturarse.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Inicialización y Escala de la Señal