Como os modelos realmente aprendem, do gradiente descendente simples ao Adam
A otimização pode falhar antes de começar se a escala inicial estiver errada. Se os pesos forem demasiado pequenos, os sinais e os gradientes podem desvanecer-se. Se os pesos forem demasiado grandes, as ativações e os gradientes podem explodir ou saturar.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Inicialização e Escala de Sinal