Inicialização e Escala de Sinal

Como os modelos realmente aprendem, do gradiente descendente simples ao Adam

A otimização pode falhar antes de começar se a escala inicial estiver errada. Se os pesos forem demasiado pequenos, os sinais e os gradientes podem desvanecer-se. Se os pesos forem demasiado grandes, as ativações e os gradientes podem explodir ou saturar.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Inicialização e Escala de Sinal
← Acumulação de GradienteProcura de Hiperparâmetros →