Como os modelos realmente aprendem, da descida do gradiente simples ao Adam
A otimização pode falhar antes mesmo de começar se a escala inicial estiver errada. Se os pesos são pequenos demais, sinais e gradientes podem desaparecer. Se os pesos são grandes demais, ativações e gradientes podem explodir ou saturar.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Inicialização & Escala do Sinal