Inicialização & Escala do Sinal

Como os modelos realmente aprendem, da descida do gradiente simples ao Adam

A otimização pode falhar antes mesmo de começar se a escala inicial estiver errada. Se os pesos são pequenos demais, sinais e gradientes podem desaparecer. Se os pesos são grandes demais, ativações e gradientes podem explodir ou saturar.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Inicialização & Escala do Sinal
← Acúmulo de GradienteBusca de Hiperparâmetros →