Initialisation et échelle du signal

Comment les modèles apprennent réellement, de la descente de gradient classique à Adam

L'optimisation peut échouer avant même de commencer si l'échelle initiale est mauvaise. Si les poids sont trop petits, les signaux et les gradients peuvent s'évanouir. S'ils sont trop grands, les activations et les gradients peuvent exploser ou saturer.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Initialisation et échelle du signal
← Accumulation de gradientRecherche d'hyperparamètres →