Como os modelos realmente aprendem, do gradiente descendente simples ao Adam
Uma taxa de aprendizagem fixa raramente é a melhor para toda uma execução de treino. O treino inicial consegue lidar com passos maiores porque os parâmetros estão longe de configurações úteis. O treino mais tardio frequentemente precisa de passos menores para assentar.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Escalonamento e Aquecimento