Como os modelos realmente aprendem, da descida do gradiente simples ao Adam
Uma taxa de aprendizado fixa raramente é a melhor para um treinamento inteiro. O início do treinamento costuma aguentar passos maiores porque os parâmetros estão longe de configurações úteis. O final do treinamento geralmente precisa de passos menores para se assentar.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Cronogramas e Warmup