Como os modelos realmente aprendem, do gradiente descendente simples ao Adam
A paragem antecipada usa o desempenho de validação para decidir quando parar o treino. Se a loss de validação deixar de melhorar durante tempo suficiente, mantém-se o melhor checkpoint e para-se. O progresso aqui é contado em épocas: uma época é uma passagem completa pelos dados de treino, e a validação é tipicamente verificada depois de cada uma.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Paragem Antecipada