Cómo aprenden realmente los modelos, del descenso por gradiente básico a Adam
La parada temprana usa el rendimiento de validación para decidir cuándo detener el entrenamiento. Si la pérdida de validación deja de mejorar durante suficiente tiempo, conservas el mejor checkpoint y te detienes. Aquí el progreso se cuenta en épocas: una época es una pasada completa por los datos de entrenamiento, y la validación normalmente se comprueba después de cada una.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Parada Temprana