Recorte de Gradiente

Cómo aprenden realmente los modelos, del descenso por gradiente básico a Adam

El recorte de gradiente limita cuán grande puede llegar a ser una actualización. Si un lote produce un gradiente enorme, el recorte lo reduce de escala antes del paso del optimizador.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Recorte de Gradiente
← Diagnóstico de OptimizadoresAdam vs AdamW →