Acumulación de Gradiente

Cómo aprenden realmente los modelos, del descenso por gradiente básico a Adam

La acumulación de gradiente simula un lote más grande cuando la memoria es limitada. En lugar de dar un paso tras cada micro-lote, sumas los gradientes de varios micro-lotes, y luego das un solo paso del optimizador.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Acumulación de Gradiente
← Escalado del Tamaño de LoteInicialización y Escala de la Señal →