Adam

Cómo aprenden realmente los modelos, del descenso por gradiente básico a Adam

Adam combina dos ideas: el momentum para el gradiente promedio, y un escalado al estilo de RMSProp para el gradiente promedio al cuadrado. Luego corrige el sesgo inicial, porque esos promedios móviles empiezan en cero.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Adam
← RMSPropDescenso Estocástico y por Mini-Lotes →