Cómo aprenden realmente los modelos, del descenso por gradiente básico a Adam
Adam combina dos ideas: el momentum para el gradiente promedio, y un escalado al estilo de RMSProp para el gradiente promedio al cuadrado. Luego corrige el sesgo inicial, porque esos promedios móviles empiezan en cero.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Adam