Adam

How models actually learn, from vanilla gradient descent to Adam

Adam поєднує дві ідеї: momentum для середнього градієнта і масштабування в стилі RMSProp для середнього квадрата градієнта. Потім він коригує раннє зміщення, бо ці ковзні середні починаються з нуля.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Adam
← RMSPropСтохастичний та міні-партійний GD →