Масштабування розміру партії

How models actually learn, from vanilla gradient descent to Adam

Розмір партії, записаний B, змінює шум у оцінках градієнта. Мала партія дає шумну, але дешеву оцінку. Велика партія дає стійкішу оцінку, але кожне оновлення коштує дорожче.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Масштабування розміру партії
← Змішана точність та масштабування втратНакопичення градієнтів →