How models actually learn, from vanilla gradient descent to Adam
Тренування зі змішаною точністю використовує менші числові формати для швидкості та пам’яті. Замість зберігання кожного обчислення в повній точності (стандартні 32-бітові числа з плаваючою комою), багато операцій використовують float16 або bfloat16: 16-бітові формати, які займають вдвічі менше пам’яті в обмін на меншу точність і, для float16, вужчий діапазон поданих величин.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Змішана точність та масштабування втрат