Змішана точність та масштабування втрат

How models actually learn, from vanilla gradient descent to Adam

Тренування зі змішаною точністю використовує менші числові формати для швидкості та пам’яті. Замість зберігання кожного обчислення в повній точності (стандартні 32-бітові числа з плаваючою комою), багато операцій використовують float16 або bfloat16: 16-бітові формати, які займають вдвічі менше пам’яті в обмін на меншу точність і, для float16, вужчий діапазон поданих величин.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Змішана точність та масштабування втрат
← Чергуючі найменші квадратиМасштабування розміру партії →