Как модели на самом деле обучаются — от обычного градиентного спуска до Adam
Обучение со смешанной точностью использует более компактные числовые форматы ради скорости и экономии памяти. Вместо того чтобы хранить каждое вычисление с полной точностью (стандартные 32-битные числа с плавающей точкой), многие операции используют float16 или bfloat16: 16-битные форматы, занимающие вдвое меньше памяти в обмен на меньшую точность и, для float16, более узкий диапазон представимых величин.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Смешанная точность и масштабирование потерь