Смешанная точность и масштабирование потерь

Как модели на самом деле обучаются — от обычного градиентного спуска до Adam

Обучение со смешанной точностью использует более компактные числовые форматы ради скорости и экономии памяти. Вместо того чтобы хранить каждое вычисление с полной точностью (стандартные 32-битные числа с плавающей точкой), многие операции используют float16 или bfloat16: 16-битные форматы, занимающие вдвое меньше памяти в обмен на меньшую точность и, для float16, более узкий диапазон представимых величин.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Смешанная точность и масштабирование потерь
← Чередующиеся наименьшие квадратыМасштабирование размера пакета →