モデルが実際にどう学習するか — 普通の勾配降下法からAdamまで
混合精度訓練は、速度とメモリのために、より小さな数値形式を使う。すべての計算を全精度(標準的な32ビット浮動小数点数)で保持する代わりに、多くの演算にfloat16やbfloat16を使う。これらは16ビットの形式で、メモリを半分に抑える代わりに精度が落ち、float16の場合は表現できる大きさの範囲も狭くなる。
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ 混合精度と損失スケーリング