Как моделите наистина се учат — от обикновено градиентно спускане до Adam
Обучението със смесена точност използва по-малки числови формати за скорост и памет. Вместо да съхранява всяко изчисление с пълна точност (стандартните 32-битови числа с плаваща запетая), много операции използват float16 или bfloat16: 16-битови формати, които заемат половин памет в замяна на по-малка точност и, за float16, по-тесен диапазон от представими стойности.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Смесена точност и мащабиране на загубата