Jak modele naprawdę się uczą — od zwykłego spadku gradientu po Adama
Trening w mieszanej precyzji wykorzystuje mniejsze formaty liczb dla szybkości i pamięci. Zamiast przechowywać każde obliczenie w pełnej precyzji (standardowe 32-bitowe liczby zmiennoprzecinkowe), wiele operacji używa formatu float16 albo bfloat16: formatów 16-bitowych, które zajmują połowę pamięci w zamian za mniejszą precyzję i, w przypadku float16, węższy zakres reprezentowalnych rozmiarów.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Mieszana precyzja i skalowanie straty