Mieszana precyzja i skalowanie straty

Jak modele naprawdę się uczą — od zwykłego spadku gradientu po Adama

Trening w mieszanej precyzji wykorzystuje mniejsze formaty liczb dla szybkości i pamięci. Zamiast przechowywać każde obliczenie w pełnej precyzji (standardowe 32-bitowe liczby zmiennoprzecinkowe), wiele operacji używa formatu float16 albo bfloat16: formatów 16-bitowych, które zajmują połowę pamięci w zamian za mniejszą precyzję i, w przypadku float16, węższy zakres reprezentowalnych rozmiarów.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Mieszana precyzja i skalowanie straty
← Naprzemienne najmniejsze kwadratySkalowanie rozmiaru wsadu →