Jak se modely reálně učí, od klasického gradientního sestupu po Adam
Trénování se smíšenou přesností používá menší číselné formáty pro zvýšení rychlosti a úsporu paměti. Místo ukládání každého výpočtu v plné přesnosti (standardní 32bitové hodnoty s plovoucí řádkovou čárkou) používá mnoho operací float16 nebo bfloat16: 16bitové formáty, které zabírají polovinu paměti výměnou za nižší přesnost a v případě float16 i užší rozsah zobrazitelných hodnot.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Smíšená přesnost a škálování ztráty