Precisione Mista e Loss Scaling

Come i modelli imparano davvero, dalla discesa del gradiente vanilla ad Adam

L'addestramento a precisione mista usa formati numerici più piccoli per guadagnare velocità e memoria. Invece di memorizzare ogni calcolo a piena precisione (i normali float a 32 bit), molte operazioni usano float16 o bfloat16: formati a 16 bit che dimezzano la memoria in cambio di meno precisione e, per float16, un intervallo più stretto di grandezze rappresentabili.

🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.

▶ Precisione Mista e Loss Scaling
← Minimi Quadrati AlternatiScalatura della Batch Size →