Come i modelli imparano davvero, dalla discesa del gradiente vanilla ad Adam
L'addestramento a precisione mista usa formati numerici più piccoli per guadagnare velocità e memoria. Invece di memorizzare ogni calcolo a piena precisione (i normali float a 32 bit), molte operazioni usano float16 o bfloat16: formati a 16 bit che dimezzano la memoria in cambio di meno precisione e, per float16, un intervallo più stretto di grandezze rappresentabili.
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ Precisione Mista e Loss Scaling