मॉडल वास्तव में कैसे सीखते हैं, सादे ग्रेडिएंट डिसेंट से लेकर Adam तक
मिश्रित परिशुद्धता प्रशिक्षण गति और मेमोरी के लिए छोटे संख्या प्रारूपों का उपयोग करता है। हर गणना को पूर्ण परिशुद्धता (मानक 32-बिट फ्लोट) में संग्रहीत करने के बजाय, कई संक्रियाएँ float16 या bfloat16 का उपयोग करती हैं: 16-बिट प्रारूप जो कम परिशुद्धता के बदले आधी मेमोरी लेते हैं, और float16 के लिए, प्रदर्शित करने योग्य आकारों की एक संकरी सीमा।
🔒 This is a Pro lesson — the interactive figure, worked examples, quiz and practice open with Pro access.
▶ मिश्रित परिशुद्धता और हानि स्केलिंग