NVIDIA के नए NVFP4 और MXFP8 क्वांटाइज़ेशन फॉर्मेट Blackwell GPU पर मापने लायक परफ़ॉर्मेंस फ़ायदे दे रहे हैं, Flux.1-Dev, QwenImage, और LTX-2 जैसे लोकप्रिय डिफ्यूज़न मॉडल्स पर एंड-टू-एंड इन्फ़रेंस स्पीडअप क्रमशः 1.68x और 1.26x तक पहुंच रहा है। ये फॉर्मेट माइक्रोस्केलिंग का इस्तेमाल करते हैं, यानी पूरे टेंसर को स्केल करने के बजाय एलिमेंट्स को शेयर्ड हाई-प्रिसिज़न स्केल फ़ैक्टर वाले छोटे ब्लॉक में समूहित करना। NVFP4, 16-एलिमेंट ब्लॉक के साथ 4-बिट फ़्लोटिंग-पॉइंट (E2M1) का इस्तेमाल करता है, जबकि MXFP8, 32-एलिमेंट ब्लॉक के साथ 8-बिट E4M3/E5M2 फ़ॉर्मेट वाले Open Compute Project स्टैंडर्ड का पालन करता है।
ये सिर्फ़ सैद्धांतिक सुधार नहीं हैं। यह क्वांटाइज़ेशन अब diffusers और TorchAO इंटीग्रेशन के ज़रिए प्रोडक्शन-रेडी है, और रीप्रोडक्शन के लिए कोड भी उपलब्ध है। यह इसलिए मायने रखता है क्योंकि कई इस्तेमाल के मामलों के लिए डिफ्यूज़न मॉडल इन्फ़रेंस अब तक बेहद महंगा रहा है, मेमोरी फ़ुटप्रिंट को 3.5x तक घटाते हुए भी विज़ुअल क्वालिटी (LPIPS से मापी गई) बनाए रखना इन मॉडलों को ज़्यादा डेवलपर्स के लिए सुलभ बना देता है। यह टाइमिंग उस व्यापक इंडस्ट्री रुझान से मेल खाती है जो ट्रेनिंग लागत स्थिर होने और डिप्लॉयमेंट के बॉटलनेक बनने के साथ कुशल AI इन्फ़रेंस की ओर बढ़ रहा है।
यहां ध्यान देने वाली बात NVIDIA की रणनीतिक पोज़िशनिंग है। जहां प्रतिस्पर्धी जनरल-पर्पज़ क्वांटाइज़ेशन पर ध्यान केंद्रित कर रहे हैं, वहीं NVIDIA हार्डवेयर-स्पेसिफ़िक ऑप्टिमाइज़ेशन पर दांव लगा रहा है जो डेवलपर्स को उसके इकोसिस्टम में बांध देता है। CUDA क्षमता 10.0+ की ज़रूरत का मतलब है कि यह सिर्फ़ सबसे नए और सबसे महंगे हार्डवेयर पर ही काम करता है। अन्य स्रोतों से पता चलता है कि यह 208 बिलियन ट्रांज़िस्टर और सेकंड-जनरेशन Transformer Engine वाले व्यापक Blackwell आर्किटेक्चर पुश का हिस्सा है, यानी NVIDIA सिर्फ़ स्पीड नहीं बेच रहा, बल्कि एक पूरा इन्फ्रास्ट्रक्चर स्टैक बेच रहा है।
डेवलपर्स के लिए, व्यावहारिक बाधा B200 हार्डवेयर तक पहुंच है, जो अब भी सीमित और महंगा है। यह क्वांटाइज़ेशन हाई-बैच, कंप्यूट-बाउंड वर्कलोड के लिए सबसे बेहतर काम करता है, इसलिए सोलो डेवलपर्स को इसका पूरा फ़ायदा नहीं मिलेगा। लेकिन जो कंपनियां पहले से ही Blackwell इन्फ्रास्ट्रक्चर में निवेश कर रही हैं, उनके लिए यह बिना किसी आर्किटेक्चरल बदलाव के डिफ्यूज़न मॉडल डिप्लॉयमेंट पर तुरंत ROI है।
