Mistral ने 26 मार्च को Voxtral-4B-TTS रिलीज़ किया, और दावा किया कि यह ह्यूमन इवैल्यूएशन में 62.8% प्रेफरेंस स्कोर के साथ ElevenLabs v2.5 Flash को पीछे छोड़ देता है। 4 बिलियन पैरामीटर वाला यह मॉडल केवल 3GB VRAM पर चलता है, 9 भाषाओं को सपोर्ट करता है, और 3 सेकंड के ऑडियो सैंपल से ज़ीरो-शॉट वॉइस क्लोनिंग का वादा करता है। लेकिन एक पेंच है: Mistral ने ओपन रिलीज़ से ऑडियो ऑटोएन्कोडर वेट्स हटा दिए हैं, यानी डेवलपर्स केवल Mistral की 20 प्रीसेट आवाज़ें ही इस्तेमाल कर सकते हैं, स्थानीय रूप से मनचाही आवाज़ें क्लोन नहीं कर सकते।

यह एआई कंपनियों का क्लासिक व्यवहार है: ओपन सोर्स का वादा करो, और कुछ अधूरी चीज़ डिलीवर कर दो। तकनीकी उपलब्धि असली है: Voxtral एक ऑटोरिग्रेसिव LLM बैकबोन (Ministral 3B) इस्तेमाल करता है जो 80ms के ऑडियो टोकन जनरेट करता है, साथ ही सिमेंटिक और अकॉस्टिक कंपोनेंट्स को जोड़ने वाला एक सोफिस्टिकेटेड हेड भी है। स्वतंत्र टेस्टिंग के आधार पर क्वालिटी असली लगती है। लेकिन पूरे एन्कोडर के बिना, "ओपन वेट्स" सिर्फ "डेमो वर्शन" के लिए मार्केटिंग भाषा बनकर रह जाता है।

व्यापक इकोसिस्टम पहले से ही Mistral की सीमाओं के आसपास रास्ता निकाल रहा है। कोर्स क्रिएटर्स ElevenLabs की $22/महीना सब्सक्रिप्शन के मुकाबले $0.016 प्रति हज़ार कैरेक्टर वाली API-ओनली वॉइस क्लोनिंग के इर्द-गिर्द ट्रेनिंग बना रहे हैं। CC-BY-NC लाइसेंस वैसे भी कमर्शियल सेल्फ-होस्टिंग को रोकता है, जिससे गंभीर यूज़र्स को हर हाल में Mistral के पेड API की ओर धकेला जा रहा है। कुछ शोधकर्ता यह जांच रहे हैं कि क्या गायब एन्कोडर वेट्स के बिना ऑडियो रिप्रेजेंटेशन को फिर से बनाया जा सकता है, हालांकि सफलता अभी अस्पष्ट है।

डेवलपर्स के लिए, यह "ओपन" एआई की मौजूदा स्थिति को दिखाता है: प्रभावशाली क्षमताएं, साथ में रणनीतिक सीमाएं जो यूज़र्स को पेड सर्विसेज़ की ओर धकेलती हैं। Voxtral की क्वालिटी और एफिशिएंसी उल्लेखनीय है, खासकर मल्टीलिंगुअल एप्लीकेशन्स के लिए, लेकिन वॉइस क्लोनिंग की यह कमी इसे शुरुआती वादे जितना आकर्षक नहीं रहने देती। जब तक आप प्रीसेट आवाज़ों से संतुष्ट न हों या API फीस देने को तैयार न हों, कस्टम वॉइस वर्क के लिए ElevenLabs ही बेहतर विकल्प बना रहेगा।