Cohere ने Transcribe जारी किया है, एक ऑटोमैटिक स्पीच रिकग्निशन मॉडल जो स्टैंडर्ड बेंचमार्क पर 5.42% औसत वर्ड एरर रेट हासिल करता है, और Hugging Face के Open ASR Leaderboard पर टॉप स्पॉट होने का दावा करता है। यह मॉडल एक हल्के Transformer डिकोडर के साथ जोड़े गए Conformer एनकोडर का इस्तेमाल करता है, और अंग्रेजी, चाइनीज, जापानी और अरबी समेत 14 भाषाओं को सपोर्ट करता है। आमने-सामने की ह्यूमन एवैल्यूएशन में, एनोटेटर्स ने 78% बार IBM Granite के मुकाबले और 64% बार OpenAI के Whisper Large v3 के मुकाबले Cohere के ट्रांसक्रिप्ट को तरजीह दी।
यह टेक्स्ट जनरेशन से आगे स्पीच प्रोसेसिंग में Cohere की पहली बड़ी पहल है, एक रणनीतिक कदम, क्योंकि एंटरप्राइज को बड़े पैमाने पर ऑडियो डेटा प्रोसेस करने की जरूरत लगातार बढ़ रही है। यहां Conformer आर्किटेक्चर समझ में आता है, लोकल एकॉस्टिक फीचर्स के लिए CNN और ग्लोबल कॉन्टेक्स्ट के लिए Transformer को जोड़ना शुद्ध अटेंशन मैकेनिज्म से बेहतर तरीके से असली ASR चुनौतियों को हल करता है। हालांकि, लंबे कॉन्टेंट के लिए मॉडल की 35-सेकंड ऑडियो चंक की सीमा उन मेमोरी सीमाओं को उजागर करती है जो अब भी प्रोडक्शन स्पीच सिस्टम को परेशान करती हैं।
गौर करने वाली बात यह है कि Cohere का सिर्फ 14 भाषाओं वाला "क्वालिटी ओवर क्वांटिटी" तरीका सीधे Whisper के 100+ भाषा सपोर्ट को टक्कर देता है। बेंचमार्क प्रभावशाली दिखते हैं, पर एंटरप्राइज ASR उस उलझी हुई हकीकत में जीता है जिसमें एक्सेंट वाला भाषण, बैकग्राउंड नॉइज़, और डोमेन-स्पेसिफिक शब्दावली होती है, जिसे स्टैंडर्ड टेस्ट सेट कैप्चर नहीं करते। ह्यूमन प्रेफरेंस मेट्रिक्स ज्यादा कुछ बताते हैं, असली यूजर उन क्वालिटी फर्क को पहचान सकते हैं जिन्हें WER स्कोर पकड़ ही नहीं पाते।
स्पीच एप्लीकेशन बनाने वाले डेवलपर्स के लिए, यह OpenAI और ElevenLabs से आगे एक और मजबूत विकल्प देता है, खासकर अगर आपको सेल्फ-होस्टेड डिप्लॉयमेंट चाहिए। 35-सेकंड चंकिंग की सीमा का मतलब है कि लंबे ऑडियो के लिए आपको अब भी प्रीप्रोसेसिंग पाइपलाइन चाहिए होगी, पर एक्युरेसी में बढ़त शायद इस इंजीनियरिंग बोझ को जायज ठहरा दे। अपने असली डेटा पर टेस्ट करना फायदेमंद रहेगा, बेंचमार्क शायद ही कभी प्रोडक्शन ऑडियो के संपर्क में आने के बाद भी टिके रहते हैं।
