Meta ने पाच भारतीय भाषांसाठी स्थानिक समर्थनासह 'म्युज व्हॉईस ट्रान्सक्राइब' लाँच केले
Meta ने म्यूज व्हॉईस ट्रान्स्क्राइब लाँच केले आहे, त्याचे पहिले रिअल-टाइम ऑडिओ-परसेप्शन मॉडेल, पाच प्रमुख भारतीय भाषा आणि जागतिक स्तरावर 70 पेक्षा जास्त भाषांना समर्थन देते. मॉडेल स्ट्रीमिंग ट्रान्सक्रिप्शन, स्पीकर डायरिएशन, कोड-स्विचिंग, अनुकूली विलंब आणि सुधारित अचूकता, मेटा एआय आणि म्यूज कोड ऍप्लिकेशन्सची शक्ती देते.
प्रकाशित तारीख – 2 सप्टेंबर 2026, दुपारी 12:07
नवी दिल्ली: यूएस-आधारित तंत्रज्ञान क्षेत्रातील दिग्गज मेटाने आपले पहिले रिअल-टाइम ऑडिओ-परसेप्शन मॉडेल सादर केले आहे – म्यूज व्हॉईस ट्रान्स्क्राइब – जे पाच प्रमुख भारतीय भाषा आणि प्रगत स्ट्रीमिंग वैशिष्ट्यांसाठी मूळ समर्थन देते. म्युज व्हॉईस ट्रान्स्क्राइब – मेटा सुपरइंटिलिजन्स लॅब्सने विकसित केले आहे – स्ट्रीमिंग ट्रान्सक्रिप्शन, तासाहून अधिक रेकॉर्डिंगमध्ये 20 पेक्षा जास्त आवाजांमध्ये स्पीकर वेगळे करणे, नेटिव्ह कोड-स्विचिंग आणि पोस्ट-प्रोसेसिंग स्टेपशिवाय एकाच मॉडेलमधून डायराइझेशन, कंपनीने एका निवेदनात म्हटले आहे.
म्युझ व्हॉईस ट्रान्स्क्राइब लाँचच्या वेळी 25 प्रमाणित असलेल्या अनेक देशांमध्ये बोलल्या जाणाऱ्या 70 हून अधिक भाषांमध्ये प्रशिक्षित केले जाते. “1 सप्टेंबर 2026 पर्यंत आर्टिफिशियल ॲनालिसिस स्ट्रीमिंग स्पीच-टू-टेक्स्ट लीडरबोर्डवर ते पहिल्या क्रमांकावर आहे,” असे निवेदनात म्हटले आहे.
Meta Model API द्वारे उपलब्ध आणि Mac आणि Muse Code साठी Meta AI मध्ये आधीपासून श्रुतलेख चालू आहे, Muse Voice Transcribe रिअल-टाइम ऑटोमॅटिक स्पीच रेकग्निशन, 20 पेक्षा जास्त स्पीकरसह डायरिएशन आणि एंडपॉइंटिंग प्रदान करते.
हे अखंड कोड-स्विचिंगसह बहुभाषिक आहे आणि भाषा, कीवर्ड आणि संदर्भ बायसिंगसह अचूकता सुधारते. “मॉडेल अंदाज लावण्यासाठी जितका जास्त वेळ थांबेल तितका उतारा अधिक अचूक, परंतु विलंब जास्त. म्युझ व्हॉईस ट्रान्स्क्राइबमध्ये “ॲडॉप्टिव्ह विलंब” आहे, अडचणावर आधारित प्रत्येक शब्दासाठी डायनॅमिकली बदलणारा विलंब,” स्टेटमेंटमध्ये नमूद केले आहे.
हे रीइन्फोर्समेंट लर्निंग (RL) सह सक्षम केले आहे, जेथे शब्द त्रुटी दर (WER) पुरस्कार आणि विलंब बक्षीस गुणाकाराने एकत्र केले जातात. “म्युज व्हॉइस ट्रान्स्क्राइब हे म्युज स्पार्क कुटुंबातील एक ऑटोरिग्रेसिव्ह मल्टीमोडल मॉडेल आहे,” मेटा म्हणाला.
हे स्पष्ट केले आहे की ऑडिओवर 80 ms भागांमध्ये (12.5 Hz) प्रक्रिया केली जाते, त्यातील प्रत्येक एका सॉफ्ट टोकनमध्ये बदलला जातो. प्रत्येक ऑडिओ भागावर, मॉडेल एकतर पुढील ऑडिओ भाग ऐकणे सुरू ठेवण्याचा किंवा मजकूर टोकन उत्सर्जित करण्याचा निर्णय घेतो.
ॲडॉप्टिव्ह विलंबाने, म्युझ व्हॉईस ट्रान्स्क्राइबने अंतिम ट्रान्सक्रिप्शनपर्यंत वेळेनुसार मोजलेल्या गती-अचूकता ट्रेड-ऑफवर पॅरेटो आघाडीवर यश मिळवले, असे कंपनीने म्हटले आहे.
Comments are closed.