सर्वम AI ने बहुभाषिक उच्चार ओळखण्याच्या क्षमतेसह सारस V4 लाँच केले
भारतीय कृत्रिम बुद्धिमत्ता स्टार्टअप सर्वम एआय लाँच केले आहे सारस V4त्याच्या स्वयंचलित स्पीच रेकग्निशन (ASR) मॉडेलची नवीनतम आवृत्ती, बहुभाषिक भाषण, भारतीय भाषा आणि वास्तविक-जगातील ऑडिओ परिस्थितींवर लक्ष केंद्रित करून.
नवीन मॉडेल भारतीय भाषा आणि इंग्रजीमध्ये भाषणावर प्रक्रिया करण्यासाठी डिझाइन केलेले आहे आणि शब्दशः मजकूर, लिप्यंतरण आणि अनुवादासह लिप्यंतरणाच्या विविध प्रकारांना समर्थन देते. सर्वम एआयने मॉडेलमध्ये कोड-मिश्रित संभाषणे, बोलीतील भिन्नता आणि गोंगाट करणारा ऑडिओ हाताळण्यासाठी क्षमता देखील तयार केली आहे.
क्रेडिट्स: सर्वम एआय
Saaras V4 पाच स्पीच आउटपुट मोड ऑफर करते
Saaras V4 ऑडिओ एन्कोडरला a सह एकत्रित करते 3-अब्ज-पॅरामीटर संकरित राज्य-स्पेस भाषा मॉडेल सर्वम एआय द्वारा विकसित. आर्किटेक्चर हे मॉडेल स्पीच प्रक्रियेस मदत करण्यासाठी डिझाइन केले आहे जे स्वच्छ, प्रमाणित ऑडिओ पॅटर्नचे अनुसरण करू शकत नाही.
सर्वम AI च्या मते, मॉडेल समान ऑडिओला पाच वेगवेगळ्या आउटपुट फॉरमॅटमध्ये रूपांतरित करू शकते: शब्दशः प्रतिलेखन, सामान्यीकृत मजकूर, कोड-मिश्र मजकूर, लिप्यंतरण आणि अनुवाद.
कंपनी म्हणते की या क्षमता वेगळ्या पोस्ट-प्रोसेसिंग सिस्टमवर अवलंबून न राहता थेट मॉडेलमध्ये एकत्रित केल्या आहेत.
इंग्रजी भाषणासाठी, Saaras V4 चे मूल्यमापन भारतीय इंग्रजी, आंतरराष्ट्रीय उच्चार, मीटिंग्ज, आर्थिक संभाषणे आणि मीडिया यासारख्या क्षेत्रांचा समावेश असलेल्या सात बेंचमार्कमध्ये करण्यात आले. सर्वम एआयने सांगितले की मॉडेलने मूल्यांकन केलेल्या डेटासेटमध्ये सर्वात कमी सरासरी शब्द त्रुटी दर (WER) नोंदवला.
भारतीय भाषांसाठी, मॉडेलची चाचणी दि विस्तार बेंचमार्क 10 भाषांमध्ये. मूल्यांकनामध्ये मानक WER आणि LLM-WER दोन्ही वापरले गेले. WER लिप्यंतरण त्रुटी मोजत असताना, LLM-WER त्रुटीचा अर्थपूर्ण प्रभाव देखील विचारात घेते, जे स्वरूपन किंवा शब्दलेखन नियमांमधील फरकांपासून अर्थावर परिणाम करणारे बदल वेगळे करण्यात मदत करते.
मॉडेल भारतीय भाषा आणि गोंगाटयुक्त ऑडिओला लक्ष्य करते
भारतीय भाषा सपोर्ट हा Saaras V4 च्या डिझाइनचा मध्यवर्ती भाग आहे.
मॉडेल आपोआप बोलली जात असलेली भाषा ओळखू शकते आणि त्याच्या संबंधित मूळ लिपीत उतारा तयार करू शकते. सर्वम एआय ने अहवाल दिला 22 भारतीय भाषांमध्ये 5.22% भाषा ओळख त्रुटी दर10 सर्वाधिक बोलल्या जाणाऱ्या भाषांमध्ये हा दर 2.9% इतका होता.
Saaras V4 देखील समर्थन करते keyterm प्रॉम्प्टिंगविकासकांना नावे, उत्पादन संज्ञा, परिवर्णी शब्द आणि इतर शब्द प्रदान करण्यास अनुमती देते जे अन्यथा उच्चार ओळख मॉडेलसाठी योग्यरित्या ओळखणे कठीण होऊ शकते.
IndicContextEval बेंचमार्कवर, सर्वम AI ने WER चा अहवाल दिला L5 कीवर्ड-प्रॉम्प्टिंग सेटिंगमध्ये 16.03%.
कोड-मिश्रित भाषण हाताळण्याची मॉडेलची क्षमता संभाषणांचा समावेश असलेल्या अनुप्रयोगांसाठी देखील महत्त्वपूर्ण असू शकते जेथे स्पीकर भारतीय भाषा आणि इंग्रजी दरम्यान स्विच करतात. अनौपचारिक संभाषण, ग्राहक संवाद आणि इतर वास्तविक-जगातील सेटिंग्जमध्ये असे भाषण नमुने सामान्य आहेत.

Credits: Swarajya
Saaras V4 स्ट्रीमिंग आणि डेव्हलपर ऍक्सेस आणते
सर्वम एआयने सारस V4 अनुप्रयोगांसाठी योग्य बनविण्यावर देखील लक्ष केंद्रित केले आहे ज्यांना जवळच्या-रिअल-टाइम स्पीच रेकग्निशनची आवश्यकता आहे.
मॉडेलला सपोर्ट करते असे कंपनीचे म्हणणे आहे 150 मिलिसेकंदांपेक्षा कमी वेळेच्या टोकनसह प्रवाह. हे शॉर्ट-फॉर्म ऑडिओवर प्रक्रिया देखील करू शकते, त्याचा संभाव्य वापर लहान व्हॉइस कमांडच्या पलीकडे विस्तारित करते.
विकासक सर्वम AI च्या API द्वारे Saaras V4 मध्ये प्रवेश करू शकतात, यासाठी समर्थन आहे Python आणि Node.js SDKs. मॉडेलसह प्लॅटफॉर्मसह देखील एकत्रित केले जाऊ शकते Vercel AI SDK, LiveKit एजंट आणि Pipecat एजंट.
API यासह मोड्सद्वारे मॉडेलच्या विविध स्पीच प्रोसेसिंग क्षमतांमध्ये प्रवेश प्रदान करते लिप्यंतरण, भाषांतर, लिप्यंतरण, शब्दशः आणि कोडमिक्स.
Saaras V4 सह, सर्वम AI फक्त ट्रान्सक्रिप्शन टूल ऐवजी एक व्यापक बहुभाषिक पायाभूत लेयर म्हणून स्पीच रेकग्निशनला स्थान देत आहे. भारतीय भाषा, कोड-मिश्रित भाषण, संदर्भात्मक संज्ञा आणि भिन्न आउटपुट स्वरूप यावर त्याचे लक्ष केंद्रित ऑडिओ वातावरणाच्या बाहेर भाषण AI तैनात करण्यात गुंतलेली आव्हाने प्रतिबिंबित करते.
भारताच्या भाषिक विविधतेला अनुसरून एआय सिस्टीम तयार करण्यावर सर्वम एआयचे लक्ष देखील प्रक्षेपण विस्तारित करते. भाषा ओळख, संदर्भात्मक प्रॉम्प्टिंग आणि एकाधिक ट्रान्सक्रिप्शन फॉरमॅट्स एकत्र करून, Saaras V4 चा उद्देश ग्राहक समर्थन, व्हॉइस इंटरफेस, मीटिंग्ज आणि इतर ऍप्लिकेशन्स यासारख्या वापरासाठी आहे जिथे भाषांमध्ये अचूक उच्चार प्रक्रिया महत्त्वाची आहे.
Comments are closed.