मूनशॉट एआय ने किमी के 3 चे अनावरण केले, जगातील सर्वात मोठे ओपन-वेट एआय मॉडेल: काय जाणून घ्यावे

एआय शर्यतीत चीन अमेरिकेसोबतची दरी कमी करत असल्याचे दिसते. Moonshot AI, AI मॉडेल्सच्या किमी फॅमिलीमागील चायनीज लॅब, Kimi K3, त्याचे नवीनतम ओपन-वेट मॉडेल अनावरण केले आहे. रिलीझ झाल्यापासून, मॉडेलने यूएस लॅबमधून आघाडीच्या बंद-स्रोत प्रणालींशी संपर्क साधणारी कामगिरी वितरीत करण्याकडे लक्ष वेधले आहे.
Kimi K3 हे 2.8 ट्रिलियन पॅरामीटर मॉडेल आहे जे मूनशॉट म्हणते की ही जगातील सर्वात मोठी ओपन-वेट AI प्रणाली आहे. कंपनीच्या मते, ते अँथ्रोपिकच्या क्लॉड फेबल आणि ओपनएआयच्या GPT-5.6 च्या जवळ कार्यप्रदर्शन देते. मॉडेल एक-दशलक्ष-टोकन संदर्भ विंडो आणि मूळ मल्टीमोडल क्षमतांना देखील समर्थन देते, ज्यामुळे ते मजकुरासह प्रतिमांवर प्रक्रिया करू शकते.
Kimi K3 हे 896 तज्ञ नेटवर्कसह मिश्रण-ऑफ-एक्सपर्ट (MoE) आर्किटेक्चर वापरते, ज्यापैकी फक्त 16 कोणत्याही दिलेल्या विनंतीसाठी सक्रिय केले जातात. हे प्रत्येक वेळी पूर्ण पॅरामीटर संख्या गुंतवून ठेवण्याऐवजी विशेष उप-नेटवर्कवर कार्ये रूट करण्यास अनुमती देते. हे दोन आर्किटेक्चरल नवकल्पना देखील सादर करते – किमी डेल्टा अटेन्शन आणि अटेन्शन रेसिड्यूअल्स – माहिती मॉडेलच्या स्तरांवर टिकून राहण्यासाठी डिझाइन केलेले. Moonshot म्हणतो की हे बदल किमी K2 च्या तुलनेत स्केलिंग कार्यक्षमतेत सुमारे 2.5 पट वाढ करतात, मॉडेलला अतिरिक्त गणना आणि प्रशिक्षण डेटा अधिक कार्यक्षमतेने सुधारित क्षमतेमध्ये रूपांतरित करण्यास सक्षम करते.
काही 3 कामगिरी
जेव्हा कार्यप्रदर्शनाचा विचार केला जातो तेव्हा, सहा मोठ्या प्रमाणात वापरल्या जाणाऱ्या कोडिंग बेंचमार्कच्या संचामध्ये, Kimi K3 बहुतेक श्रेणींमध्ये प्रथम किंवा द्वितीय स्थानावर आहे, Moonshot च्या बेंचमार्क प्रेझेंटेशननुसार अनेक उदाहरणांमध्ये फक्त Claude Fable 5 च्या मागे आहे. हे फ्रंटियर SWE वर तिसरे, किमी-इंटर्नल कोडिंग बेंचमार्क आणि टर्मिनल-बेंच 2.1 वर दुसरे आणि प्रोग्रामबेंच आणि SWE-मॅरेथॉन या दोन्हींवर पहिले आहे. एजंटिक बेंचमार्क्सवर, मूलत: एकच प्रश्नांची उत्तरे देण्याऐवजी अनेक टप्प्यांवर स्वायत्ततेने मॉडेलची क्षमता मोजणाऱ्या चाचण्या, Kimi K3 पुन्हा आठ वेगवेगळ्या मूल्यमापनांमध्ये शीर्षस्थानी किंवा जवळ आहे, फक्त Fable 5 आणि GPT-5.6 च्या मागे आहे.
सर्वात लक्षणीय परिणामांपैकी एक फ्रंट-एंड कोडिंग मूल्यमापनातून आला आहे, जिथे किमी K3 ने एकूण प्रथम क्रमांक मिळवला आहे, त्याच्या पूर्ववर्ती साठी 18 व्या स्थानावरून उडी आहे. सातपैकी सहा मोजलेल्या डोमेनमध्ये (ब्रँडिंग, संदर्भ-आधारित डिझाइन, डेटा विश्लेषण, ग्राहक उत्पादने, सिम्युलेशन आणि सामग्री साधने) हे शीर्षस्थानी आहे, गेमिंग-संबंधित कार्यांमध्ये दुसऱ्या क्रमांकावर आहे. हेड-टू-हेड तुलनांमध्ये जेथे प्रतिस्पर्धी मॉडेल्सच्या विरूद्ध आउटपुटचा थेट न्याय केला गेला, किमी K3 ला सरासरी 76 टक्के वेळेस प्राधान्य दिले गेले, जे फेबल 5 आणि GPT-5.6 साठी अंदाजे 58 टक्के होते.
(प्रतिमा: मूनशॉट AI)
मॉडेलने कोडिंगच्या बाहेरही चांगली कामगिरी केली. सामान्य मजकूर आणि लेखन मूल्यमापनांवर, ते एकत्रित लीडरबोर्डवर 38 व्या ते 9 व्या स्थानावर गेले, सर्जनशील लेखन, कोडिंग आणि सूचना-अनुसरणासाठी पहिल्या दहामध्ये आणि तीन व्यावसायिक श्रेणींमध्ये प्रथम: भौतिक आणि सामाजिक विज्ञान, कायदेशीर आणि सरकारी कार्य आणि औषध आणि आरोग्यसेवा. स्वतंत्रपणे ट्रॅक केलेल्या अंतर्गत संपादकीय-लेखन बेंचमार्कवर, ते लीडरबोर्डमध्ये शीर्षस्थानी असणारे पहिले ओपन-वेट मॉडेल म्हणून नोंदवले गेले, जे फेबल 5 ला मागे टाकले.
वित्त आणि कोडिंग कार्य यासारख्या अंदाजे आर्थिकदृष्ट्या उपयुक्त कार्यांसाठी असलेल्या व्यापक “वास्तविक-जागतिक कार्य” निर्देशांकांवर किंवा बेंचमार्कवर, Kimi K3 ने Fable 5 च्या खाली, GPT-5.6, Sonnet 5, Opus 4.8, आणि अलीकडेच रिलीझ केलेले Meta मॉडेल याच्या पुढे आहे. टर्मिनल-बेंच, ह्युमॅनिटीज लास्ट एक्झाम आणि GPQA डायमंड यासह नऊ मुल्यांकनांच्या संमिश्र निर्देशांकावर, तो GPT-5.6 आणि Fable 5 च्या मागे तिसऱ्या स्थानावर आहे परंतु विशेषत: दोन्हीच्या जवळ आहे.
मूनशॉटने 3D एक्सप्लोरेशन गेमसह खेळण्यायोग्य ब्राउझर-आधारित गेम तयार करणे यासारख्या मोठ्या, बहु-चरण एजंटिक कार्ये पूर्ण करणाऱ्या मॉडेलची उदाहरणे दाखवली; गेम बॉय ॲडव्हान्स एमुलेटर; आणि मल्टीप्लेअर-शैलीतील रिंगण नेमबाज, ॲनिमेटेड मोशन-ग्राफिक्स स्पष्टीकरणक तयार करणे, डझनभर स्त्रोत क्लिपमधून संकलित व्हिडिओ संपादित करणे आणि ओपन-सोर्स चिप डिझाइन टूल्सचा वापर करून बहु-तास स्वायत्त रनद्वारे फंक्शनल कॉम्प्युटर चिप डिझाइन करणे.
प्रतिक्रिया आणि खुले प्रश्न
यावर संमिश्र प्रतिक्रिया उमटल्या आहेत. प्रतिस्पर्धी प्रयोगशाळांशी संबंधित लोकांसह काही निरीक्षकांनी असे सुचवले आहे की चीनी आणि अमेरिकन फ्रंटियर लॅबमधील अंतर खूपच कमी झाले आहे. इतरांनी मागे ढकलले आहे, असा युक्तिवाद करून की चमकदार डेमो-शैलीचे आउटपुट (गेम, डॅशबोर्ड आणि व्हिज्युअल UI कार्य) विद्यमान मोठ्या कोडबेसमध्ये नेव्हिगेट करणे आणि डीबग करणे यासारख्या कठीण, कमी दृश्यमान कार्यांवर कार्यप्रदर्शन दर्शवत नाहीत.
चर्चेचा एक वेगळा मुद्दा असा आहे की Kimi K3 च्या प्रकाशनात CyberGym वर प्रकाशित स्कोअरचा समावेश नाही, हा बेंचमार्क मॉडेलच्या सायबर-आक्षेपार्ह क्षमतेचे मूल्यांकन करण्यासाठी वापरला जातो. या प्रकारच्या बेंचमार्कवरील स्कोअरने यापूर्वी इतर फ्रंटियर मॉडेल्सवर निर्यात निर्बंध आणले आहेत. आणि, प्रकाशित परिणामाच्या अनुपस्थितीमुळे मॉडेलचे त्यावर मूल्यमापन केले गेले की नाही आणि या क्षमतेच्या पातळीचे ओपन-वेट मॉडेल पुढे जाऊन कसे नियंत्रित केले जातात याचा परिणाम काय असू शकतो याविषयी अनुमान काढले गेले आहे.
किमी K3 च्या चर्चेचा एक महत्त्वाचा भाग खर्चाभोवती फिरतो. त्याची किंमत $3 प्रति दशलक्ष इनपुट टोकन आणि $15 प्रति दशलक्ष आउटपुट टोकन आहे. आर्टिफिशियल ॲनालिसिस 'कॉस्ट प्रति इंटेलिजेंस मेट्रिक नुसार, ते सरासरी $0.94 प्रति समतुल्य बेंचमार्क टास्क आहे—जीपीटी-5.6 प्रमाणे आणि क्लॉड ओपस 4.8 च्या अंदाजे अंदाजे किंमत सुमारे $1.80 आहे. स्वतंत्रपणे, Moonshot चा दावा आहे की Kimi K3 ची किंमत अनेक कोडिंग बेंचमार्क्सवर प्रतिस्पर्धी फ्रंटियर मॉडेल्सपेक्षा 60-80 टक्के कमी आहे आणि काही मूल्यमापनांमध्ये त्यांच्याशी जुळवून घेताना किंवा त्यापेक्षा जास्त कामगिरी करत आहे.
Comments are closed.