ओपनएआय म्हणते की ऑक्टोबर GPT-6 GPT-5.6 पेक्षा जेलब्रेक करणे कठिण आहे – परंतु त्याच्या स्वतःच्या चाचण्या काही सुरक्षा प्रतिगमन दर्शवतात
GPT-6 Sol पात्र सशुल्क ChatGPT वापरकर्त्यांसाठी रोल आउट करत आहे, तर GPT-6 लुना फ्री आणि गो वापरकर्त्यांसाठी रोल आउट करत आहे.
ऑक्टोबरच्या आवृत्त्या ग्राहक उत्पादनातील पूर्वीच्या GPT-5.6 सोल आणि GPT-5.6 लुना मॉडेल्सची जागा घेतात आणि कोडेक्स आणि ChatGPT वर्कमध्ये वापरल्या जाणाऱ्या आवृत्त्या आता सप्टेंबरच्या रिलीझमध्ये राहतील.
नियमित लॉन्च नोटपेक्षा सोबत असलेले सिस्टम कार्ड अधिक मनोरंजक आहे. हे असे मॉडेल दर्शविते जे एकूणच जेलब्रेक करणे कठीण आहे, तरीही अनेक वैयक्तिक सुरक्षा बेंचमार्कवर स्पष्ट प्रतिगमन नोंदवतात आणि त्या तणावाचे काळजीपूर्वक परीक्षण करणे योग्य आहे.
“उच्च क्षमता” म्हणजे काय?
OpenAI च्या पूर्वतयारी फ्रेमवर्क अंतर्गत, कंपनी या दोघांवर उपचार करत आहे ऑक्टोबर GPT-6 सायबर सुरक्षा आणि जैविक आणि रासायनिक डोमेनमध्ये उच्च क्षमता म्हणून मॉडेल. कोणतेही मॉडेल AI स्वयं-सुधारणेसाठी उच्च थ्रेशोल्डपर्यंत पोहोचत नाही आणि जीवशास्त्र आणि रसायनशास्त्रात, सोलने नोंदवलेले सूचक क्रिटिकल थ्रेशोल्ड ओलांडले नाही, तर OpenAI म्हणते की Luna साठी स्वतंत्र गंभीर चाचणी आवश्यक नव्हती कारण ती उच्च-क्षमता मूल्यमापनांवर GPT-5.6 Sol पेक्षा कमी गुण मिळवते.
OpenAI च्या पूर्वतयारी फ्रेमवर्क अंतर्गत, “उच्च क्षमता” म्हणजे मॉडेल गंभीर हानीसाठी विद्यमान मार्ग वाढवू शकते. या स्तरावरील मॉडेल्समध्ये सुरक्षितता असणे आवश्यक आहे जे ते तैनात करण्यापूर्वी संबंधित जोखीम पुरेसे कमी करतात.
मजबूत जेलब्रेक प्रतिकार, मिश्रित सुरक्षा स्कोअर
ऑक्टोबर मॉडेल्स outperform तरी GPT-5.6 Sol चाचणी केलेल्या आक्रमणकर्त्यांच्या बजेटमध्ये, त्यांचे अनुकूली मल्टी-टर्न जेलब्रेक स्कोअर सप्टेंबरच्या GPT-6 आवृत्त्यांपेक्षा किंचित कमी आहेत, मोठ्या प्रमाणावर आत्मविश्वास मध्यांतरांसह.
मॉडेल अप्रामाणिकता, फसवणूक आणि रेलिंगला टाळण्याचा प्रयत्न देखील कमी दर्शवतात. संरेखन मूल्यमापन जे मॉडेल निर्बंधांचा आदर करतात किंवा मर्यादा लपवतात की नाही हे मोजतात. मानसिक आरोग्य, भावनिक अवलंबन आणि स्वत: ची हानी यासाठी OpenAI च्या स्वतंत्र डायनॅमिक मल्टी-टर्न मूल्यमापनांनी संबंधित GPT-5.6 मॉडेल्समधील सांख्यिकीयदृष्ट्या महत्त्वपूर्ण फरक दर्शविला नाही.
त्याच वेळी, उत्पादन बेंचमार्क जे आव्हानात्मक, उत्पादन-व्युत्पन्न प्रॉम्प्ट्स वापरतात ते संबंधित GPT-5.6 ऑगस्ट मॉडेलच्या तुलनेत सांख्यिकीयदृष्ट्या महत्त्वपूर्ण प्रतिगमन प्रकट करतात जेथे GPT-6 सोलने मानक स्व-हानी सुरक्षा बेंचमार्कवर सांख्यिकीयदृष्ट्या महत्त्वपूर्ण रीग्रेशन दर्शवले, तर GPT-6 Luna रीग्रेशन, सेल्फ-रिग्रेशन आणि सेल्फ-हानिमार्क मानकांवर.
स्वतंत्रपणे, OpenAI च्या U18 सुरक्षा मूल्यांकनांवर, दोन्ही मॉडेल्स वयोमर्यादित सामग्री, लैंगिक सामग्री आणि भावनिक अवलंबनावर लक्षणीयरीत्या मागे गेले; लुना देखील गोरावर मागे गेली.
दोन्ही मॉडेल्स वय-प्रतिबंधित सामग्री, लैंगिक सामग्री आणि भावनिक अवलंबनावर मागे गेले. लुनाला गोरेवर अतिरिक्त प्रतिगमन सहन करावे लागले.
OpenAI म्हणते की हे बेंचमार्क जाणूनबुजून कठीण लांब-पुच्छ केसेसवर ताण देतात आणि सर्व रनटाइम सेफगार्ड्स समाविष्ट करत नाहीत, त्यामुळे कच्च्या स्कोअरला सामान्य-वापरकर्ता हानी दरांचा थेट अंदाज मानला जाऊ नये.
मॅन्युअल पुनरावलोकनात असे आढळले की उल्लंघनात्मक प्रतिसाद सीमारेषेवर होते परंतु सामान्यतः कमी तीव्रता; उदाहरणार्थ, मॉडेल्सने काहीवेळा स्वत:ला हानी पोहोचवणाऱ्या माहितीच्या प्रश्नांची उत्तरे दिली आणि तरीही स्वत:ला हानी पोहोचवणाऱ्या विनंत्या नाकारल्या.
U18 वापरकर्त्यांसाठी, ओपनएआय स्वयं-हानी, लैंगिक सामग्री, किंवा रक्ताचा समावेश असलेल्या प्रतिसादांना अतिरिक्त वर्गीकरण-आधारित ब्लॉक लागू करते; ही संरक्षणे कच्च्या U18 बेंचमार्क स्कोअरमध्ये परावर्तित होत नाहीत.
उपयुक्तता विरुद्ध नकार
दोन प्रमुख ऑपरेशनल बदलांद्वारे सुरक्षितता-विरुद्ध-उपयुक्तता ट्रेड-ऑफ बेंचमार्कमधील बदल हा एक नमुना आहे जेथे OpenAI चे सेफ्टी पॅरेटो विश्लेषण ट्रेड-ऑफ दर्शविते: ऑक्टोबर मॉडेल्स सौम्य विनंत्या नाकारण्याची किंवा जास्त सावधगिरी जोडण्याची शक्यता कमी असते, परंतु काही हानिकारक-विनंत्या caa सुरक्षिततेवर ते कमी गुण मिळवतात.
तो ट्रेड-ऑफ स्वीकार्य आहे की नाही हे एखाद्याचे वजन जास्त-नकार विरुद्ध कमी-नकार किती आहे यावर अवलंबून असते. ओपनएआय एकूण सुरक्षा प्रोफाइल निःसंदिग्धपणे मजबूत असल्याचा दावा न करता सुधारणा आणि प्रतिगमन दोन्ही सादर करते.
क्षमता संदर्भ आणि उर्वरित सुरक्षा उपाय
OpenAI म्हणते की हे उच्च क्षमता वर्गीकरण संबंधित GPT-5.6 मॉडेल्सना आधीपासून नियुक्त केलेल्या वर्गीकरणांशी जुळतात. सायबर आणि जैविक/रासायनिक क्षमतेमधील उच्च वर्गीकरण संबंधित सुरक्षा उपायांसह आहेत. जीवशास्त्र-संबंधित नकार मूल्यमापनांवर, ऑक्टोबर मॉडेल्स त्यांच्या GPT-5.6 समकक्षांच्या तुलनेत प्रत्यक्षात सुधारले. सायबरसुरक्षा सुरक्षा स्कोअर व्यापकपणे तुलना करण्यायोग्य राहिले.
कठीण प्रॉम्प्ट सेटवरील वस्तुस्थिती मूल्यमापन देखील बहुतेक मेट्रिक्समध्ये सुधारले आहे. हेल्थबेंच प्रोफेशनलवरील त्यांच्या GPT-5.6 समकक्षांपेक्षा B मॉडेल्स सुधारले आहेत. लूनाने मेंटलहेल्थबेंचच्या तीव्रतेच्या पातळीमध्ये लक्षणीय सुधारणा केली, तर सोलमध्ये देखील सुधारणा झाली, ज्यामध्ये आपत्कालीन संभाषणांमध्ये सर्वात मोठा फायदा झाला.

निकाल काळजीपूर्वक वाचा
बेंचमार्क प्रतिगमन सामान्य वापरकर्त्यांसाठी हानिकारक वर्तनाच्या उच्च दरांमध्ये स्वयंचलितपणे अनुवादित होत नाही. मूल्यमापन कठोर, लांब-शेपटी प्रकरणांना लक्ष्य करते. सिस्टम-स्तरीय संरक्षण—वर्गीकरण, संकट-संसाधन मार्ग, पालक नियंत्रणे आणि इतर स्तर—बेस मॉडेलच्या शीर्षस्थानी बसतात.
तरीही, केवळ नफ्यावर भर देण्यापेक्षा प्रतिगमन प्रकाशित करण्याचा निर्णय लक्षणीय आहे. हे बाहेरील निरीक्षकांना नवीन मॉडेल्स कोठे पुढे सरकले आणि ते कुठे बाजूला किंवा मागे सरकले याचे स्पष्ट दृश्य देते.
वापरकर्ते आणि विकासकांसाठी व्यावहारिक प्रश्न हा आहे की निव्वळ बदल वास्तविक-जगातील परिणाम सुधारतो का. OpenAI चा स्वतःचा डेटा जेलब्रेक आणि फसवणुकीवर अधिक प्रतिरोधक मॉडेल दर्शवितो, विशिष्ट सुरक्षितता श्रेणींवर मोजता येण्याजोग्या थेंबांसह, ज्याला कंपनी पुनरावलोकनानंतर कमी-तीव्रतेचे ठरवते.
ऑक्टोबर मॉडेल्सचा त्यांच्या स्वत:च्या वापराच्या प्रकरणांसाठी न्याय करताना तुरूंगातून बाहेर पडण्याच्या प्रतिकारातील प्रकाशित नफा विशिष्ट सुरक्षितता श्रेणींवरील मोजलेल्या थेंबांपेक्षा जास्त आहेत की नाही हे तुम्ही अद्याप ठरवले पाहिजे.
Comments are closed.