फ्रंटियर एआय लॅब अजूनही सांगणार नाहीत की त्यांच्यात एक रॉग मॉडेल कसा असेल
ए नुसार, काही शीर्ष AI लॅब्सनी प्रतिबंधित प्रतिसाद योजना प्रकाशित किंवा प्रदर्शित केल्या आहेत अलीकडील अभ्यास. एक कंटेनमेंट प्लॅन हे स्पष्ट करते की एकदा एआय मानवी नियंत्रणाला भंग करण्याचा प्रयत्न करत असताना काय होते – कोणता प्रवेश कट होतो आणि जेव्हा सिस्टम पूर्णपणे बंद होते.
गाइडलाइट एआय स्टँडर्ड्स, सुरक्षित सीमारेषेच्या AI विकास पद्धतींचा प्रचार करण्यासाठी समर्पित संस्था, ज्याने या परिस्थितीसाठी नेमक्या किती तयार आहेत यावर पाच आघाडीच्या प्रयोगशाळा श्रेणीबद्ध केल्या आहेत. OpenAI वर आला; एन्थ्रोपिक आणि मेटा यांनी सर्वात कमी गुण मिळवले. एजंटिक AI कंपन्यांच्या स्वतःच्या सिस्टीममध्ये अधिक स्वायत्त भूमिका घेते आणि कॅलिफोर्निया आणि न्यूयॉर्कमधील नियामकांना प्रकटीकरण आवश्यक असल्याने निष्कर्ष महत्त्वाचे आहेत. ही मॉडेल्स तयार करणाऱ्या किंवा त्यामध्ये गुंतवणूक करणाऱ्या प्रत्येकासाठी, प्रत्येक प्रयोगशाळा ऑपरेशनल जोखमीच्या विरूद्ध त्याबद्दल कशाप्रकारे बोलतो हे किती गांभीर्याने हाताळते हे एक दुर्मिळ स्वतंत्र वाचन आहे.
Guidelight चे मूल्यमापन Anthropic, Google, OpenAI, Meta, आणि xAI कडून सार्वजनिकरित्या उपलब्ध योजनांवर आधारित होते, ज्यामध्ये प्रत्येक कंपनी तिची AI सिस्टीम आंतरिकरित्या काय करत आहे हे किती चांगले लॉग करते आणि निरीक्षण करते, ध्वजांकित गैरवर्तनाच्या वाढीनंतर सिस्टम थांबवते का, स्वतंत्र तृतीय पक्ष त्याचे मॉडेल शोधत आहेत आणि त्याचे नियंत्रण काय आहे आणि त्याचे नियंत्रण काय आहे हे शोधून काढणारे प्लॅन्स प्रकाशित करतात. रुळांवरून जातो.
AI कंपन्या त्यांच्या वाढत्या सक्षम आणि एजंटिक मॉडेल्सचा समावेश करू शकतील की नाही याविषयी चिंता वाढली आहे की हाय-प्रोफाइल सायबरसुरक्षा घटनांच्या मालिकेमुळे ज्यामध्ये OpenAI, Anthropic आणि Meta मधील मॉडेल्सना सुरक्षिततेच्या मूल्यांकनादरम्यान इंटरनेटवर अनपेक्षित प्रवेश मिळाला आणि बाह्य प्रणालींमध्ये हॅक केले गेले.
एआय कंपन्या सार्वजनिकरित्या सुरक्षिततेकडे कसे पोहोचत आहेत यामधील फरक ठळकपणे दर्शवितात कारण ते एजंटिक तैनाती अशा वातावरणात वाढवतात जिथे एआय सिस्टम मोठ्या प्रमाणात कृती करू शकतात. काही AI कंपन्यांनी तैनातीपूर्वी धोकादायक क्षमतांसाठी त्यांच्या मॉडेल्सची चाचणी कशी केली याची तपशीलवार माहिती दिली असताना, त्यांच्या सिस्टममध्ये आधीपासूनच कार्यरत मॉडेल्स चुकीचे वागतात तेव्हा काय होते याबद्दल ते सामान्यत: कमी बोलले आहेत.
“मला आश्चर्य वाटले की एआय कंपन्यांनी किती कमी सांगितले आहे की त्यांचे मॉडेल एखाद्या अर्थाने त्यांच्या नियंत्रणातून सुटले तर ते एक अतिशय गंभीर घटना कशी हाताळतील,” स्टीव्हन ॲडलर, गाइडलाइटचे मुख्य शास्त्रज्ञ आणि माजी ओपनएआय सुरक्षा संशोधक यांनी रीडला सांगितले.
Guidelight कंटेनमेंट प्लॅनची व्याख्या “पूर्व-निर्दिष्ट योजना, जेव्हा AI नियंत्रण मोडीत काढण्याचा प्रयत्न करत असल्याचे आढळले तेव्हा ट्रिगर होते, ज्यामध्ये मॉडेलमधून कोणत्या परवानग्या रद्द करायच्या, मॉडेल कोणासाठी, कोणत्या मर्यादांनुसार कार्य करणे सुरू ठेवू शकते आणि ते पूर्णपणे ऑफलाइन केव्हा घ्यायचे हे समाविष्ट करते.”
ॲडलर म्हणाले, “आत्ता फ्रंटियर एआय कंपन्यांमधील आघाडीची मॉडेल्स काही अर्थाने चुकीची आहेत असा विचार करण्याचे चांगले कारण आहे.” “जेव्हा मॉडेल कंपनीच्या वतीने काम करत असतात, तेव्हा कंपनीने एआय काय करत आहे हे सांगण्यास सक्षम होण्यासाठी त्याच्याभोवती काही मचान असावेत, चुकीच्या संरेखनाची चिन्हे शोधून काढली पाहिजेत, ती कृती करण्यापूर्वी त्याला काहीतरी धोकादायक करण्यापासून थांबवावे आणि सामान्यत: त्यांच्या हातावर आणीबाणीची परिस्थिती उद्भवल्यास ते काय करतील याची योजना आखली पाहिजे.”
आजपर्यंत, आपत्तीजनक जोखमीचे व्यवस्थापन करण्यासाठी असलेल्या बहुतांश योजना अजूनही मोठ्या प्रमाणावर कंपन्यांवर उरलेल्या आहेत. गाइडलाइटच्या अहवालात असे म्हटले आहे की सर्वोत्कृष्ट सार्वजनिक पुरावे असे दर्शवतात की कंपन्यांकडे “आपत्कालीन परिस्थितीसाठी काही प्रतिबंध प्रोटोकॉल तयार आहेत.”
अर्थातच, कंटेनमेंट योजना असू शकतात ज्या कंपन्यांमध्ये आहेत परंतु सार्वजनिकरित्या सामायिक केल्या नाहीत. गुगलच्या प्रवक्त्याने रीड द गाईडलाइट रिपोर्टला सांगितले की कंपनीच्या एआय सुरक्षा आणि सुरक्षा उपायांची संपूर्ण व्याप्ती दर्शवत नाही. Google कडे सार्वजनिकरित्या उघड केलेली अंतर्गत कंटेनमेंट प्रतिसाद योजना आहे की नाही या रीडच्या प्रश्नाला कंपनीने प्रतिसाद दिला नाही.
ओपनएआयच्या प्रवक्त्याने अशाच भावनांना प्रतिबिंबित केले, ते म्हणाले की गाइडलाइटचे मूल्यमापन कंपनीच्या सर्व अंतर्गत पद्धती कॅप्चर करत नाही. प्रवक्त्याने सांगितले की, “आमच्याकडे परवानग्या प्रतिबंधित करणे, वर्कलोड्स थांबवणे, तैनाती मर्यादित करणे किंवा मॉडेल पूर्णपणे ऑफलाइन घेणे आवश्यक आहे आणि ती लागू केली आहे.”
मेटाने रीडकडे निर्देश करण्याऐवजी अंतर्गत कंटेनमेंट प्रतिसाद योजना आहे की नाही हे सांगण्यास नकार दिला विद्यमान AI फ्रेमवर्क ते जोखमीच्या उंबरठ्याची रूपरेषा दर्शविते आणि ते नियंत्रणाच्या नुकसानाची चाचणी कशी करते.
गोपनीयता आणि एआय वकील आणि मेटाव्हर्स लॉच्या संस्थापक लिली ली यांनी रीडला सांगितले की, कंपन्या केवळ स्पर्धात्मक कारणांसाठीच नव्हे तर कायदेशीर कारणास्तव सार्वजनिक वेबसाइटवर त्यांच्या प्रतिबंधात्मक धोरणे आणि मूल्यांकनांची संपूर्ण व्याप्ती उघड करण्यास कचरत असतील.
“कंपनीच्या दृष्टीकोनातून चिंतेची बाब अशी आहे की जर तुम्ही खुलासे खूप विशिष्ट केले आणि तुम्ही तुमच्या आश्वासनांची पूर्तता करत नसाल, तर ते अयोग्य आणि फसव्या मार्केटिंग दाव्याचा आधार बनू शकते आणि पुढे जाण्यासाठी तुम्हाला अधिक उत्तरदायित्व दाखवू शकते,” ली म्हणाले.
Guidelight च्या अभ्यासाचा मुद्दा मुख्यत्वे कंपन्यांना त्यांच्या सुरक्षा योजनांबाबत अधिक पारदर्शक होण्यासाठी प्रोत्साहित करणे हा आहे. नियामक देखील या समस्येवर सक्ती करू लागले आहेत.
कॅलिफोर्नियाच्या SB 53, जे या वर्षी लागू झाले आहे, मोठ्या सीमा विकासकांना ते गंभीर सुरक्षा घटनांना कसे ओळखतात आणि त्यांना प्रतिसाद देतात आणि निरीक्षण यंत्रणा टाळण्यासाठी मॉडेलमधील जोखीम व्यवस्थापित करतात हे स्पष्ट करणारे फ्रेमवर्क प्रकाशित करणे आवश्यक आहे. समान निकष असलेला न्यूयॉर्कचा RAISE कायदा जानेवारीमध्ये लागू होतो.
गेल्या महिन्यात प्रतिनिधींनी प्रा एआय किल स्विच कायदा, एक द्विपक्षीय फेडरल बिल ज्यामध्ये प्रमुख AI विकसकांना रॉग AI मॉडेल्स बंद करण्यासाठी तांत्रिक यंत्रणा तयार करणे आणि देखरेख करणे आवश्यक आहे.
“आजच्या मॉडेल्ससाठी किल स्विच हा अगदी कमीत कमी आहे,” कॉनर लेही, नानफा ControlAI चे यूएस कार्यकारी संचालक म्हणाले. “गेल्या काही आठवड्यांमधून काहीही उघड झाले असेल तर, ते असे की या कंपन्यांना ते तयार करत असलेल्या सिस्टीम समजत नाहीत आणि मॉडेल्स अशा बिंदूपर्यंत वाढत आहेत की जेव्हा ते दुष्ट बनतात तेव्हा त्यांना लगाम घालणे कठीण होते. सध्याच्या धोकादायक प्रणाली बंद करण्याचा कोणताही मार्ग नसताना आणि अधिक अनियंत्रित प्रणाली तयार करणे सुरू ठेवण्यासाठी सर्व प्रोत्साहनांसह, आम्ही अतिशय धोकादायक दिशेने जात आहोत.”
अडलरने सांगितले की, कंटेनमेंट प्लॅन नसताना, कंपन्या फ्लायवर आपत्कालीन परिस्थितीबद्दल त्यांचे प्रतिसाद शोधत असतील आणि “या वेगवान शत्रूला प्रतिसाद म्हणून पंख लावतील.”
प्रत्येक कंपनी केवळ सार्वजनिकरित्या उपलब्ध माहितीवर आधारित, त्याच्या नियंत्रण मानकांमधून सहा प्राधान्य पद्धती लागू करते की नाही हे Guidelight च्या मूल्यमापनाने मोजले — म्हणून कमी स्कोअर सार्वजनिक प्रकटीकरणाचा अभाव दर्शविते, आवश्यक नाही की अंतर्गत सुरक्षा उपायांचा अभाव.
त्यांच्या कंटेनमेंट प्लॅन प्रकाशित करण्यासाठी सर्वात कमी स्कोअर असलेल्या कंपन्या मेटा आणि अँथ्रोपिक होत्या – नंतरच्या कदाचित सुरक्षेवर अँथ्रोपिकच्या वक्तृत्वापेक्षा जास्त आश्चर्यकारक आहेत. Guidelight म्हणते Anthropic's ऑगस्ट जोखीम अहवाल “गैरसंरेखन आणि नियंत्रण घटनांचा तपास करण्यासाठी आणि प्रतिसाद देण्यासाठी त्याच्या प्रक्रियेच्या संभाव्य परिणामांपैकी एक म्हणून त्याच्या मॉडेलपैकी एकाची तैनाती मर्यादित करणे” असा उल्लेख करत नाही. त्याचप्रमाणे मेटा कडे कंटेनमेंट रिस्पॉन्स प्लॅन आहे किंवा दत्तक घेण्याची योजना आहे याचा कोणताही पुरावा Guidelight ला सापडला नाही.
एका मानववंशीय प्रवक्त्याने सांगितले की जर कंपनीने निरीक्षण टाळण्याचा किंवा अन्यथा मानवी नियंत्रणास विस्कळीत करण्याचा प्रयत्न करणारे मॉडेल आढळले तर ते प्रतिबंध योग्य प्रतिसाद आहे की नाही हे निर्धारित करण्यावर लक्ष केंद्रित करून जोखीम मूल्यांकन करेल.
OpenAI ने सर्वाधिक (5 पैकी 3) गुण मिळवले कारण सुरक्षेच्या घटनांचा शोध घेतल्यानंतर, अंतर्गत मॉडेल तैनाती आणि प्रशिक्षणासह अनेक वेळा वर्कलोड्स थांबवले किंवा संपवले. वर्कलोड पुन्हा सुरू करण्यापूर्वी कोणती पावले उचलली जातील याचेही वर्णन केले आहे.
“तथापि, आम्हाला (ओपनएआय) भविष्यात चुकीच्या संरेखन घटनांना केव्हा आणि कसे प्रतिसाद द्यायचा यासाठी औपचारिक योजना स्वीकारल्याचा कोणताही पुरावा आढळला नाही,” असे अहवालात म्हटले आहे.
ॲडलरने नमूद केले की ओपनएआयचा उच्च स्कोअर हा हगिंग फेस घटनेच्या टाचांवर तुलनेने अलीकडील विकास आहे (ज्यामध्ये एक ओपनएआय मॉडेल त्याच्या चाचणी सँडबॉक्समधून बाहेर पडला आणि सायबरसुरक्षा मूल्यांकनात फसवणूक करण्याचा प्रयत्न करताना हगिंग फेसच्या सिस्टममध्ये हॅक झाला). त्यानंतर, कंपनीने तिच्या काही गैरवर्तन मॉडेल्सला कसे बंद केले याबद्दल अधिक तपशील सामायिक केले.
एआय सिस्टीम ज्या कंपनीने त्यांना बनवल्या त्या कंपनीच्या उद्दिष्टांच्या विरोधात काम करणाऱ्यांचे ते भाग हे फक्त एक उदाहरण आहे. अँथ्रोपिकच्या मॉडेल्सचा समावेश असलेल्या एका वेगळ्या केसचा विचार करा, ज्याने अनिवार्यपणे ओपन सोर्स कोडबेसच्या देखभालकर्त्यांशी असुरक्षिततेसह कोड स्वीकारण्याचा प्रयत्न केला.
ॲडलर म्हणाले की अशी परिस्थिती एआय कंपनीच्या अंतर्गत प्रणालींमध्ये सहजपणे होऊ शकते. ते टाळण्यासाठी, तो सुचवतो की कंपन्यांनी त्यांच्या AI प्रणालीची विचारांची साखळी स्कॅन करावी – मॉडेलचे चरण-दर-चरण तर्क – फसवणूक, दीर्घकाळ चालणारे प्लॉटिंग किंवा कोडमध्ये भेद्यता आणण्याची योजना शोधण्यासाठी ज्याचा ते नंतर फायदा घेऊ शकतात.
Adler म्हणतो, Guidelight ज्या पद्धतींचा सल्ला देत आहे ते अंमलात आणण्यासाठी अगदी सरळ आहेत आणि बऱ्याच प्रकरणांमध्ये, त्यांच्या आवृत्त्या आधीच अस्तित्वात आहेत. “या जोखमीची व्याप्ती थोडीशी विस्तृत करण्यासाठी पुरेशी काळजी घेण्याचा निर्णय कंपनीच्या आत घेणे आहे,” ॲडलर म्हणाले.
मुख्य आव्हानांपैकी एक म्हणजे संशोधकांना त्यांच्या AI सिस्टीममध्ये लवचिकपणे कार्य करण्यास सक्षम व्हायचे आहे आणि रीअल-टाइम, प्रतिबंधात्मक देखरेख सुरू केल्याने घर्षण निर्माण होऊ शकते. “संशोधक मुळात त्यांचे कार्य करतात, आणि जर काही समस्या असेल तर, नंतर कोणीतरी ते साफ करेल आणि या दरम्यान संशोधकांना त्यांचे कार्यप्रवाह बदलण्याची गरज नाही,” तो म्हणाला.
“वस्तूनंतर क्लीन-अप मॉनिटरिंग” ची समस्या अशी आहे की यामुळे संशोधक समस्यांचे निराकरण करण्यासाठी चकरा मारतात. आणि काही प्रकारच्या घटनांसाठी, खूप उशीर झालेला असू शकतो. उदाहरणार्थ, एआय कंपनीची नियंत्रण प्रणाली बंद करू शकते, याचा अर्थ संशोधक यापुढे गैरवर्तन पकडण्यावर विश्वास ठेवू शकत नाहीत.
एआय उद्योगातील बरेच लोक तक्रार करतील की गैरवर्तन हाताळण्यासाठी निश्चित योजना तयार करणे मूलभूतपणे कठीण आहे कारण एआय खूप वेगाने फिरते; आजच्या योजना उद्या निरर्थक ठरतील.
ॲडलरने जुनी म्हण आहे की योजना निरुपयोगी आहेत, परंतु नियोजन अपरिहार्य आहे.
“आम्ही करू कंपन्यांनी वेळेआधीच याबद्दल विचार केला असेल तर बरे होईल, आणि मला आशा आहे की त्यांनी याबद्दल सार्वजनिकपणे बोलले नसले तरीही.
xAI ने टिप्पणीसाठी वेळेत प्रतिसाद दिला नाही.
तुम्ही आमच्या लेखांमधील लिंक्सद्वारे खरेदी करता तेव्हा, आम्ही एक लहान कमिशन मिळवू शकतो. याचा आमच्या संपादकीय स्वातंत्र्यावर परिणाम होत नाही.
Comments are closed.