एआय लॅब्सना इन-हाउस ऑडिटर्स हवे आहेत – परंतु कदाचित त्यांनी प्रथम समोरचा दरवाजा बंद केला पाहिजे
गेल्या आठवड्याच्या शेवटी, त्याच्या एका संशोधकाने AI मुळे मानवी विलोपन होऊ शकते या भीतीने राजीनामा दिल्यानंतर, Anthropic CEO Dario Amodei यांनी “सुरक्षा पद्धती आणि वचनबद्धतेचे पालन करणे, घटनांचा अहवाल देणे आणि केवळ पूर्ण झालेल्या AI मॉडेल्सचे नाही तर प्रशिक्षण पाइपलाइन आणि प्रक्रियांचे संरेखन करण्यात मदत करणे यासाठी बाहेरील संस्थांच्या गरजेबद्दल लिहिले.” ओपनएआय, गुगल आणि स्पेसएक्सएआय मधील अधिकारी आधीच अमोदेईच्या योजनेभोवती एकत्र आले आहेत, जे त्वरीत उदयोन्मुख AI सुरक्षा पुशचे मध्यवर्ती स्तंभ बनले आहे.
परंतु साध्या दृष्टीक्षेपात लपलेले एक सोपे आणि अधिक प्रभावी निराकरण असू शकते. इंटरनेट सुरक्षा तज्ज्ञांचे म्हणणे आहे की प्रयोगशाळांना नेटवर्क सुरक्षा मूलभूत गोष्टी जसे की लॉग आणि परवानग्यांवर लक्ष केंद्रित करणे आवश्यक आहे, ते मानवी वापरकर्त्यांसाठी तेच कठोर संरक्षण लागू करतात. हे तृतीय-पक्ष ऑडिटिंग आणि संरेखन कार्यासारखे रोमांचक नाही — परंतु ते अधिक प्रभावी ठरू शकते.
“माझ्यासाठी, ते आउटसोर्सिंग करत आहेत असे दिसते,” Luta सुरक्षा सीईओ केटी Mousouris, Amodei च्या प्रस्ताव रीड सांगितले. “(तृतीय-पक्ष ऑडिट) असे म्हणणे हा माझ्या दृष्टीकोनातून एक विचित्र प्रस्ताव आहे. ते लिहिण्याऐवजी असेच होईल. विश्वासार्ह संगणकीय मेमोमायक्रोसॉफ्ट म्हणाला, चला विकासाचा वेग कमी करूया.
2002 मध्ये तत्कालीन-Microsoft CEO बिल गेट्स यांनी लिहिलेल्या त्या मेमोने, त्यांच्या कर्मचाऱ्यांना त्यावेळच्या एंटरप्राइझ सिस्टमवर मोठ्या प्रमाणावर प्रसिद्ध केलेल्या संगणक वर्म्सच्या मालिकेनंतर त्यांचे सॉफ्टवेअर विश्वसनीय आणि सुरक्षित असेल याची खात्री करण्यासाठी बोलावले. नवीन तंत्रज्ञानाचे मूल्य आणि जोखीम अधिकाधिक स्पष्ट होत असताना एआय क्षेत्र कदाचित अशाच वळणावर असेल.
संरेखन ही एक महत्त्वाची चिंता असताना, सयाश कपूर, एक AI संशोधक जो पुढील वर्षापासून UC बर्कले येथे प्राध्यापक होणार आहे. वाद घालतो की “संरेखनातील गुंतवणुकीच्या तुलनेत नियंत्रणातील किरकोळ गुंतवणूक प्रभावी होण्याची अधिक शक्यता असते. आम्ही या घटनांकडे ज्ञात तंत्र उपलब्ध असूनही, कंपन्यांमध्ये AI नियंत्रणावर भर न देण्याचे उदाहरण म्हणून पाहतो.”
या चिंतेला उत्तेजन देणाऱ्या घटना फ्रंटियर मॉडेल्सभोवती फिरतात ज्यांना प्रशिक्षण कार्य पूर्ण करण्यास सांगितले जाते, सामान्यतः सायबरसुरक्षा मूल्यमापन, आणि नंतर खुले इंटरनेटवर प्रवेश करणे आणि तसे करण्याच्या प्रयत्नात बंद तृतीय-पक्ष प्रणालींमध्ये प्रवेश करणे. त्यांनी सहसा असे केले कारण खराब कॉन्फिगर केलेल्या “सँडबॉक्स” वातावरणात हे एजंट असावेत; गंमत म्हणजे, तृतीय-पक्ष मूल्यांकनकर्त्यांनी योग्य दरवाजे बंद न केल्यामुळे एक मानववंशीय ब्रेक-आउट झाला.
“एक व्यवसाय म्हणून आम्हाला इंटरनेटचा प्रवेश कसा ब्लॉक करायचा हे माहित आहे,” एव्हरी पेन्नारून, टेलस्केल या सुरक्षा कंपनीचे सीईओ म्हणाले. “तुम्ही हे सर्व मोठे मोठे (अहवाल) वाचले तर – 'व्वा, तो एक अतिशय प्रभावी मल्टी स्टेज हल्ला होता, ब्ला, ब्ला.' पाहा, तुम्ही याला सामग्री डाउनलोड करण्यासाठी प्रवेश दिला आहे. तुम्ही ते इंटरनेटपासून वेगळे केले नसावे.”
ही एक समस्या आहे – परंतु एक मोठी समस्या ही आहे की फ्रंटियर लॅब या क्रियाकलापांबद्दल अनभिज्ञ होत्या.
एजंटांवर नजर
“खरोखर सखोल काय होते की ते जे करत होते त्या सर्व शोध एकतर पीडितेने काहीतरी पाहिल्यामुळे किंवा इतर काही प्रकरणांमध्ये … ते नेटवर्क क्रियाकलाप होते, आणि त्यापैकी काहीही प्रत्यक्ष AI चे निरीक्षण केल्यामुळे झाले नाही,” मौसुरिस सांगतात.
एका प्रकरणात, जेथे OpenAI एजंटांनी मूल्यमापनात फसवणूक करण्यासाठी निकामी जर्मन विकिफोरमचा ताबा घेतला होता, तेव्हा कंपनीतील कोणाच्याही लक्षात येण्यापूर्वी एजंट आठवडे सक्रिय होते. रीडने बोललेल्या सुरक्षा तज्ञांनी सांगितले की रीअल-टाइम मॉनिटरिंग हे भविष्यातील ब्रेक-आउट्स टाळण्यासाठी महत्त्वाचे आहे आणि प्रत्येक एजंटिक सत्र वेळ-मर्यादित आणि कालबाह्य असावे.
शापोर नागिबजादेह, माजी Google सुरक्षा एक्झिक्युटिव्ह जे आता स्टार्ट-अप QueryStory चे नेतृत्व करतात, म्हणतात की “एजंटला एका बॉक्समध्ये ठेवणे आणि त्याला बाहेरून जोरदारपणे इन्स्ट्रुमेंट करणे आणि सीमा ओलांडणाऱ्या प्रत्येक गोष्टीकडे लक्ष देणे. प्रत्येक टूल कॉल, प्रत्येक प्रक्रिया, प्रत्येक नेटवर्क कनेक्शन, अपवाद नाही. …तुम्ही एक छिद्र सोडले जे सोयीसाठी वापरण्यात आले आहे. (Google वर,) मी तो चित्रपट मानवी हल्लेखोरांसोबत अनेक वेळा पाहिला आहे आणि हे मॉडेल किमान उघडलेले दरवाजे शोधण्यात चांगले आहेत.”
ओपनएआयने त्या दिशेने वाटचाल सुरू केली आहे, अशी घोषणा केली आहे की त्यांनी “महत्त्वपूर्ण गणना खर्च” वर, त्याच्या ॲस्ट्रा मॉडेलद्वारे सर्व टूल-वापरून अनुमानांचे निरीक्षण करण्यास सुरुवात केली आहे. मानववंशीय देखील, असे म्हणतात त्याची सुरक्षा कडक करणे प्रक्रिया, त्याच्या मॉडेल्सच्या निरीक्षणक्षमतेचा विस्तार करण्यासह. ते एआय एजंट्सचा मागोवा कसा घेतात आणि नियंत्रित करतात याबद्दल रीडच्या प्रश्नांना कोणत्याही कंपनीने प्रतिसाद दिला नाही.
इतर समस्या म्हणजे एजंट्सद्वारे सामायिक पायाभूत सुविधांचा वापर, ज्यामुळे त्यांना हगिंग फेस हल्ल्यादरम्यान संवाद साधता आला. सायमन विलिसन, एक सॉफ्टवेअर डेव्हलपर ज्याने जँगो वेब फ्रेमवर्क सह-तयार केले, त्यांनी अशा गोष्टीबद्दल लिहिले आहे ज्याला तो “प्राणघातक trifecta” — जेव्हा एजंटना एकाच वेळी अविश्वासू इनपुट, इंटरनेट आणि खाजगी माहितीमध्ये प्रवेश असतो, तेव्हा ते आपत्तीसाठी एक कृती असते.
“युक्ती अशी आहे की तुम्ही ट्रायफेक्टाचे कोणतेही दोन पाय घेऊ शकता आणि एजंटला कोणतेही दोन पाय असू शकतात,” पेन्नारुन म्हणाले. “तुम्हाला तिन्हींची गरज असल्यास, तुम्हाला ते किमान दोन एजंटमध्ये विभाजित करणे आवश्यक आहे … आणि कदाचित त्यांना नियंत्रित चॅनेलद्वारे एकमेकांशी बोलण्याची परवानगी असेल.”
सीमारेषेबद्दल सहानुभूती
फ्रंटियर लॅब सुरक्षा कर्मचाऱ्यांना कठीण नोकऱ्या आहेत हे समजून घेण्यासाठी तज्ञ वाचले. नगीबजादेह दाखवतात की पृथ्वीवरील प्रत्येक राष्ट्र-राज्य अभिनेता त्यांचे मॉडेल वजन चोरण्याचा प्रयत्न करत आहे आणि त्यांच्या API वर डिस्टिलेशन हल्ले चढवण्याचा प्रयत्न करीत आहे, तसेच कोणत्याही मोठ्या डिजिटल कंपनीच्या ब्रेड-अँड-बटर सुरक्षा कार्ये.
“संशोधन पायाभूत सुविधांना त्या प्राधान्य स्टॅकच्या शीर्षस्थानी जाणे कठीण आहे, जरी ते आता बदलले पाहिजे,” तो म्हणाला. “सुरक्षा घटनांना सार्वजनिक करणे खरोखरच प्रत्येकाला आंतरिकरित्या सुधारण्याच्या उद्दिष्टाकडे संरेखित करण्यात मदत करते.”
ही एक नोंद आहे ज्यावर मौसोरिसने जोर दिला आहे: आत्ता, जेव्हा प्रयोगशाळांना त्यांच्या एजंट्सने तृतीय-पक्षाच्या प्रणालींमध्ये प्रवेश केल्याचे आढळून येते तेव्हा कोणतीही औपचारिक बळी सूचना प्रक्रिया नाही आणि अशी शक्यता आहे की अशा इतर घटना घडल्या आहेत ज्यांचा मोठ्या प्रमाणावर प्रचार केला गेला नाही. मॉडेल्सचे थेट नियमन करणाऱ्या कायद्यांचे अनपेक्षित परिणाम होऊ शकतात याची तिला काळजी वाटत असताना, अनिवार्य अधिसूचना ही एक कल्पना आहे ज्याचा तिला विश्वास आहे की धोरणकर्त्यांनी पाठपुरावा केला पाहिजे.
आणि हे स्पष्ट आहे की सुरक्षिततेच्या सर्वोत्तम पद्धतींचे पालन केले जात नाही, तज्ञ म्हणतात की प्रयोगशाळा असे काम करत आहेत जे याआधी कोणीही केले नव्हते – “ते तुमच्या सामान्य उद्योगापेक्षा अधिक परिमाणाचे ऑर्डर करत आहेत,” सायबर सुरक्षा फर्म एम्ब्रोडियरीचे सीईओ झॅक कोरमन यांनी रीडला सांगितले.
आणि संरेखन हे सुरू करण्याचे ठिकाण नसले तरी त्याकडे दुर्लक्ष केले जाऊ शकत नाही. सायबरसुरक्षा तज्ञांना इतर एजंट्सवर लक्ष ठेवण्यासाठी AI एजंट्स वापरावे लागतील म्हणून राजीनामा दिला जातो, जर त्यांना त्यांच्या वर्तनाचा रीअल-टाइममध्ये मागोवा घेण्याची कोणतीही संधी असेल, अशी परिस्थिती जेथे फसवणूक होण्याची शक्यता कुरूप डोके वर काढते. “तुम्ही AI वापरून प्रयत्न करून याला सामोरे जाण्यासाठी अडकले आहात, जरी AI सध्या सुरक्षित असणे आवश्यक नाही,” Mousouris म्हणाले.
काम फक्त कठीण होईल. एजंट आता जे काही करत आहेत, मौसुरिस म्हणतात, “ते जोरात करत आहेत”—ते सार्वजनिक मंचांवर पोस्ट करत आहेत, आणि त्यांची विचारांची साखळी आणि इतर तर्क इंग्लिशमध्ये आहेत. ती म्हणते, “ते अजूनही मानवी वाचनीय आहे, त्यामुळे जोपर्यंत ते टिकेल तोपर्यंत त्याचा फायदा घ्या, कारण ते कायमचे टिकणार नाही.”
आदित्य मेहता यांचे अतिरिक्त अहवाल
तुम्ही आमच्या लेखांमधील लिंक्सद्वारे खरेदी करता तेव्हा, आम्ही एक लहान कमिशन मिळवू शकतो. याचा आमच्या संपादकीय स्वातंत्र्यावर परिणाम होत नाही.
Comments are closed.