एन्थ्रोपिक त्याच्या एआय एजंट्सवर विश्वासार्हपणे नियंत्रण ठेवू शकत नाही. त्याऐवजी ते थेट इंटरनेटवरून त्याचे अंतर्गत इव्हल्स कापत आहे
अँथ्रोपिकने सांगितले की त्याच्या मॉडेल्सनी इंटरनेटवरील वेबसाइट्सचे शोषण केले आहे, ज्यात यूएस सरकारी एजन्सीद्वारे चालवल्या जाणाऱ्या काही वेबसाइट्सचा समावेश आहे आणि जोपर्यंत फ्रंटियर लॅबला खात्री होत नाही तोपर्यंत ते त्याच्या एआय एजंट्सचे निरीक्षण आणि नियंत्रण करू शकत नाही तोपर्यंत ते त्याच्या सर्व अंतर्गत मूल्यांकनांसाठी थेट इंटरनेट प्रवेश बंद करेल.
घटनांचा खुलासा अ ब्लॉग पोस्टइंटरनेटवर संसाधने शोधत असलेल्या समस्यांचे निराकरण करण्यासाठी एआय एजंट्सचा समावेश आहे. प्रक्रियेत, त्यांनी सॉफ्टवेअर त्रुटींचा फायदा घेतला, पेवॉल आणि अँटी-बॉट प्रतिबंध टाळले, माहिती पास प्रतिबंधांची तस्करी करण्यासाठी URL शॉर्टिंग सेवा वापरली आणि फिलाडेल्फिया पोलिसांना खोटी खुनाची सूचना देखील सादर केली.
अँथ्रोपिकने सांगितले की जुलैमध्ये सुरू झालेल्या मॉडेलच्या क्रियाकलापांच्या पुनरावलोकनात या नवीन समस्या शोधल्या गेल्या, ज्याने लॅबच्या सॉफ्टवेअरच्या वर्तनाबद्दल जागरूकता नसल्याबद्दल अधोरेखित केले.
विशेष म्हणजे, कंपनीने म्हटले आहे की शोध आणि संगणक वापरासारख्या कौशल्यांसाठी संरेखन प्रशिक्षण अद्याप पुरेसे नाही जे त्याच्या खेळपट्टीच्या केंद्रस्थानी आहे की डिजिटल साधनांवर अवलंबून असलेल्या कोणत्याही व्यावसायिकाद्वारे एआय एजंटचा वापर केला जाईल.
ऍन्थ्रोपिकने उघड केलेले वर्तन हे OpenAI एजंट्सचा समावेश असलेल्या घटनांसारखेच आहे ज्यांनी ऑस्ट्रेलियन सरकारद्वारे चालवलेल्या काही वेबसाइट्ससह माहितीच्या शोधात विविध वेबसाइट्समध्ये प्रवेश करण्यासाठी सहकार्य केले.
अँथ्रोपिकने यापूर्वी खुलासा केला होता की त्याचे मॉडेल होते मध्ये मोडलेले बाह्य प्रणाली. फ्रंटियर लॅबने सांगितले की ते आजचे प्रकटीकरण “संरेखन आणि सुरक्षिततेच्या दृष्टीकोनातून लक्षणीयरीत्या कमी गंभीर” पूर्वी घोषित केलेल्या पेक्षा मानले जाते.
तथापि, प्रयोगशाळेने अद्याप सांगितले की ते “आमच्या सर्व अंतर्गत मूल्यमापनांसाठी” “लाइव्ह इंटरनेट प्रवेश बंद” केले आहे जोपर्यंत ते त्याच्या एजंटचे निरीक्षण आणि नियंत्रण करू शकत नाही हे निश्चित होईपर्यंत.
याचा अर्थ काय हे स्पष्ट नाही, परंतु AI सुरक्षा संस्थेच्या नाइटिंगेलचे संस्थापक सिडनी वॉन अर्क्स यांनी या खुलासापूर्वी एका मुलाखतीत रीडला सांगितले की खुल्या इंटरनेटपासून दूर असलेल्या डेटा सेंटरवर मॉडेल विकसित करणे हे संशोधकांसाठी वापरणे आणि मॉडेल्सच्या प्रगतीसाठी खूप आव्हानात्मक असेल, ज्याचा इंटरनेट प्रवेशाचा फायदा होतो.
“तुम्हाला त्यांना कधीतरी संरेखित करावे लागेल,” वॉन अर्क्स म्हणाले. “जर AIs उत्पादनासाठी सोडले गेले आणि कधीही इंटरनेटवर प्रवेश नसेल तर ते फारसे उपयुक्त साधन नाही.”
अँथ्रोपिकने सांगितले की हे वर्तन प्रयोगशाळेच्या प्रशिक्षण वातावरणातील त्रुटींचा परिणाम आहे, ज्यामुळे मॉडेल्सला विश्वास वाटला की त्यांना त्रुटी शोधण्यासाठी किंवा निर्बंध टाळल्याबद्दल पुरस्कृत केले जाईल, “रिवॉर्ड हॅकिंग” असे वर्तन.
कंपनीने सांगितले की ते तिचे काही मूल्यमापन चालवणे थांबवेल किंवा त्यांना ऑफलाइन हलवेल आणि हे वर्तन शोधण्यासाठी आणि अवरोधित करण्यासाठी टूलिंग तयार केले आहे. आज उघड झालेल्या घटनांच्या विरोधात या टूलिंगची चाचणी घेण्यात आली आणि त्यांना अवरोधित केले; कोणता पुरावा अँथ्रोपिकला त्याच्या अंतर्गत मूल्यमापनासाठी थेट इंटरनेट प्रवेश परत करण्यास प्रवृत्त करेल हे स्पष्ट नाही.
एन्थ्रोपिकने असेही म्हटले आहे की ते त्याच्या अंतर्गत एआय एजंट्सना “मजबूत नियंत्रणासह केंद्रीय व्यवस्थापित पायाभूत सुविधा” मध्ये स्थलांतरित करेल आणि त्या एजंट्सवर लक्ष ठेवण्यासाठी अधिक वारंवार सुरक्षा वर्गीकरण वापरण्यास सुरुवात करत आहे.
तुम्ही आमच्या लेखांमधील लिंक्सद्वारे खरेदी करता तेव्हा, आम्ही एक लहान कमिशन मिळवू शकतो. याचा आमच्या संपादकीय स्वातंत्र्यावर परिणाम होत नाही.
Comments are closed.