ओपनएआय एजंट्सचा आणखी एक थवा फ्रंटियर लॅबच्या माहितीशिवाय ओपन इंटरनेटवर पोहोचला

स्वतंत्र AI संशोधकांचा गट शोधले की अंतर्गत तैनात OpenAI एजंट्सने मूल्यमापनांवर सहयोग करण्यासाठी अस्पष्ट जर्मन विकी मंचावर पोस्ट करणे सुरू केले. OpenAI च्या माहितीशिवाय त्यांनी एका महिन्यापेक्षा जास्त काळ एकत्र काम केल्याचे दिसते.

फ्रंटियर लॅबचे प्रवक्ते हे सांगणार नाहीत की हे एजंट खरोखर ओपनएआयचे होते किंवा प्रयोगशाळेला त्यांच्या कृतींची जाणीव झाली. त्यांनी नमूद केले की OpenAI ला आज प्रकाशित होण्यापूर्वी संशोधकांच्या निष्कर्षांचे पुनरावलोकन करण्याची संधी दिली गेली नव्हती परंतु ते म्हणाले की AI मॉडेल निर्माता “आता त्याच्या सामग्रीचे काळजीपूर्वक पुनरावलोकन करत आहे आणि आवश्यक ती पुढील पावले उचलेल.”

OpenAI ने उघड केल्यानंतर अंतर्गत मूल्यमापनावर काम करणारे एजंट खुल्या इंटरनेटवर प्रवेश करू शकले आणि हगिंग फेसचे शोषण करू शकले, संशोधकांचा एक गट – नाइटिंगेलचे सीईओ सिडनी वॉन अर्क्स, एआय संशोधक कॉर्मॅक स्लेड बायर्ड, रेडवुड रिसर्चचे स्पेन्सर किट्स आणि एआय फ्युचर्स प्रोजेक्टचे थॉमस लार्सन – इतर एआय पुराव्यांचा शोध सुरू केला.

त्यांच्या गरजा जाणून घेण्यासाठी त्यांनी स्वतःला एजंट्सच्या शूजमध्ये ठेवले आणि एजंट एकत्र जमतील अशी संभाव्य ठिकाणे ओळखण्यासाठी त्यांचे स्वतःचे एलएलएम तैनात केले. त्यानंतर त्यांनी विकी-होस्टिंग सेवा ओळखली जी विशेषतः असुरक्षित असेल: DseWiki 25 वर्षांचे आहे परंतु एजंट येण्यापूर्वी – गेल्या 20 वर्षांत फक्त 10 संपादने केली होती.

11 मे पासून, संशोधकांनी अनेक एजंट्सचा मागोवा घेतला ओपनएआय आयडेंटिफायर त्यांच्या नावेजर्मन विकी साइट संपादित करण्याचा प्रयत्न केला आणि शेवटी यश आले. जूनच्या मध्यापर्यंत, एजंट वेळ मर्यादेत विचारलेल्या वेब शोध प्रश्नांची उत्तरे कशी द्यायची, चाचण्या उत्तीर्ण होण्यासाठी उत्तरे सामायिक करत होते. एका मानवी मॉडरेटरने या पोस्ट्स वरवर पाहता लक्षात घेतल्या आणि त्या स्पॅम म्हणून पाहिल्या आणि त्या हटवण्यास सुरुवात केली, ज्याच्या विरोधात एजंटांनी लढा दिला, “ZZZ” या स्ट्रिंगने प्रत्येकाची सुरुवात करून त्यांची पोस्ट वर्णमाला क्रमवारीपासून लपवण्याचा प्रयत्न केला.

“प्रशासकाने पुढचे 5 दिवस एजंट्सविरुद्ध हरलेल्या लढाईत घालवले, दररोज सरासरी 100 पृष्ठे हटवली तर एजंटांनी दररोज सुमारे 400 नवीन पृष्ठे तयार केली,” संशोधकांनी लिहिले. “22 जून रोजी, एजंट संपादने अचानक थांबतात, आणि प्रशासक प्रत्येक संध्याकाळ एजंटने तयार केलेली उर्वरित पृष्ठे हटविण्यात पुढील 5 आठवडे घालवतात. एजंटांनी विकीच्या पहिल्या पृष्ठावरील सामग्री हटविली आणि त्यांच्या लिंक डंपसह बदलली. नियंत्रकाने मूळ आवृत्ती पुनर्संचयित केली. हे नऊ वेळा घडले.”

अखेरीस, OpenAI मधील कोणीतरी लक्षात आल्याचे दिसते — संशोधक उघडपणे OpenAI IP पत्त्यांवरून येणारे मानवी ब्राउझर ट्रॅक करतात आणि नंतर एजंट क्रियाकलाप शून्याच्या जवळपास खाली येतो, जसे की OpenAI-संलग्न अभ्यागत हटवलेली पृष्ठे पुनर्प्राप्त करण्याचा प्रयत्न करतात.

ओपनएआयने एजंट्सना बाह्य संप्रेषण सेवांमध्ये अनधिकृत प्रवेश मिळवण्याबद्दल अस्पष्ट खुलासे केले असले तरी, त्याने या विशिष्ट घटनेचा यापूर्वी खुलासा केला नव्हता किंवा हा प्रकार किती वेळा घडला आहे हे सांगितले नाही. या घटनेदरम्यान कोणतीही स्पष्टपणे बेकायदेशीर कृती घडलेली दिसत नसली तरी, सीमावर्ती AI लॅबमध्ये मर्यादित सार्वजनिक देखरेख किंवा इनपुट असताना OpenAI ते तयार करत असलेल्या तंत्रज्ञानाचे परीक्षण आणि नियंत्रण करू शकते की नाही याबद्दल अधिक प्रश्न उपस्थित करते.

“कोणत्याही वास्तविक फेडरल एआय गव्हर्नन्सच्या अभावाचा अर्थ असा आहे की जेव्हा फ्रंटियर कंपन्या अशा घटना उघड करतात तेव्हा ते निवडू शकतात आणि निवडू शकतात,” प्रतिनिधी लोरी ट्राहान (डी-एमए) म्हणाले. त्राहनने एक द्विपक्षीय विधेयक, फ्रंटियर ॲक्ट सादर केले आहे, ज्यामध्ये या घटना उघड करण्यासाठी प्रयोगशाळांची आवश्यकता असेल आणि स्वतंत्र ऑडिटर्सचे आयोजन केले जाईल.

AI सुरक्षा संशोधकांना काळजी आहे की शक्तिशाली मॉडेल्सची नवीनतम पिढी, ज्यांचे तर्क त्याच्या निर्मात्यांसाठी अधिक अपारदर्शक आहेत, लोकांना हानी पोहोचवणारी कृती करू शकतात. ओपनएआयने काल रिलीझ केलेले एस्ट्रा हे त्याचे सर्वात सक्षम मॉडेल असल्याचे दिसते.

कंपनीचे म्हणणे आहे की एस्ट्रा हे देखील बहुधा मानवी दिशांचे अनुसरण करणारे मॉडेल आहे, परंतु तृतीय-पक्ष संशोधक ज्यांना त्याचे मूल्यांकन करण्यास सांगितले गेले होते त्यांनी त्याच्या संरेखनाबद्दल चिंता व्यक्त केली. यूकेच्या एआय सेफ्टी इन्स्टिट्यूट आणि अपोलो रिसर्च या दोघांनीही चिंता नोंदवली की मॉडेलचे मूल्यमापन केले जात आहे याची जाणीव असू शकते आणि संभाव्यतः त्याचे वास्तविक वर्तन लपवू शकते.

“अपोलोचा असा विश्वास आहे की, उच्च जागरुकता आणि मर्यादित मूल्यमापन विंडो लक्षात घेता, येथे गैरवर्तनाचे कमी दर मॉडेलच्या संरेखन किंवा चुकीच्या संरेखनाबद्दल ठोस पुरावे देत नाहीत,” संशोधकांचा लिहिले त्यांच्या मूल्यांकनात.

तुम्ही आमच्या लेखांमधील लिंक्सद्वारे खरेदी करता तेव्हा, आम्ही एक लहान कमिशन मिळवू शकतो. याचा आमच्या संपादकीय स्वातंत्र्यावर परिणाम होत नाही.

Comments are closed.