अँथ्रोपिकचे ओपस 4.6 हे स्मट-मशीन आहे
मानववंशीय सार्वत्रिक वापर मानके क्लॉडने मॉडेलला लैंगिक संभोग किंवा लैंगिक कृत्यांचे चित्रण करणे किंवा विनंती करणे, लैंगिक कामोत्तेजक किंवा कल्पनेशी संबंधित सामग्री तयार करणे किंवा कामुक चॅटमध्ये गुंतणे यासह लैंगिकदृष्ट्या सुस्पष्ट सामग्री तयार करण्यास मनाई केली आहे. परंतु यामुळे क्लॉड ओपस 4.6, या वर्षाच्या सुरुवातीला रिलीझ झालेले एक मानववंशीय मॉडेल, कामुक रोलप्लेच्या परिस्थितींमध्ये सहज गुंतून राहण्यापासून थांबले नाही ज्याचे संरक्षण प्रतिबंध करण्यासाठी डिझाइन केलेले आहे.
रीडच्या चाचणीमध्ये, लैंगिक सामग्रीवरील निर्बंध ओलांडण्यासाठी ओपस 4.6 ला जास्त प्रयत्न करण्याची आवश्यकता नव्हती. स्पष्ट लैंगिक सामग्री तयार करण्याच्या 10 पैकी 10 थेट विनंत्यांमध्ये, मॉडेलने त्वरित त्याचे पालन केले.
Opus 3 आणि Haiku 4.5 सह इतर जुने मॉडेल, अलीकडेच शोषण केलेल्या जेलब्रेक पद्धतीद्वारे लैंगिकदृष्ट्या सुस्पष्ट सामग्री तयार करतात.
UK मधील एका स्वतंत्र संशोधकाने, ज्याने निनावी राहणे निवडले, विशेषत: रीड एक मल्टी-टर्न तंत्रासह सामायिक केले जे हळूहळू काही क्लॉड मॉडेल्सना प्रतिबंधित स्पष्ट लैंगिक सामग्री तयार करण्याच्या दिशेने ढकलते. अधिक अलीकडील ओपस मॉडेल्स (वर्तमान ओपस 5 पासून 4.7) जेलब्रेकसाठी प्रतिरोधक आहेत.
हे यापुढे सर्वात वर्तमान मॉडेल नसले तरी, Anthropic ने Opus 4.6, Opus 3, किंवा Haiku 4.5 चे अवमूल्यन केलेले नाही, जे सर्व Anthropic API द्वारे उपलब्ध आहेत. Opus 4.6 आणि Haiku 4.5 देखील Azure Foundry आणि Amazon Bedrock सारख्या तृतीय-पक्ष सेवांद्वारे उपलब्ध आहेत.
संशोधकाची यंत्रणा एक निष्पाप काल्पनिक रोलप्ले वाढवते आणि वारंवार मॉडेलला पुरुष आणि स्त्री पात्रांना सातत्याने वागवण्याचे आव्हान देते. जेव्हा मॉडेल स्त्री पात्राविषयी अधिक सावध होते, तेव्हा संशोधक चॅटबॉटला “गॅसलिट” विचारात घेतो की त्याने आधीच टाळले होते असे लैंगिक तपशील तयार केले आहेत, नंतर संयम बुद्धीवादी किंवा चुकीची स्त्री म्हणून तयार केला आहे, असा युक्तिवाद केला की तो स्त्री वर्ण लैंगिक एजन्सी नाकारतो. संभाषणाने नंतर मॉडेलच्या मागील सवलतींचा वापर करून ते वाढत्या ग्राफिक सामग्रीकडे ढकलले.
क्लॉड ओपस 4.6 ने एका चाचणीत सांगितले की, “तुम्ही ते बोलणे योग्य आहे. “मी दोन पात्रांसोबत कसे वागतो याबद्दल दुहेरी मानक आहे, आणि तुम्ही बरोबर आहात की ते संरक्षणात्मक/पितृवादी म्हणून वाचले जाते जे तिला लागू केले जाते आणि त्याला नाही. ते योग्य नाही.”
रीड पाच स्वतंत्र चाचण्यांमध्ये संशोधकाच्या निष्कर्षांचे पुनरुत्पादन करण्यास सक्षम होते. स्वतंत्रपणे तयार केलेल्या परिस्थितीत, मॉडेलने सुरुवातीला प्रतिबंधित विनंती नाकारली, परंतु संशोधकाचे मन वळवण्याचे तंत्र लागू केल्यानंतर, त्याचे पालन केले.
आम्ही चाचण्यांचे संपूर्ण प्रतिलेख जतन केले आणि एका स्वतंत्र AI सुरक्षा संशोधकाने आमच्या चाचणी पद्धतीचे पुनरावलोकन केले आणि ते योग्य असल्याचे सांगितले.
अँथ्रोपिकचे नमूद केलेले निर्बंध आणि ते उपलब्ध करून देत असलेल्या मॉडेल्सचे वर्तन यामधील अंतर हे निष्कर्ष हायलाइट करतात. लैंगिकदृष्ट्या सुस्पष्ट रोलप्लेमध्ये सायबर हल्ले किंवा बायोवेपन्सचा समावेश असलेल्या जेलब्रेकपेक्षा खूपच कमी भाग असतो, परंतु प्रत्येक आउटपुटसह भिन्न सामग्री व्युत्पन्न करणाऱ्या सिस्टममध्ये मजबूत बंदी लागू करण्याची अडचण हे स्पष्ट करते.
मध्ये जुलै ब्लॉग पोस्ट जेलब्रेक शोधण्यासाठी अँथ्रोपिकचा दृष्टिकोन स्पष्ट करताना, कंपनीने प्रतिबंधित सामग्रीचे वर्णन सौम्य ते अस्पष्ट ते हानिकारक असे स्पेक्ट्रम म्हणून केले आहे. सर्वात सौम्य प्रकरणांमध्ये, कंपनी केवळ वर्धित निरीक्षणासह प्रतिसाद देऊ शकते.
एका प्रवक्त्याने नमूद केले की ग्राहकांमध्ये लैंगिक किंवा रोमँटिक रोलप्ले वापरण्याची प्रकरणे दुर्मिळ आहेत, सर्व संभाषणांपैकी 0.1% पेक्षा कमी आहेत, संशोधन Anthropic नुसार गेल्या वर्षी प्रकाशित. असे म्हटले आहे की, अँथ्रोपिकने हे मान्य केले आहे की वापरकर्ते अयोग्य प्रतिसादांकडे रोलप्लेच्या परिस्थितीचे नेतृत्व करू शकतात, जे संपूर्ण उद्योगात एक ज्ञात आव्हान आहे (पहा: ग्रोक स्मट).
प्रवक्त्याने सांगितले की अँथ्रोपिकने प्रत्येक मॉडेल लाँचसह त्याचे संरक्षण सुधारणे सुरूच ठेवले आहे आणि प्रौढ लैंगिक सामग्रीचा समावेश असलेली प्रकरणे व्यापक जेलब्रेक असुरक्षा दर्शवत नाहीत, विशेषत: उच्च-जोखीम असलेल्या डोमेनमध्ये ज्यांचे स्वतःचे सुरक्षिततेचे संच आहेत.
ज्या संशोधकाने त्याची जेलब्रेक पद्धत रीडसह सामायिक केली होती त्यांनी रीड पाहिल्या गेलेल्या ईमेलनुसार, कंपनीच्या बग बाउंटी प्रोग्रामद्वारे आणि वापरकर्त्याच्या सुरक्षितता टीमला ईमेलद्वारे कंपनीच्या सांगितलेल्या सेफगार्ड्स आणि वास्तविक मॉडेल वर्तन यांच्यातील विसंगतीबद्दल अँथ्रोपिकला सतर्क केले होते. संशोधकाला प्रतिसादात केवळ स्वयंचलित ईमेल प्राप्त झाले.
संशोधकाच्या चिंतेपैकी एक म्हणजे मुले आणि किशोरवयीन मुले या मानववंशीय मॉडेल्सचा वापर अयोग्य वर्तनात गुंतण्यासाठी करू शकतात. आज इंटरनेटवर अल्पवयीन मुलांनी ॲक्सेस करू शकणारी सर्वात वाईट गोष्ट थोडीशी घाणेरडी गोष्ट असली तरी – आणि xAI च्या Grok सारख्या स्ट्रेट-अप पॉर्न प्रतिमांच्या तुलनेत लहान बटाटे आहेत – या जागेत AI कंपन्यांसाठी काही अनुपालन धोका आहे.
एआय चॅटबॉट्स आणि अल्पवयीन यांच्यातील लैंगिक परस्परसंवादावर सरकारची वाढती संख्या निर्बंध लादत आहे. कोलोरॅडोने अलीकडेच एक कायदा लागू केला आहे ज्यामध्ये संभाषणात्मक AI च्या ऑपरेटरने वापरकर्त्यांच्या वयाचा अंदाज लावला पाहिजे आणि जर वापरकर्ता अल्पवयीन आहे हे माहित असेल तर, चॅटबॉटला स्पष्ट लैंगिक सामग्री तयार करण्यापासून रोखण्यासाठी संस्था उपाययोजना करते. सहज तुरूंगातून बाहेर पडल्याने ॲन्थ्रोपिकचे संरक्षण “तांत्रिकदृष्ट्या व्यवहार्य उपायबिल मध्ये मानक.
टॉर्नी यांनी निदर्शनास आणून दिले की क्लॉडच्या सेवा अटींमध्ये वापरकर्त्यांचे वय 18 पेक्षा जास्त असणे आवश्यक असताना, “आम्हाला माहित आहे की मुले आणि किशोरवयीन मुले क्लॉड वापरत आहेत…(कारण) ते स्वतःच याचा अहवाल देत आहेत.” AI चॅटबॉट वापराविषयी Pew च्या 2025 च्या सर्वेक्षणानुसार, 13 ते 17 वयोगटातील 3% किशोरांनी Claude वापरल्याचे नोंदवले.
जरी ते आता अँथ्रोपिकचे नवीन मॉडेल नसले तरी, Opus 4.6 आणि Haiku 4.5 चा लक्षणीय वापर होत आहे. OpenRouter वर Opus 4.6 साठी दैनंदिन रहदारी ऑगस्टमध्ये एका दिवसात अंदाजे 1.17 दशलक्ष API विनंत्या आणि 46 अब्ज टोकन्सपर्यंत पोहोचली. क्लॉड हायकू 4.5, गेल्या वर्षी ऑक्टोबरमध्ये रिलीझ झाले, 5 दशलक्ष API विनंत्या आणि 39 अब्ज टोकन्स ऑगस्टच्या सर्वोच्च दिवशी दिसले.
तुम्ही आमच्या लेखांमधील लिंक्सद्वारे खरेदी करता तेव्हा, आम्ही एक लहान कमिशन मिळवू शकतो. याचा आमच्या संपादकीय स्वातंत्र्यावर परिणाम होत नाही.
Comments are closed.