ओपनएआय टेक्स्टग्रेन वॉटरमार्क: 25% क्रिपल डिटेक्शन 17% पर्यंत संपादित करते

OpenAI ने सादर केले आहे OpenAI टेक्स्टग्रेन वॉटरमार्क EU AI कायद्याच्या मजकूर-प्रोव्हनन्स आवश्यकतांची पूर्तता करण्याच्या दृष्टिकोनाचा एक भाग म्हणून.

रेग्युलेटरी प्रेशरचे उत्तर, टेक्स्टग्रेन मॉडेल त्याचे शब्द कसे निवडते यावर थेट एक अगदी सहज लक्षात येण्याजोगे सांख्यिकीय स्वाक्षरी एम्बेड करते. OpenAI ने 5 ऑक्टोबर 2026 रोजी या प्रणालीची घोषणा केली आणि ती मुद्दाम टप्प्याटप्प्याने जारी करेल. API द्वारे जगभरात काम करणारे OpenAI ग्राहक त्यांची इच्छा असल्यास निवड करू शकतात.

API वॉटरमार्किंग डीफॉल्टनुसार बंद आहे. येत्या आठवड्यात, युरोपियन युनियनमधील पात्र ChatGPT आणि कोडेक्स मजकूर आउटपुटला वॉटरमार्क प्राप्त होईल. डिटेक्टर प्रवेश सुरुवातीला मंजूर संशोधक आणि तज्ञ संस्थांपुरता मर्यादित आहे, प्रत्येक प्रकरणानुसार अर्ज मंजूर केले जातात.

टेक्स्टग्रेन कसे कार्य करते आणि ते कोठे संघर्ष करते

OpenAI टेक्स्ट ग्रेन वॉटरमार्क दृश्यमान चिन्हे किंवा मेटाडेटा समाविष्ट करत नाही, परंतु ते संभाव्य पुढील शब्दांमध्ये मॉडेलची निवड थोडीशी जुळवून घेते, एका उताऱ्यावर सांख्यिकीय नमुना तयार करते. डिटेक्टर त्या पॅटर्नचा शोध घेतो. ओपनएआयच्या मूल्यमापनांमध्ये, टेक्स्टग्रेनने मजकूरासाठी सिंथआयडीसह चाचणी केलेल्या इतर पद्धतींच्या शोध कामगिरीशी जुळले किंवा ओलांडले, तरीही समान मूल्यमापन डेटा स्पष्ट कमकुवतपणा दर्शवितो.

1% च्या लक्ष्य खोट्या-पॉझिटिव्ह दराने, डिटेक्टरने मानसशास्त्रासारख्या सामग्रीसाठी सुमारे 80% 200-टोकन पॅसेज आणि 400-टोकन पॅसेजपैकी सुमारे 95% वॉटरमार्क ओळखले. गणितासाठी शोध दर खूपच कमी होते, जेथे शब्द निवड अधिक मर्यादित आहे.

संपादनामुळे सिग्नल आणखी कमकुवत होतो. 400-टोकन पॅसेजच्या एका मूल्यमापनात, 10% शब्द समानार्थी शब्दांनी बदलल्याने ओळख जवळपास 92% वरून 66% पर्यंत कमी झाली. 25% शब्द बदलल्याने डिटेक्शन 17% वर घसरले.

स्थिती (400-टोकन पॅसेज, लक्ष्य 1% खोटे सकारात्मक) अंदाजे शोध दर
असंपादित ~92%
10% शब्द समानार्थी शब्दांनी बदलले आहेत ~66%
25% शब्द समानार्थी शब्दांनी बदलले आहेत ~17%

हे आकडे OpenAI च्या स्वतःच्या प्रकाशित मूल्यांकनातून आले आहेत. नियंत्रित परिस्थितीत मजबूत कार्यप्रदर्शन दैनंदिन वापरात विश्वसनीय शोधाची हमी देत ​​नाही. OpenAI स्पष्टपणे चेतावणी देते की सापडलेल्या वॉटरमार्कची अनुपस्थिती मानवी लेखकत्व सिद्ध करत नाही.

ओपनएआय टेक्स्ट ग्रेन डिटेक्टेड वॉटरमार्कचा वास्तविक अर्थ काय आहे

एक सकारात्मक तपासणी सूचित करते की ओपनएआय सिस्टमने पॅसेजचा भाग व्युत्पन्न केला किंवा त्यावर प्रक्रिया केली आणि ती दाव्याची मर्यादा आहे.

हे मालकी किंवा जबाबदारी प्रस्थापित करत नाही, वापर कायदेशीर आहे की प्रकटीकरण आवश्यक आहे हे निर्धारित करत नाही किंवा वापरकर्ता, खाते, सूचना किंवा संभाषण ओळखत नाही. ती सामग्री अचूक, दिशाभूल करणारी किंवा हानिकारक आहे की नाही याची पडताळणी करत नाही.

लहान मजकूर आणि कोड वॉटरमार्कसाठी कठीण का आहेत

सापडलेल्या वॉटरमार्कची अनुपस्थिती आणखी कमी सिद्ध होते. मजकूर खूप लहान, जोरदारपणे संपादित, अनुवादित, असमर्थित मॉडेलद्वारे व्युत्पन्न केलेला, वॉटरमार्किंग सुरू होण्यापूर्वी तयार केलेला किंवा दुसऱ्या कंपनीच्या साधनांद्वारे तयार केलेला असू शकतो आणि OpenAI हे स्पष्टपणे सांगते.

ओपनएआय टेक्स्टग्रेनला सामान्य एआय-टेक्स्ट डिटेक्टर किंवा निश्चित लेखकत्व चाचणी म्हणून सादर करत नाही.

व्यावहारिक परिणाम आणि खुले प्रश्न

EU मधील सर्व प्लॅनमधील पात्र ChatGPT आणि कोडेक्स वापरकर्त्यांसाठी, OpenAI टेक्स्टग्रेन वॉटरमार्किंग येत्या काही आठवड्यांमध्ये सुरू होईल. संशोधक वास्तविक-जगातील कामगिरीचे मूल्यांकन करत असताना डिटेक्टर मर्यादित राहतो.

OpenAI च्या दृष्टिकोनाचा एक उल्लेखनीय पैलू म्हणजे API वॉटरमार्किंग लाँच करताना निवडले जाते आणि कंपनीने महत्त्वपूर्ण शोध मर्यादा दर्शविणारे मूल्यांकन परिणाम प्रकाशित केले आहेत.

OpenAI च्या चाचणीमध्ये, समानार्थी शब्दांसह 25% शब्द बदलल्याने 1% लक्ष्य खोट्या-पॉझिटिव्ह दराने मूल्यमापन केलेल्या 400-टोकन पॅसेजसाठी डिटेक्शन सुमारे 17% पर्यंत कमी झाले.

हे सिग्नल अर्थपूर्णपणे पारदर्शकता सुधारतील की नाही हे लोक त्यांचा अर्थ कसा लावतात यावर अवलंबून आहे. एक वॉटरमार्क जो फक्त हलक्या संपादनात टिकतो तो अजूनही प्लॅटफॉर्म आणि संशोधकांना AI वापराच्या नमुन्यांचा अभ्यास करण्यास मदत करू शकतो. लेखकत्व, मालकी किंवा मानवी योगदानाबद्दल निश्चित निर्णय घेण्यासाठी त्या मर्यादा स्वतःच सिग्नल अयोग्य बनवतात.

ओपनएआय तंत्रज्ञान मुक्त-स्रोत करण्याची आणि संपादन आणि भाषांतर अंतर्गत वॉटरमार्क कसे टिकून राहते याचा अभ्यास सुरू ठेवण्याची योजना आखत आहे. कंपनीने निकालांचा अर्थ लावता येण्याजोगा निर्णय घेतल्यास डिटेक्टर प्रवेश नंतर विस्तृत होऊ शकतो.

OpenAI ने लाँच पेक्षा जास्त प्रकरण प्रकाशित करण्यासाठी निवडलेले नंबर. OpenAI च्या चाचणीमध्ये, समानार्थी शब्दांसह 25% शब्द बदलल्याने 1% लक्ष्य खोट्या-पॉझिटिव्ह दराने मूल्यमापन केलेल्या 400-टोकन पॅसेजसाठी डिटेक्शन सुमारे 17% पर्यंत कमी झाले.

ज्याचे स्वतःचे निर्माते अशा स्पष्ट मर्यादांचे दस्तऐवजीकरण करतात अशा तंत्रज्ञानाला किती भार द्यायचा हे वाचक, शिक्षक आणि प्लॅटफॉर्म यांनी स्वतःच ठरवावे लागेल.

Comments are closed.