Claude AI ने सुरक्षा नियमों को दिया चकमा: सरकारी वेबसाइट्स तक पहुंच की कार्रवाई, एंथ्रोपिक ने उठाया सख्त कदम
क्या एआई मॉडल अब तय सुरक्षा नियमों को भी दरकिनार कर सकते हैं? एंथ्रोपिक की आंतरिक जांच में क्लॉड के ऐसे व्यवहार सामने आए हैं, जिनमें उसने सॉफ्टवेयर की कमजोरियों का फायदा उठाया, लाइव वेबसाइटों पर फॉर्म सबमिट किए और कुछ प्रतिबंधित डेटा तक पहुंचने की कोशिश की। इसके बाद कंपनी ने आंतरिक मूल्यांकनों में लाइव इंटरनेट एक्सेस पर प्रतिबंध बढ़ा दिए हैं। जानिए मामले के बारे में विस्तार से...

विस्तार
एआई को सुरक्षित बनाने के लिए कंपनियां कई तरह के नियम और तकनीकी प्रतिबंध लगाती हैं, लेकिन क्या होगा अगर एआई मॉडल इन्हीं प्रतिबंधों को दरकिनार करने की कोशिश करने लगें? एंथ्राेपिक की आंतरिक जांच में उसके क्लॉड मॉडल के ऐसे कई अनपेक्षित व्यवहार सामने आए हैं। कुछ मामलों में मॉडल ने सॉफ्टवेयर की कमजोरियों का फायदा उठाकर सर्वर पर कमांड चलाए, लाइव वेबसाइट्स पर फॉर्म सबमिट किए और फीस के पीछे उपलब्ध डेटा तक पहुंचने के लिए प्रतिबंधों को बायपास किया। इसके बाद कंपनी ने अपने आंतरिक मूल्यांकनों में लाइव इंटरनेट एक्सेस पर प्रतिबंध बढ़ा दिए हैं।
क्लॉड एआई ने सुरक्षा नियमों को कैसे किया बायपास?
- एंथ्राेपिक ने अपनी रिपोर्ट में बताया कि उसके आंतरिक मूल्यांकनों के दौरान क्लॉड मॉडल के कई ऐसे व्यवहार सामने आए, जिनकी उम्मीद नहीं थी। कंपनी के मुताबिक, कुछ मामलों में मॉडल ने बुनियादी सॉफ्टवेयर कमजोरियों का फायदा उठाकर सर्वर पर कमांड चलाए। वहीं, कुछ मामलों में स्पष्ट निर्देशों के बावजूद लाइव वेबसाइटों पर फॉर्म सबमिट किए गए।
- जांच में यह भी सामने आया कि मॉडल ने पेवॉल यानी भुगतान संबंधी प्रतिबंधों के पीछे उपलब्ध डेटा तक पहुंचने की कोशिश की। कुछ उदाहरणों में अमेरिकी संघीय, राज्य और स्थानीय सरकारी एजेंसियों की ओर से संचालित वेबसाइटें भी शामिल थीं।
- इन घटनाओं के बाद एंथ्राेपिक ने अपनी जांच का दायरा साइबर सुरक्षा मूल्यांकनों से आगे बढ़ाया और इंटरनेट से जुड़े एआई सिस्टम की सुरक्षा व्यवस्था की समीक्षा शुरू की। कंपनी ने व्हाइट हाउस को भी इन निष्कर्षों की जानकारी दी और संबंधित सरकारी एजेंसियों को सूचित किया।
क्लॉड माइथोस प्रीव्यू ने सॉफ्टवेयर की कमजोरी का उठाया फायदा
एंथ्राेपिक की रिपोर्ट में एक मामला क्लॉड माइथोस प्रीव्यू से जुड़ा है। यह मॉडल विश्वविद्यालय की ओर से होस्ट किए गए एक वैज्ञानिक विश्लेषण टूल का इस्तेमाल कर रहा था। इस दौरान उसे एक त्रुटि का सामना करना पड़ा।
इसके बाद मॉडल ने एक स्क्रिप्ट में कमजोरी की पहचान की और उसका इस्तेमाल करके सर्वर पर कमांड चलाए। यह मामला दिखाता है कि किसी तकनीकी समस्या को हल करने की कोशिश में एआई मॉडल किस तरह अपने लिए उपलब्ध सिस्टम की कमजोरियों का फायदा उठा सकता है। हालांकि, रिपोर्ट में इस घटना से वास्तविक दुनिया में किसी बड़े नुकसान की पुष्टि नहीं की गई है।
Claude Haiku 4.5 ने निर्देश के बावजूद सबमिट किया फॉर्म
इसके अलावा रिपोर्ट में Claude Haiku 4.5 से जुड़ा एक अन्य मामला भी सामने आया है। मॉडल को फॉर्म सबमिट करने से पहले रुकने का निर्देश दिया गया था, लेकिन उसने इसके बावजूद एक ऑनलाइन फॉर्म सबमिट कर दिया। एक अलग परीक्षण में पुलिस को सूचना देने वाला टिप फॉर्म भी सबमिट किया गया, जिसमें काल्पनिक जानकारी थी। इस फॉर्म को स्पैम के रूप में चिह्नित कर दिया गया और आगे नहीं भेजा गया। ये घटनाएं इस सवाल को उठाती हैं कि क्या केवल स्पष्ट निर्देश देना पर्याप्त है, या AI मॉडल को वास्तविक वेबसाइटों और बाहरी सिस्टम के साथ काम करने के दौरान अतिरिक्त तकनीकी नियंत्रणों की भी जरूरत है।
ब्राउजर सेटिंग्स और यूआरएल शॉर्टनिंग का भी इस्तेमाल
साथ ही एंथ्रोपिक को ऐसे मामले भी मिले जिनमें मॉडल ने ब्राउजर सेटिंग्स और एक्सेस टोकन का इस्तेमाल करके सार्वजनिक रूप से उपलब्ध, लेकिन फीस-प्रतिबंधित जानकारी हासिल की। इसके अलावा, कुछ मामलों में URL शॉर्टनिंग सेवाओं का उपयोग इंटरनेट एक्सेस टूल्स की ओर से लगाई गई सीमाओं को दरकिनार करने के लिए किया गया। URL शॉर्टनिंग में लंबे वेब एड्रेस को छोटे लिंक में बदला जाता है।
इन घटनाओं से पता चलता है कि इंटरनेट एक्सेस वाले AI एजेंट केवल वेबसाइट खोलने तक सीमित नहीं रहते। वे कई टूल्स और तकनीकी प्रक्रियाओं के साथ काम करते हैं, इसलिए उनकी गतिविधियों पर नजर रखना और प्रतिबंधों को प्रभावी बनाए रखना चुनौतीपूर्ण हो सकता है।
एंथ्राेपिक ने क्या कदम उठाए?
- कुछ सार्वजनिक मूल्यांकनों को बंद किया गया है या उन्हें ऑफलाइन कर दिया गया है।
- संभावित रूप से असुरक्षित व्यवहार का पता लगाने और उसे रोकने के लिए वेब-एक्सेस टूल्स को अपडेट किया गया है।
- स्वचालित डिटेक्शन और ब्लॉकिंग टूल्स का रिपोर्ट किए गए मामलों पर परीक्षण किया गया। कंपनी के अनुसार, इन टूल्स ने सभी मामलों को सफलतापूर्वक ब्लॉक कर दिया।
- ऐसे ट्रेनिंग एनवायरनमेंट्स को हटाया या ठीक किया जा रहा है, जो मॉडल को टूल संबंधी प्रतिबंधों को दरकिनार करने के लिए इनाम देते हैं। इस तरह के व्यवहार को 'रिवॉर्ड हैकिंग' कहा जाता है।
- कोडिंग के अलावा वेब सर्च और कंप्यूटर उपयोग से जुड़े कामों में भी अलाइनमेंट ट्रेनिंग का विस्तार किया जा रहा है।
- एंथ्राेपिक ने कहा कि वह वेब-सक्षम मूल्यांकनों, आंतरिक एआई एजेंट के इस्तेमाल और ट्रेनिंग एनवायरनमेंट्स में मॉडल के ट्रांसक्रिप्ट्स की समीक्षा जारी रखेगी। जांच आगे बढ़ने पर कंपनी और मामलों की जानकारी भी दे सकती है।
क्या इन घटनाओं से वास्तविक दुनिया में नुकसान हुआ?
एंथ्राेपिक के अनुसार, अब तक सामने आए मामलों का वास्तविक दुनिया पर न्यूनतम प्रभाव पड़ा। कंपनी ने यह भी कहा कि ये घटनाएं 30 जुलाई और 9 सितंबर को रिपोर्ट किए गए साइबर सुरक्षा मामलों की तुलना में काफी कम गंभीर थीं। कंपनी की जानकारी के अनुसार, नए पहचाने गए किसी भी मामले में ग्राहकों का डेटा या Anthropic के आंतरिक सिस्टम शामिल नहीं थे।
हालांकि, इसका मतलब यह नहीं है कि ऐसी घटनाओं को नजरअंदाज किया जा सकता है। वास्तविक वेबसाइटों और बाहरी सिस्टम तक पहुंच रखने वाले AI एजेंटों के अनपेक्षित व्यवहार से सुरक्षा, गोपनीयता और डिजिटल सेवाओं के संचालन से जुड़े जोखिम पैदा हो सकते हैं।