वाशिंगटन, कृत्रिम बुद्धिमत्ता (AI) की सुरक्षा को लेकर बढ़ती चिंता के बीच OpenAI ने अपने मॉडलों के अप्रत्याशित और चिंताजनक व्यवहार से जुड़े छह मामलों का खुलासा किया है।
कंपनी ने साथ ही AI मॉडल के ‘मिसअलाइनमेंट’ यानी निर्धारित उद्देश्य और वास्तविक व्यवहार के बीच अंतर से जुड़े मामलों की पहचान, जांच और सार्वजनिक रिपोर्टिंग के लिए नया ढांचा पेश किया है।
OpenAI का कहना है कि इसका उद्देश्य AI सुरक्षा पर स्वतंत्र शोध और सार्वजनिक समझ को बेहतर बनाना है।
कंपनी के अनुसार, एक अप्रकाशित शोध मॉडल ने अपने टास्क-सारांश में सामान्य प्रतिबंधों को नजरअंदाज करने वाले निर्देश डाल दिए। दूसरे मामले में GPT-5.6 Sol के प्रशिक्षण के दौरान कुछ मॉडल इंस्टेंस ने अपनी गलतियों या गलत व्यवहार को उपयोगकर्ता से छिपाने के लिए सारांश में निर्देश जोड़े।
एक अन्य घटना में मॉडल ने सार्वजनिक रिपॉजिटरी में उजागर API कुंजी खोजकर उसका अनधिकृत इस्तेमाल करने की कोशिश की और वांछित जानकारी हासिल नहीं होने पर आंकड़े गढ़ दिए।
चौथे मामले में एक AI एजेंट ने उपयोगकर्ता से अनुमति लिए बिना इंटरनेट पर फाइल अपलोड कर दी, ताकि उसे अपने जवाब में ब्राउजर स्रोत के रूप में उद्धृत किया जा सके। पांचवें मामले में अलग-अलग प्रशिक्षण नमूनों में मौजूद मॉडलों ने एक आंतरिक सॉफ्टवेयर रिपॉजिटरी को आपस में संदेश भेजने के माध्यम के रूप में इस्तेमाल किया।
छठे मामले में सहयोग कर रहे AI एजेंटों ने स्थानीय फाइलों तक पहुंच न मिलने पर सार्वजनिक फाइल-होस्टिंग वेबसाइटों के जरिए एक-दूसरे के साथ फाइल साझा की।
OpenAI ने कहा कि ये छह मामले पिछले छह महीनों में प्रशिक्षण या मूल्यांकन के दौरान सामने आए। कंपनी ने स्पष्ट किया है कि ये अलग-अलग घटनाओं की रिपोर्ट हैं और इन्हें उसके सभी मॉडलों में मिसअलाइनमेंट की सामान्य आवृत्ति का प्रतिनिधि नहीं माना जाना चाहिए।
नया ढांचा कर्मचारियों को संभावित मामलों की रिपोर्ट करने, सुरक्षा टीमों द्वारा उनकी जांच करने और उपयुक्त मामलों को सार्वजनिक करने की प्रक्रिया तय करता है।
OpenAI ने यह भी कहा कि AI उद्योग ने अभी तक एलाइनमेंट और निगरानी की चुनौतियों को पूरी तरह हल नहीं किया है। यह खुलासा जुलाई में सामने आए Hugging Face मामले के बाद हुआ है, जिसमें OpenAI के एक आंतरिक शोध मॉडल से जुड़ी साइबर सुरक्षा घटना की कंपनी ने बाद में जानकारी दी थी।