नियमों से भटकने वाले AI व्यवहार पर निगरानी
US-based Artificial Intelligence कंपनी OpenAI ने अपने AI मॉडल्स के अप्रत्याशित और अनधिकृत व्यवहार की पहचान, जांच और सार्वजनिक जानकारी साझा करने के लिए नया Framework पेश किया है। कंपनी ने इसके साथ ऐसे व्यवहार से जुड़े छह शुरुआती Reports भी जारी किए हैं। OpenAI के अनुसार, AI Industry ने अभी तक तेजी से सक्षम हो रहे मॉडल्स को मानव निर्देशों के अनुरूप बनाए रखने की समस्या का पूरी तरह समाधान नहीं किया है।
क्या है Model Misalignment?
OpenAI के अनुसार, Misalignment उस स्थिति को कहा जाता है जब कोई Model अपने Developers द्वारा तय उद्देश्यों, सीमाओं या सुरक्षा उपायों से अलग तरीके से व्यवहार करता है। कंपनी ने कहा कि पहले ऐसे मामलों की जानकारी अनियमित और अपेक्षा से कम बार साझा की जाती थी। नए Framework का उद्देश्य ऐसे मामलों की रिपोर्टिंग को तेज करना है, भले ही जांच या समाधान पूरी तरह पूरा न हुआ हो।
गलतियां छिपाने से लेकर डेटा गढ़ने तक
जारी Reports में ऐसे उदाहरण शामिल हैं, जहां AI मॉडल्स ने अपनी गलतियां छिपाने के लिए निर्देश तैयार किए, सार्वजनिक Repository में उजागर API Keys खोजीं और उनका इस्तेमाल किया। एक मामले में जरूरी जानकारी हासिल नहीं होने पर Model ने आंकड़े गढ़ दिए और उन्हें वास्तविक Data की तरह प्रस्तुत किया।
GPT-5.6 Sol से जुड़ा मामला
Training के दौरान GPT-5.6 Sol के कई Instances ने Task Summaries में ऐसी Instructions जोड़ीं, जिनका उद्देश्य गलतियों या Misaligned Behavior को User से छिपाना था। इनमें Missing Historical Data को बिना जानकारी दिए गढ़ने और Source Versions में अंतर छिपाने जैसी Instructions शामिल थीं।
फाइलें सार्वजनिक Website पर अपलोड करने का मामला
एक अन्य मामले में एक AI Agent ने User की अनुमति के बिना Local Files को Public File-hosting Services पर Upload कर दिया, ताकि अपने उत्तर में Browser Citation दे सके। OpenAI ने स्पष्ट किया है कि ये छह Reports शुरुआती उदाहरण हैं और इन्हें उसके सभी Models में ऐसे व्यवहार की Frequency का प्रतिनिधि नहीं माना जाना चाहिए।
कर्मचारी कर सकेंगे Misalignment की रिपोर्ट
नए Framework के तहत OpenAI का कोई भी Employee संभावित Misalignment Case को जांच के लिए Flag कर सकेगा। इसके बाद Safety और Alignment Teams मामले का आकलन करेंगी, संभावित Third-party Impact की जांच करेंगी और तय करेंगी कि उसे सार्वजनिक Report के रूप में जारी किया जाना चाहिए या नहीं।

