New Delhi,
कृत्रिम बुद्धिमत्ता क्षेत्र की प्रमुख कंपनी OpenAI ने अपने ChatGPT प्लेटफॉर्म में नया image generation मॉडल ‘Images 2.0’ शामिल किया है। यह नया मॉडल पहले के मुकाबले अधिक सटीक, realistic और उपयोगी visuals तैयार करने में सक्षम बताया जा रहा है।
कंपनी के अनुसार, यह मॉडल जटिल निर्देशों को बेहतर तरीके से समझकर objects को सही स्थान पर प्रस्तुत करता है। इसके साथ ही dense text, user interface और कई भाषाओं से जुड़े content को भी अधिक स्पष्टता के साथ तैयार करता है। यह अलग-अलग आकार और format के अनुसार images बना सकता है, जिनका उपयोग social media, presentation और अन्य डिजिटल माध्यमों में किया जा सकता है। इस नए मॉडल में ‘thinking’ क्षमता को जोड़ा गया है, जिससे यह real-time जानकारी के लिए web search का उपयोग कर सकता है। साथ ही एक ही निर्देश से कई अलग-अलग images तैयार करने और उनके परिणामों की जांच करने की सुविधा भी मिलती है। इससे उपयोगकर्ताओं को कम मेहनत में बेहतर visual सामग्री प्राप्त करने में मदद मिलेगी।
भारतीय भाषाओं समेत कई भाषाओं में बेहतर प्रदर्शन
OpenAI ने बताया कि यह मॉडल विभिन्न भाषाओं में भी बेहतर काम करता है। विशेष रूप से हिन्दी, जापानी, चीनी, कोरियाई और बंगाली जैसी भाषाओं के text को अधिक स्पष्ट रूप से दर्शाने में यह सक्षम है। इससे वैश्विक स्तर पर उपयोगकर्ताओं के लिए इसकी उपयोगिता बढ़ेगी।
visual गुणवत्ता और design में सुधार
Images 2.0 मॉडल में फोटो, cinematic दृश्य, manga और pixel art जैसे विभिन्न styles में बेहतर गुणवत्ता देखने को मिलती है। इसमें रोशनी, texture और छोटे-छोटे विवरणों को अधिक सटीकता से प्रस्तुत किया जाता है। कंपनी ने बताया कि इस तकनीक का उपयोग UI screenshot, magazine layout, infographic, handwritten note, comic, advertisement और cinematic content जैसे कई क्षेत्रों में किया जा सकता है। साथ ही यह Canva, Figma और Adobe जैसे प्लेटफॉर्म पर design कार्यों में भी सहायक है। developers इस मॉडल को ‘gpt-image-2’ API के माध्यम से अपने products में जोड़ सकते हैं, जिससे design, marketing, शिक्षा और content निर्माण जैसे क्षेत्रों में इसका उपयोग संभव होगा। यह सुविधा ChatGPT और Codex प्लेटफॉर्म पर भी उपलब्ध कराई गई है।
कुछ सीमाएं अब भी मौजूद
हालांकि OpenAI ने यह भी स्वीकार किया कि यह मॉडल अभी अत्यधिक जटिल संरचनाओं या बहुत अधिक दोहराव वाले pattern को पूरी तरह सटीकता से प्रस्तुत करने में सीमित है। कुछ मामलों में diagram जैसे output को मानव जांच की आवश्यकता हो सकती है। कंपनी ने बताया कि इस मॉडल में कई सुरक्षा स्तर जोड़े गए हैं, ताकि भ्रामक या हानिकारक content को रोका जा सके। इसके लिए prompt और image स्तर पर जांच के साथ metadata tagging और watermarking जैसे उपाय शामिल किए गए हैं। यह नया संस्करण फिलहाल उपलब्ध है, जिसमें advanced सुविधाएं paid users के लिए प्रदान की गई हैं। API के माध्यम से उपयोग करने पर इसकी कीमत image की गुणवत्ता और resolution के अनुसार तय की जाएगी।

