नित्यानंद माथुर¹ *, श्याम मार्जित² *, अभ्रा चौधरी³,⁴, अंजन दत्ता⁴
¹ स्मॉलेस्ट एआई, ² भारतीय विज्ञान संस्थान, ³ एक्सेटर विश्वविद्यालय, ⁴ सरे विश्वविद्यालय
¹nityanand@smallest.ai, ²marjitshyam@gmail.com, ³ac1151@exeter.ac.uk, ⁴anjan.dutta@surrey.ac.uk
परियोजना पृष्ठ: https://clipdrawx.github.io/
*बराबर योगदान।
CLIP टेक्स्ट प्रॉम्प्ट के साथ जिन विज़ुअल कॉन्सेप्ट्स को जोड़ता है, उन्हें समझने के उद्देश्य से, हम दिखाते हैं कि CLIP के लेटेंट स्पेस को पूरी तरह से सीधी रेखाओं और वृत्तों जैसे सरल ज्यामितीय प्रिमिटिव्स पर लीनियर ट्रांसफॉर्मेशन्स के रूप में विज़ुअलाइज़ किया जा सकता है। हालाँकि मौजूदा दृष्टिकोण ऑप्टिमाइज़ेशन-के-माध्यम-से-स्केच-सिंथेसिस द्वारा इसे प्राप्त करते हैं, लेकिन वे ऐसा उच्च क्रम के बेज़ियर कर्व्स के स्पेस पर करते हैं, जो संरचनाओं के एक बहुत बड़े समूह को प्रदर्शित करते हैं जिसमें वे विकसित हो सकते हैं, क्योंकि उनमें से अधिकांश सार्थक स्केच बनाने के लिए गैर-जरूरी हैं। हम CLIPDraw++ प्रस्तुत करते हैं, एक ऐसा एल्गोरिदम जो केवल सीधी रेखाओं और वृत्तों जैसे सरल प्रिमिटिव आकृतियों का उपयोग करके, CLIP टेक्स्ट एम्बेडिंग्स के लिए काफी बेहतर विज़ुअलाइज़ेशन प्रदान करता है। यह संभावित आउटपुट के सेट को इन प्रिमिटिव्स पर लीनियर ट्रांसफॉर्मेशन्स तक सीमित करता है, जिससे स्वाभाविक रूप से एक सरल गणितीय रूप प्रदर्शित होता है। CLIPDraw++ की सिंथेसिस प्रक्रिया को एंड-टू-एंड ट्रैक किया जा सकता है, जिसमें प्रत्येक विज़ुअल कॉन्सेप्ट को विशेष रूप से प्रिमिटिव्स के रूप में व्यक्त किया जाता है।

चित्र 1. हमारी पद्धति, CLIPDraw++ शब्दों पर ध्यान केंद्रित करते हुए वृत्त, सीधी रेखाओं और अर्ध-वृत्त जैसे सरल मूल आकृतियों का उपयोग करके इनपुट टेक्स्ट प्रॉम्प्ट के आधार पर वेक्टर रेखाचित्रों को संश्लेषित करती है। अधिक परिणाम परिशिष्ट में हैं।
1. परिचय
रेखाचित्रों और मौखिक विवरणों जैसे सरलीकृत निरूपण विचारों को संप्रेषित करने, विषय के मूल सार पर ध्यान केंद्रित करने के शक्तिशाली माध्यम हैं। जहाँ भाषा अमूर्त अर्थों को संप्रेषित करती है, वहीं रेखाचित्र दृश्य विशिष्टताओं को दर्शाते हैं। उदाहरण के लिए, एक डिज़ाइनर डिज़ाइन योजनाओं की समीक्षाओं के दौरान स्पष्टता के लिए ग्राहक के विचारों का रेखाचित्र बना सकता है, और इस प्रक्रिया को स्वचालित करने से श्रम लागत कम हो सकती है।
इस टेक्स्ट-टू-स्केच जनरेशन कार्य के महत्व को समझते हुए, कई शोध पहलों ने CLIP मॉडल [24] और परिवर्तनकारी डिफ्यूजन मॉडल [25] का उपयोग करते हुए टेक्स्ट-कंडीशन्ड स्केच जनरेशन की खोज की है। CLIPDraw [5] प्रीट्रेन्ड CLIP टेक्स्ट-इमेज एनकोडर का उपयोग करके टेक्स्ट से चित्र बनाता है, जबकि VectorFusion [11] व्यापक डेटासेट पर निर्भर किए बिना वेक्टर ग्राफिक्स के लिए टेक्स्ट-निर्देशित मॉडल को अनुकूलित करता है। ऐसे मॉडल इस प्रकार कला और डिज़ाइन [7, 11] में बढ़ती भूमिका पा रहे हैं, अक्सर कई कार्यों में मानव प्रदर्शन को पीछे छोड़ देते हैं [12, 26]। हालाँकि, अंतर्निहित एल्गोरिदम की जटिलता उनके प्रदर्शन के साथ बढ़ती जाती है, जिससे वे कम पारदर्शी और इसलिए कम नियंत्रणीय हो जाते हैं।
इस उद्देश्य के लिए, हम स्केच संश्लेषण की समस्या को विशेष रूप से गणितीय रूप से सुलभ मूल आकृतियों (प्रिमिटिव्स) के संदर्भ में ढालना चाहते हैं। हमारे एल्गोरिदम के घटक सीधी रेखाएं, वृत्त और अर्ध-वृत्त जैसी बुनियादी ज्यामितीय आकृतियों से बने हैं, जिसमें संश्लेषण प्रक्रिया को इन बुनियादी आकृतियों पर रैखिक परिवर्तन के रूप में पूरी तरह से संक्षेपित किया जा सकता है। इस तरह के निर्माण का दोहरा लाभ है - (1) जिन मापदंडों को अनुकूलित करने की आवश्यकता है उनकी संख्या नाटकीय रूप से कम हो जाती है, और (2) संश्लेषण प्रक्रिया के प्रत्येक चरण को स्पष्ट रूप से ट्रैक किया जा सकता है और एक बंद रूप रैखिक अभिव्यक्ति के माध्यम से व्यक्त किया जा सकता है। हमारा दृष्टिकोण संश्लेषण-के-माध्यम से-अनुकूलन पर आधारित है, जो वेक्टर स्ट्रोक का उपयोग करके विज़ुअलाइज़ करता है, जो प्राकृतिक भाषा टेक्स्ट प्रॉम्प्ट के अनुरूप CLIP [24] के प्रतिनिधित्व स्थान में एन्कोड किए गए विचारों को दर्शाता है। ऐसे वेक्टर स्ट्रोक, जैसा कि CLIPDraw [5] द्वारा रेखांकित किया गया है, पिक्सेल छवियों की तुलना में स्पष्ट रूप से विभाजित करने और सरल घटक विशेषता को सक्षम करते हैं। जबकि डिफ्यूजन जैसे उन्नत मॉडल उच्च गुणवत्ता वाले पिक्सेल रेखाचित्र [25] उत्पन्न कर सकते हैं, उनकी पिक्सेल जटिलता अंतर्निहित तर्क को अस्पष्ट कर सकती है। हालांकि, वेक्टराइज्ड स्ट्रोक का उपयोग करना, विशेष रूप से जब मूल आकृतियों तक सीमित हो, स्पष्टता और उन चरणों की बेहतर समझ को बढ़ाता है जो एक मॉडल स्केच को संश्लेषित करने के लिए लेता है, जबकि अत्याधुनिक परिणाम प्राप्त करने के लिए आवश्यक मापदंडों की संख्या को काफी कम करता है।
इस शोध पत्र में, हम CLIPDraw++ प्रस्तुत करते हैं, जो एक एल्गोरिदम है जो टेक्स्ट विवरणों के आधार पर उच्च-गुणवत्ता वाले वेक्टर रेखाचित्रों को संश्लेषित कर सकता है। यह न केवल रेखाचित्रों को संश्लेषित करता है बल्कि प्रारंभिक ज्यामितीय आकृतियों, जैसे सीधी रेखाएं, वृत्त और अर्ध-वृत्त, से अंतिम आउटपुट तक प्रत्येक वेक्टर स्ट्रोक के विकास को भी ट्रैक करता है। प्री-ट्रेंड टेक्स्ट-टू-इमेज डिफ्यूजन मॉडल [25] से क्रॉस-अटेंशन मैप्स का लाभ उठाते हुए, हम एक प्रारंभिक स्केच कैनवास को मूल आकृतियों के एक सेट के रूप में परिभाषित करते हैं, जिसके मापदंडों को एक डिफरेंशिएबल रास्टराइज़र [15] का उपयोग करके ट्यून किया जाता है। न्यूनतमता और एक सरल गणितीय रूप सुनिश्चित करने के लिए, हमने बेज़ियर वक्रों की तुलना में अधिक कठोर ज्यामिति वाली विशिष्ट प्रारंभिक आकृतियों का पालन करने के लिए मूल आकृतियों को बाधित किया है। हमारा CLIPDraw++, जो CLIPDraw [5] पर आधारित है, स्ट्रोक के लिए पूर्वनिर्धारित मूल आकृतियों का उपयोग करके खुद को अलग करता है, सरलता पर जोर देता है, जबकि CLIPDraw स्ट्रोक को जटिल, मनमाने आकार के बेज़ियर वक्रों के साथ शुरू करता है, जो आकृतियों के एक अनावश्यक रूप से बड़े सेट को प्रदर्शित करते हैं जिन्हें वे बदल सकते हैं, लेकिन सार्थक रेखाचित्रों के उत्पादन के लिए आवश्यक नहीं हैं। हमारी विधि इन सरल मूल आकृतियों को संबंधित स्केच स्ट्रोक में रैखिक रूप से बदल देती है, न कि CLIPDraw द्वारा निर्मित अधिक अमूर्त और समझने में कठिन रेखाचित्रों की तरह। हमारा CLIPDraw++ मौजूदा तरीकों की तुलना में प्रदर्शन और मेमोरी उपयोग दोनों के संदर्भ में अधिक कुशल तरीके से बेहतर रेखाचित्रों को संश्लेषित करता है। यह सुधार कम मूल आकृतियों के उपयोग के कारण है, जिनमें से प्रत्येक में कैनवास पर रणनीतिक रूप से वितरित कम नियंत्रण बिंदु होते हैं। प्रचलित जनरेटिव मॉडल [19] के विपरीत, जिसमें डिफ्यूजन मॉडल [25] शामिल हैं जो व्यापक पैरामीटर प्रशिक्षण की मांग करते हैं, हमारा CLIPDraw++ अनुकूलन के माध्यम से रेखाचित्रों को संश्लेषित करता है और बिना किसी विशिष्ट प्रशिक्षण के काम करता है। इसके बजाय, इनपुट टेक्स्ट प्रॉम्प्ट और संश्लेषित स्केच के बीच समानता को अधिकतम करने के लिए एक प्रीट्रेन्ड CLIP मॉडल का उपयोग मीट्रिक के रूप में किया जाता है।
संक्षेप में, हम निम्नलिखित योगदान करते हैं:
सरल ज्यामितीय आकृतियों पर रैखिक परिवर्तनों को सीखने के एक अच्छी तरह से समझे जाने वाले गणितीय ढांचे के संदर्भ में अनुकूलन के माध्यम से स्केच संश्लेषण की समस्या को प्रस्तुत करना
मूल आकृतियों का उपयोग करके एक स्केच कैनवास इनिशियलाइजेशन दृष्टिकोण का प्रस्ताव करना। पूर्व-प्रशिक्षित डिफ्यूजन मॉडल के क्रॉस-अटेंशन मैप का लाभ उठाकर, हम आवश्यकता के आधार पर इन मूल आकृतियों को कैनवास पर रणनीतिक रूप से वितरित करते हैं। इसके अलावा, इन मूल आकृतियों को कम अस्पष्टता (ओपेसिटी) के साथ शुरू करके, मॉडल केवल टेक्स्ट प्रॉम्प्ट से प्रासंगिक आकृतियों पर जोर देता है
हमारे अनुकूलन को "नियमित" करने के लिए एक अभिनव तकनीक के रूप में प्रिमिटिव-लेवल ड्रॉपआउट। ऐसा करने से, हम प्रभावी रूप से अति-अनुकूलन को कम करते हैं, शोर वाले स्ट्रोक को कम करते हैं, और संश्लेषित रेखाचित्रों की समग्र गुणवत्ता को बढ़ाते हैं
व्यापक गुणात्मक और मात्रात्मक प्रयोग मौजूदा तरीकों से बेहतर प्रदर्शन देने में हमारे नए घटकों की उपयोगिता को प्रदर्शित करते हैं, जबकि काफी सरल और पैरामीटर-कुशल संश्लेषण योजना का प्रदर्शन करते हैं।
2. संबंधित कार्य
स्केच जनरेशन: मुक्त-हस्त रेखाचित्र मानव दृश्य धारणा के अतिसूक्ष्मवाद का लाभ उठाते हुए अमूर्त विचारों को संप्रेषित करते हैं। वे संरचनात्मक [3] और शब्दार्थ [31] दोनों व्याख्याओं के आधार पर अमूर्त निरूपण का लक्ष्य रखते हैं। मानव ड्राइंग की नकल करने के उद्देश्य से डिजिटल स्केचिंग विधियों में निरूपण की एक विस्तृत श्रृंखला शामिल है, जिसमें इनपुट छवि के किनारे के नक्शे [4, 14, 16, 17, 29] पर आधारित लोगों से लेकर अमूर्तता के उच्च स्तर [2, 5, 8] में जाने वाले शामिल हैं, जिन्हें आमतौर पर वेक्टर प्रारूप में दर्शाया जाता है। वेक्टर स्केच निर्माण के क्षेत्र में, CLIPasso [31] और CLIPascene [30] जैसी पहल एक छवि इनपुट पर निर्भर हैं; इस बीच, CLIPDraw [5], VectorFusion [11] और DiffSketcher [32] जैसे दृष्टिकोण टेक्स्ट-आधारित सशर्त इनपुट के साथ जुड़ते हैं, जो अन्य बिना शर्त पद्धतियों से अलग खड़े हैं। विशेष रूप से, CLIPDraw [5] अनुकूलन-आधारित स्केच संश्लेषण को नियोजित करता है, जबकि VectorFusion [11] और DiffSketcher [32] दोनों डिफ्यूजन-आधारित दृष्टिकोण अपनाते हैं, जिसमें VectorFusion अव्यक्त स्थान (लेटेंट स्पेस) में अनुकूलन पर ध्यान केंद्रित करता है, जिससे यह DiffSketcher की तुलना में अधिक हल्का और कुशल बन जाता है जो छवि स्थान में अपना अनुकूलन करता है। इस पेपर में, हम टेक्स्ट-कंडीशन्ड स्केच संश्लेषण का पता लगाते हैं। मौजूदा दृष्टिकोणों से अलग, हम दिखाते हैं कि जटिल रेखाचित्रों को सरल ज्यामितीय मूल आकृतियों पर सरल रैखिक परिवर्तनों के रूप में संश्लेषित किया जा सकता है, जिसमें हमारी नवीनता हमारे निर्माण के अतिसूक्ष्मवाद में निहित है।
अनुकूलन के माध्यम से संश्लेषण: चित्र उत्पन्न करने के लिए किसी नेटवर्क को सीधे प्रशिक्षित करने के बजाय, सक्रियण अधिकतमकरण (एक्टिवेशन मैक्सिमाइजेशन) नामक एक अलग रणनीति मूल्यांकन के दौरान एक लक्ष्य से मेल खाने के लिए एक यादृच्छिक छवि को अनुकूलित करती [21] है। CLIPDraw [5] संश्लेषित छवि और एक निर्दिष्ट विवरण के बीच असमानता को कम करने के लिए CLIP भाषा-छवि एनकोडर [6, 24] का उपयोग करके इस दृष्टिकोण को आगे बढ़ाता है, जो बारीक विवरणों के बजाय व्यापक विशेषताओं पर ध्यान केंद्रित करता है। यद्यपि अनुकूलन के माध्यम से संश्लेषण के परिणामस्वरूप अक्सर अप्राकृतिक या भ्रामक चित्र [20] बनते हैं, 'प्राकृतिक छवि पूर्वताओं (प्रायर्स)' को नियोजित करना प्रामाणिकता को बनाए रख सकता है [21, 22], जिसमें अक्सर GAN का प्रतिबंधात्मक और कम्प्यूटेशनल रूप से गहन उपयोग शामिल होता है। इस पेपर में, हम मूल आकृतियों के ज्यामितीय परिवर्तनों के माध्यम से वस्तुओं और दृश्यों के रेखाचित्रों को संश्लेषित करने के लिए CLIPDraw की क्षमताओं का विस्तार करते हैं, जो CLIPDraw के दृष्टिकोण से भिन्न है, जो विश्लेषण करने में कठिन, मनमाने आकार के बेज़ियर वक्रों के साथ बनाए गए जटिल और अमूर्त रेखाचित्रों का उपयोग करता है।
वेक्टर ग्राफिक्स: हम [15] द्वारा शुरू किए गए वेक्टर ग्राफिक्स के लिए डिफरेंशिएबल रेंडरर का लाभ उठाते हैं, जो हाल की प्रगति के कारण अब वेक्टर-विशिष्ट डेटासेट तक सीमित नहीं है। CLIP [24] के आगमन ने, जो बेहतर विजुअल टेक्स्ट एम्बेडिंग को बढ़ावा देता है, CLIPDraw [5], CLIP-CLOP [18], और CLIPascene [30] सहित मजबूत स्केच संश्लेषण तकनीकों के विकास को प्रेरित किया है। हाल ही में पेश किया गया VectorFusion [11] भी एक डिफ्यूजन मॉडल के साथ एक डिफरेंशिएबल रेंडरर को एकीकृत करता है, जो आइकोनोग्राफी और पिक्सेल आर्ट जैसे वेक्टर ग्राफिक्स निर्माणों के उत्पादन में सहायता करता है।
रेखाचित्रों के लिए सरलीकृत निरूपण: न्यूरल स्केच निरूपण को पारदर्शी और सरलीकृत बनाने पर वर्तमान स्केच अनुसंधान काफी सीमित है, जो मुख्य रूप से स्ट्रोक-स्तर अमूर्तता [1] और स्ट्रोक स्थान उलटाव [23] के माध्यम से मानव रेखाचित्रों की व्याख्या करने पर ध्यान केंद्रित करता है। हालाँकि, जैसे-जैसे जनरेटिव एआई का सामग्री निर्माण में उपयोग बढ़ रहा है, रेखाचित्रों [5, 30, 31] के लिए ऐसे मॉडलों में निहित अमूर्तता को तोड़ना और भी महत्वपूर्ण हो जाता है। हम एक ऐसा दृष्टिकोण प्रस्तुत करते हैं जो न केवल गणितीय रूप से सरल मूल आकृतियों के संदर्भ में रेखाचित्रों को संश्लेषित करता है, बल्कि CLIP [24] जैसे फाउंडेशन मॉडल के प्रतिनिधित्व स्थान में मानव-समझने योग्य अंतर्दृष्टि भी प्रदान करता है।
3. CLIPDraw++
इस कार्य में, हम रेखाचित्रों को रैखिक रूप से रूपांतरित मूल आकृतियों के संग्रह के रूप में व्यक्त करके उन्हें संश्लेषित करना चाहते हैं, जिन्हें एक इनपुट पाठ के आधार पर ट्रैक करने योग्य तरीके से अंतिम स्केच में स्ट्रोक के एक सेट में विकसित किया जा सकता है। हम सीधी रेखाएं, वृत्त और अर्ध-वृत्त जैसी मूल आकृतियों के साथ एक कैनवास को भरकर शुरुआत करते हैं, जिसका विवरण सेक. 3.2 में है। फिर हम सेक. 3.4 में निर्दिष्ट प्रशिक्षण मानदंडों द्वारा निर्देशित सेक. 3.3 में उल्लिखित स्केच संश्लेषण प्रक्रिया के दौरान उनकी प्रगति को ट्रैक करते हैं। प्रस्तावित दृष्टिकोण का एक उदाहरण चित्र 2 में प्रदान किया गया है।
3.1. मूल आकृतियों से स्केच संश्लेषण
दिए गए एक प्रारंभिक कैनवास C जो मूल आकृतियों के एक सेट {p1, p2, ..., pn} से C = p1 ⊕ p2... ⊕ pn के रूप में बना है, हम गुणात्मक रूप से दिखाते हैं कि किसी भी शब्दार्थ रूप से सार्थक स्केच Y को C पर एक परिवर्तन f (·) के रूप में इस तरह बनाया जा सकता है कि S = f(C) = f1(p1) ⊕ f2(p2)... ⊕ fn(pn), जहाँ f1, f2, ..., fn मूल आकृतियों पर रैखिक परिवर्तन हैं, और ⊕ एक एकल कैनवास में मूल आकृतियों के संयोजन को दर्शाता है। दूसरे शब्दों में, कोई भी मूल आकृति p ∈ C लक्ष्य स्केच में एक अवधारणा y ∈ Y को y = F · p के रूप में मैप करती है, जहाँ F रैखिक परिवर्तन को एन्कोड करने वाला एक मैट्रिक्स है। इस प्रकार सीखने की समस्या F का सबसे अच्छा सन्निकटन F˜ खोजना बन जाती है ताकि p को Y में किसी लक्ष्य अवधारणा को चित्रित करने के लिए उचित रूप से रूपांतरित किया जा सके। इस प्रकार, एक प्रारंभिक कैनवास और एक लक्ष्य स्केच को देखते हुए, लक्ष्य में सभी उप-अवधारणाओं yi ∈ Y के पार, निम्नलिखित उद्देश्य को अनुकूलित करने की आवश्यकता है:
min F l(CF , Y) = arg min i,F ∑ j ||yi − F˜ · pj || (1)
जहाँ F = {F˜ 1, F˜2, ..., F˜n} क्रमशः C से {p1, p2, ..., pn} पर लागू रैखिक परिवर्तनों का एक सेट है ताकि लक्ष्य स्केच Y का एक सन्निकटन प्राप्त किया जा सके, और CF कैनवास C पर लागू परिवर्तनों के सेट F के तहत प्राप्त स्केच को दर्शाता है।
हालाँकि, लक्ष्य अवधारणा स्केच Y उपलब्ध नहीं है, क्योंकि मुख्य उद्देश्य इसे एक पाठ्य विवरण से संश्लेषित करना है। इसलिए हम एक विज़न-लैंग्वेज मॉडल चुनते हैं, विशेष रूप से, CLIP [24], और इसके अव्यक्त प्रतिनिधित्वों का उपयोग लक्ष्य स्केच के प्रतिनिधि के रूप में करते हैं। CLIP का प्रतिनिधित्व स्थान एकीकृत है, यानी, प्राकृतिक भाषा के वाक्यों और उनके संबंधित दृश्य समकक्षों की एम्बेडिंग समान होती है। इसलिए, एक स्केच जो एक टेक्स्ट प्रॉम्प्ट के माध्यम से व्यक्त किए गए समान शब्दार्थ को कैप्चर करता है, उसकी CLIP के प्रतिनिधित्व स्थान में समान एम्बेडिंग होनी चाहिए। इस प्रकार हम CLIP टेक्स्ट और स्केच एम्बेडिंग्स को क्रमशः ग्राउंड-ट्रुथ अवधारणा Y स्केच और संश्लेषित स्केच CF के लिए प्रतिनिधि प्रतिनिधित्व के रूप में कार्य कराते हैं और निम्नलिखित उद्देश्य को अनुकूलित करते हैं जो समीकरण (1) के समतुल्य है:
min F l(CF , xt) = arg min F ||T (xt) − I [∑ i F˜i · pi]|| (2)
इस प्रकार समीकरण (2) के निर्माण में, टेक्स्ट प्रॉम्प्ट xt ग्राउंड ट्रुथ Y के लिए एक प्रतिनिधि के रूप में कार्य करता है। फ़ंक्शन I और T क्रमशः CLIP के इमेज और टेक्स्ट एनकोडर को दर्शाते हैं।
3.2. मूल आकृतियों पर आधारित कैनवास आरंभीकरण
हम पहले पाठ्य इनपुट से प्राप्त आवश्यक लैंडमार्क बिंदुओं की पहचान करके स्केच कैनवास को आरंभ करते हैं। इसके बाद, इन लैंडमार्क को सीधी रेखाएं, वृत्त और अर्ध-वृत्त जैसी मूल आकृतियों का उपयोग करके भरा जाता है।

चित्र 2. CLIPDraw++ में रणनीतिक कैनवास आरंभीकरण शामिल है, जो डिफ्यूजन-आधारित क्रॉस-अटेंशन मैप्स और मूल आकृतियों की पैच-वार व्यवस्था के साथ-साथ एक प्रिमिटिव-लेवल ड्रॉपआउट (PLD) का उपयोग करता है। प्रस्तावित मॉडल, समानता को अधिकतम करने के लिए CLIP मॉडल से पूर्व-प्रशिक्षित छवि (I) और टेक्स्ट (T) एनकोडर के उपयोग के साथ मिलकर, खुद को AI-संचालित स्केच संश्लेषण के क्षेत्र में एक कुशल और उपयोगकर्ता के अनुकूल उपकरण के रूप में स्थापित करता है। क्रॉस-अटेंशन मैप बनाने के लिए हाइलाइट किए गए शब्द का उपयोग किया जाता है।
अटेंशन मैप्स का उपयोग करके लैंडमार्क की पहचान करना: CLIPDraw++ मूल आकृतियों का उपयोग करके एक कैनवास शुरू करता है, जिसके लिए टेक्स्ट इनपुट के आधार पर उस कैनवास पर महत्वपूर्ण लैंडमार्क की पहचान करने की आवश्यकता होती है। उसके लिए, हम अव्यक्त डिफ्यूजन मॉडल [25] से UNet आर्किटेक्चर से प्राप्त एक अभिन्न अंग के रूप में DAAM [28] जनरेटेड टोकन वार क्रॉस-अटेंशन तंत्र को नियोजित करते हैं। विशेष रूप से, हम ऊपरी और निचले दोनों नमूना ब्लॉकों से अलग से अटेंशन विशेषताओं को कैप्चर करते हैं, उन्हें एक एकीकृत अटेंशन मैप में मिलाते हैं। इस संयुक्त अटेंशन मैप को फिर एक संभाव्य वितरण मानचित्र बनाने के लिए सॉफ्टमैक्स फ़ंक्शन का उपयोग करके सामान्यीकृत किया जाता है। यह वितरण मानचित्र k पदों के चयन के हमारे अगले कार्य के आधार के रूप में कार्य करता है। इस अटेंशन-व्युत्पन्न वितरण मानचित्र के भीतर प्रत्येक बिंदु के परिमाण का उपयोग चयन प्रक्रिया को निर्देशित करने के लिए एक भार पैरामीटर के रूप में किया जाता है। यह सुनिश्चित करता है कि पदों का चयन अंतर्निहित अटेंशन-आधारित विशेषताओं की प्रमुखता और महत्व से प्रभावित होता है। शब्दार्थ चित्रण की ओर अभिसरण में सुधार करने के लिए, हम लक्ष्य छवि के प्रमुख क्षेत्रों (यहाँ पैच) के आधार पर मूल आकृतियों या प्रारंभिक स्ट्रोक को रखते हैं।
पैच-आधारित आरंभीकरण (इनिशियलाइजेशन): बिंदु-आधारित आरंभीकरण समान स्ट्रोक प्रकारों [5, 31] के लिए प्रभावी है, लेकिन अटेंशन मैप पर किसी विशिष्ट बिंदु के लिए सही मूल आकृति का निर्धारण करना कठिन हो सकता है। इसके अतिरिक्त, एक ही स्थान पर विभिन्न मूल आकृतियों को रखना समस्याग्रस्त है क्योंकि उच्च बिंदु घनत्व के कारण अव्यवस्था हो सकती है, जिससे असमान मूल आकृति वितरण और गंदे रेखाचित्र बन सकते हैं। इसे संबोधित करने के लिए, हमारा CLIPDraw++ सटीक अटेंशन मैप स्थानों के बजाय निश्चित सीमाओं या 'पैच' में मूल आकृतियों को पेश करता है, जो भीतर के सभी बिंदुओं का प्रतिनिधित्व करता है। यह 224 × 224 कैनवास को 32 × 32 के पैच में विभाजित करता है। प्रत्येक पैच को बुनियादी मूल आकृतियों का मिश्रण मिलता है: सीधी रेखाएं, वृत्त और अर्ध-वृत्त, जो अटेंशन मैप स्थानीय मैक्सिमा के आसपास समान आकार के वितरण को बढ़ावा देते हैं। बिंदु-आधारित पर पैच-आधारित आरंभीकरण के लाभों पर सेक. 4.3 में चर्चा की गई है और चित्र 7 में चित्रित किया गया है।
मूल आकृतियों के साथ स्केच कैनवास आरंभ करना: हम एक स्केच को कैनवास में दिखाई देने वाले n स्ट्रोक {s1, . . . , sn} के एक सेट के रूप में परिभाषित करते हैं। इन स्ट्रोक की उत्पत्ति और विकास को स्पष्ट करने के लिए, हम अपने कैनवास को सीधी रेखाएं, वृत्त और अर्धवृत्त जैसी मूल आकृतियों के साथ शुरू करते हैं। प्रत्येक मूल आकृति को द्वि-आयामी आकार का उपयोग करके बनाया जाता है जो दो से चार नियंत्रण बिंदुओं को नियोजित करता है, जिसे si = {p j i } c j=1 = {(xi , yi) j}c j=1 और एक अस्पष्टता (ओपेसिटी) विशेषता αi के रूप में दर्शाया जाता है; जहाँ c ∈ {2, 3, 4} नियंत्रण बिंदुओं की संख्या को दर्शाता है। उदाहरण के लिए, सीधी रेखा में 2 नियंत्रण बिंदु होते हैं, जबकि अर्ध-वृत्त और वृत्त में 3 और 4 होते हैं। हम अनुकूलन प्रक्रिया में प्रत्येक नियंत्रण बिंदु की स्थिति और स्ट्रोक की अस्पष्टता को शामिल करते हैं और पाठ्य विवरण से स्केच के संश्लेषण को निर्देशित करने के लिए CLIP में शब्दार्थ ज्ञान का उपयोग करते हैं। स्ट्रोक के मापदंडों को एक डिफरेंशिएबल रास्टराइज़र R में फीड किया जाता है, जो रास्टर स्केच S = R((s1, α1), . . . ,(sn, αn)) = R(({p j 1 } c j=1, α1), . . . ,({p j 1 } c j=1, αn)) बनाता है।
3.3. स्केच संश्लेषण का अनुकूलन
अवांछित स्ट्रोक एक स्केच में शोर पैदा कर सकते हैं, जिससे स्वचालित स्केच निर्माण के लिए अनावश्यक स्ट्रोक को हटाना महत्वपूर्ण हो जाता है। यह अनुभाग मौजूदा मशीन लर्निंग तकनीकों और मानव स्केचिंग प्रथाओं से प्रेरणा लेते हुए, शोर वाले स्ट्रोक को खत्म करने की प्रक्रियाओं की रूपरेखा तैयार करता है।
प्रिमिटिव-लेवल ड्रॉपआउट: ड्रॉपआउट [27] तंत्रिका नेटवर्क के लिए एक नियमितीकरण तकनीक है जहाँ प्रशिक्षण के दौरान न्यूरॉन्स के यादृच्छिक उपसमुच्चय अस्थायी रूप से निष्क्रिय हो जाते हैं। यह प्रक्रिया फीचर डिटेक्टरों के सह-अनुकूलन को रोककर और अधिक मजबूत नेटवर्क प्रतिनिधित्व को बढ़ावा देकर ओवरफिटिंग को कम करती है। मजबूत प्रतिनिधित्व सीखने में ड्रॉपआउट की सफलता से प्रेरित होकर, हम अपने CLIPDraw++ मॉडल में प्रिमिटिव-लेवल ड्रॉपआउट (PLD) का प्रस्ताव करते हैं। यह तकनीक प्रत्येक स्केच मूल आकृति के उपयोग को अनुकूलित करने और अनावश्यक शोर में योगदान देने वाले किसी भी हिस्से को हटाने पर केंद्रित है। हमारे दृष्टिकोण के पीछे अंतर्ज्ञान यह है कि उपलब्ध मूल आकृतियों की संख्या को सीमित करने से मॉडल को पाठों में वर्णित शब्दार्थ को कैप्चर करने के लिए कुशलतापूर्वक उपयोग करने के लिए मजबूर होना पड़ता है, जिससे शोर वाले स्ट्रोक में उनकी बर्बादी से बचा जा सके। प्रत्येक पुनरावृत्ति (इटरेशन) के लिए मूल आकृतियों के यादृच्छिक छोटे उपसमुच्चय का चयन करके, मॉडल को सार्थक स्केच प्रतिनिधित्व के लिए सभी पुनरावृत्तियों में प्रत्येक मूल आकृति का उपयोग करने के लिए प्रोत्साहित किया जाता है, जिससे अनावश्यक शोर पैदा करने में उनके उपयोग को कम किया जा सके।
अनुकूलन प्रक्रिया के प्रत्येक चरण में, मूल आकृतियों की एक विशिष्ट संख्या, जिसे P द्वारा दर्शाया गया है और एक संभाव्यता वितरण के माध्यम से निर्धारित किया गया है, जानबूझकर हटा दी जाती है, जिसके बाद एक ग्रेडिएंट कदम उठाया जाता है। औपचारिक रूप से, निम्नानुसार एक कम कैनवास C˜ बनाने के लिए प्रत्येक पुनरावृत्ति में मूल कैनवास C के यादृच्छिक उपसमुच्चय का चयन किया जाता है:
d ∼ Bernoulli(1 − P); C˜ = C · d T
जहाँ d बर्नौली यादृच्छिक चरों का एक n-आयामी पंक्ति वेक्टर है, जिनमें से प्रत्येक तत्व 1 संभाव्यता (1 − P) के साथ हैं, और अन्यथा 0 हैं। C के साथ d का गुणा करने से उन मूल आकृतियों को बाहर कर दिया जाता है जिनके सूचकांक d के उन तत्वों के अनुरूप होते हैं जो 0 हैं, जबकि अन्य को बनाए रखा जाता है। इसके बाद, इन P मूल आकृतियों को पुनरावृत्ति के अंत में अनुकूलन लूप में फिर से शामिल किया जाता है, जिसमें अगली पुनरावृत्ति में P मूल आकृतियों के एक अन्य यादृच्छिक उपसमुच्चय को हटा दिया जाता है। CLIPDraw++ में मूल आकृतियों को पेश करने, बाहर करने और फिर से पेश करने का चक्रव्यूह दृष्टिकोण एक संतुलित अनुकूलन प्रदान करता है, यह सुनिश्चित करता है कि रेखाचित्र स्ट्रोक से अत्यधिक न भरें बल्कि फिर भी महत्वपूर्ण तत्वों को बनाए रखें। सामान्यता के नुकसान के बिना¹, सरलीकृत परिदृश्य पर विचार करें जहाँ मूल आकृतियों की संख्या n लक्ष्य अवधारणाओं y ∈ Y की संख्या के बराबर है, और निम्नलिखित लागू होता है:
∀ y ∈ Y, ∃ p ∈ C, f ∈ F | y = f(p) (3)
दूसरे शब्दों में, लक्ष्य पाठ Y में प्रत्येक अवधारणा को एक निश्चित मूल आकृति के परिवर्तन के रूप में विशिष्ट रूप से चित्रित किया जा सकता है, यानी, F के तहत C और Y के बीच एक-से-एक मैपिंग मौजूद है। अब, मूल सेट में η अतिरिक्त मूल आकृतियों को जोड़ने पर विचार करें ताकि C अब {p1, p2, ..., pn, pn+1, ..., pn+η} बन जाए। हालाँकि, दिया गया आधार बताता है कि Y उत्पन्न करना केवल {p1, p2, ..., pn} का उपयोग करके प्राप्त करने योग्य था। इसलिए अतिरिक्त मूल आकृतियों {pn+1, ..., pn+η} का विकास अनुकूलन उद्देश्य से विवश नहीं है, जिससे उनके बिना किसी स्पष्ट अर्थ के शोर वाले स्ट्रोक के रूप में कैनवास के आसपास पड़े रहने की संभावना बनी रहती है। पर्याप्तता सुनिश्चित करने के लिए, यानी समीकरण (3) में स्थिति, हम हमेशा एक निश्चित टेक्स्ट प्रॉम्प्ट की कल्पना करने के लिए आवश्यक मूल आकृतियों की संख्या का अधिक अनुमान लगाते हैं, ताकि यह सुनिश्चित हो सके कि संश्लेषित स्केच आवश्यक विवरणों के साथ पूर्ण है। हालाँकि, जैसा कि औपचारिक रूप से तर्क दिया गया है, यह अधिक अनुमान कैनवास को भरने वाले कुछ शोर वाले स्ट्रोक के लिए जगह छोड़ सकता है। प्रिमिटिव-लेवल ड्रॉपआउट यह सुनिश्चित करता है कि प्रत्येक पुनरावृत्ति में यादृच्छिक रूप से η (अनुमानित शोर दर के आनुपातिक) मूल आकृतियों को हटाकर ऐसा न हो, जिससे शेष सभी मूल आकृतियों को कुछ सार्थक प्रतिनिधित्व करने की दिशा में योगदान करने के लिए मजबूर होना पड़े। इस PLD दृष्टिकोण के अनुभवजन्य लाभों पर सेक. 4.3 में चर्चा की गई है और इसे चित्र 5 में देखा जा सकता है।
¹ सामान्य तौर पर, प्रत्येक अवधारणा को कई मूल आकृतियों द्वारा चित्रित किया जाएगा, लेकिन इस औपचारिकता का केंद्रीय दावा अभी भी लागू रहेगा।
कम अस्पष्टता के साथ मूल आकृतियों को आरंभ करना: पारंपरिक स्केचिंग में, कलाकार अक्सर एक हल्की रूपरेखा या हल्के लेआउट के साथ शुरुआत करते हैं, जो कलाकृति के लिए एक आधार के रूप में कार्य करता है। यह प्रारंभिक चरण व्यापक संरचना और रचना को निर्धारित करता है। जैसे-जैसे कलाकृति आगे बढ़ती है, कलाकार स्ट्रोक को तेज करते हैं, विशेष रूप से महत्वपूर्ण तत्वों को प्रमुख बनाने पर ध्यान केंद्रित करते हैं, यह सुनिश्चित करते हुए कि प्रत्येक स्ट्रोक समग्र टुकड़े में मूल्य जोड़ता है। डिजिटल क्षेत्र के साथ एक समानता दर्शाते हुए, CLIPDraw++ में, हमने एक समान कार्यप्रणाली तैयार की है। यहाँ, मूल आकृतियों का आरंभीकरण कम अस्पष्टता मान के साथ शुरू होता है, जिसे α के रूप में दर्शाया गया है। इसकी तुलना कलाकारों द्वारा बनाए गए हल्के लेआउट से की जा सकती है। जैसे ही सिस्टम प्रासंगिकता और महत्व के आधार पर अपनी अनुकूलन प्रक्रिया शुरू करता है, कुछ मूल आकृतियों की अस्पष्टता को धीरे-धीरे बढ़ाया जाता है। यह कलाकार की उस विधि को दर्शाता है जिसमें बार-बार उन स्ट्रोक को तेज किया जाता है जिन्हें स्केच की अखंडता के लिए महत्वपूर्ण माना जाता है। औपचारिक रूप से, प्रत्येक बैकवर्ड पास में, हम एक मूल आकृति p के अस्पष्टता मान को αp ← ∇I(Ltotal); αp > K के रूप में अपडेट करते हैं, जहाँ Ltotal समीकरण (4) से CLIPDraw++ का अनुकूलन मानदंड है और K एक अनुभवजन्य स्थिरांक है। यदि असमानता पूरी होती है तो हम p को कैनवास में बनाए रखते हैं और अन्यथा इसे छोड़ देते हैं। संक्षेप में, CLIPDraw++ उस विचारशील और क्रमिक दृष्टिकोण को दोहराने का प्रयास करता है जिसे कलाकार नियोजित करते हैं, मशीन अनुकूलन की सटीकता के साथ मानव कलात्मकता की बारीकियों का सम्मिश्रण करते हैं। कम अस्पष्टता के साथ स्ट्रोक शुरू करने के लाभ पर सेक. 3.2 में चर्चा की गई है और अतिरिक्त दस्तावेज के चित्र 7 में प्रदर्शित किया गया है।
3.4. प्रशिक्षण मानदंड
हमारे प्रशिक्षण मानदंड इनपुट टेक्स्ट प्रॉम्प्ट और संश्लेषित रेखाचित्रों के बीच संरेखण का मूल्यांकन करते हैं, जिसमें उनके संवर्धित संस्करण भी शामिल हैं। समानता को मापने के लिए, हम CLIP मॉडल [24] से पूर्व-प्रशिक्षित टेक्स्ट और इमेज एनकोडर का उपयोग करते हैं। प्राकृतिक छवियों (यहाँ रेखाचित्र) और ग्रंथों दोनों से जानकारी एन्कोड करने की CLIP की क्षमता, अतिरिक्त प्रशिक्षण की आवश्यकता को समाप्त करती है। किसी दिए गए टेक्स्ट और संश्लेषित स्केच के संरेखण को मापने के लिए हम कोसाइन समानता का उपयोग sim(x, y) = x·y / ||x||·||y|| के रूप में करते हैं।
शब्दार्थ हानि (सिमेंटिक लॉस): हमारा प्राथमिक उद्देश्य टेक्स्ट प्रॉम्प्ट और संश्लेषित रेखाचित्रों के बीच शब्दार्थ समानता को बढ़ाना है। टेक्स्ट प्रॉम्प्ट P और संश्लेषित स्केच S के रास्टराइज़्ड संस्करण के बीच शब्दार्थ समानता को मापने के लिए, हम शब्दार्थ हानि फ़ंक्शन, Lsem पेश करते हैं, जिसे शब्दार्थ सुसंगतता सुनिश्चित करने और दो तौर-तरीकों के बीच विसंगतियों को पकड़ने के लिए डिज़ाइन किया गया है।
Lsem = − ∑ M i=0 sim (T (P), I (Tf (S)))
जहाँ Tf यादृच्छिक एफ़िन परिवर्तनों को इंगित करता है, और M संवर्द्धन के माध्यम से उत्पादित रूपांतरित विविधताओं की संख्या को दर्शाता है।
दृश्य हानि (विजुअल लॉस): जबकि शब्दार्थ हानि उच्च-स्तरीय शब्दार्थ संकेतों पर ध्यान केंद्रित करती है, यह मुद्रा और संरचना जैसे महत्वपूर्ण निम्न-स्तरीय स्थानिक विशेषताओं की अनदेखी कर सकती है। इसलिए, शब्दार्थ हानि के पूरक के लिए, हम एक मानदंड Lvis पेश करते हैं जो डिफ्यूजन UNet द्वारा उत्पन्न छवि और उसी इनपुट टेक्स्ट के लिए हमारे मॉडल द्वारा संश्लेषित स्केच के बीच ज्यामितीय समानता को मापता है, जिसकी गणना इस प्रकार की जाती है:
Lvis = − ∑ M i=0 sim (I (I0), I(Tf (S)))
जहाँ I0 फ्रोजन UNet द्वारा उत्पन्न अंतिम छवि को दर्शाता है।
कुल हानि (टोटल लॉस): कुल हानि, Ltotal ऊपर वर्णित दो हानि कार्यों (शब्दार्थ हानि Lsem और दृश्य हानि Lvis) का योग है, जिनमें से प्रत्येक को उनके संबंधित गुणांकों, λsem और λvis द्वारा भारित किया गया है। ये दो हानि कार्य हमारी स्केच संश्लेषण प्रक्रिया को संतुलित करते हैं: शब्दार्थ हानि वेक्टर रेखाचित्रों को पाठ्य संकेतों के साथ संरेखित करती है, जबकि दृश्य हानि निम्न-स्तरीय स्थानिक विशेषताओं और अवधारणात्मक सुसंगतता को बनाए रखती है। यह संयोजन शब्दार्थ निष्ठा और ज्यामितीय सटीकता के बीच जटिल संबंध को प्रभावी ढंग से कैप्चर करता है।
Ltotal = λsemLsem + λvisLvis (4)
4. प्रयोग
इस अनुभाग में, हम वृत्त, सीधी रेखाओं और अर्ध-वृत्त जैसी रैखिक रूप से रूपांतरित मूल आकृतियों से रेखाचित्रों को संश्लेषित करने के लिए CLIPDraw++ का उपयोग करते हैं। हम संबंधित तरीकों के साथ CLIPDraw++ की तुलना भी करते हैं और इसके घटकों का मूल्यांकन करने के लिए एब्लेशन करते हैं। अधिक परिणाम परिशिष्ट में हैं।
4.1. मूल आकृतियों से स्केच जनरेशन
जैसा कि चित्र 3 में दिखाया गया है, हमारा CLIPDraw++ मॉडल उन रेखाचित्रों को संश्लेषित करने की क्षमता प्रदान करता है जिनके स्ट्रोक रैखिक रूप से रूपांतरित मूल आकृतियाँ हैं जैसे वृत्त (ऊपर से दूसरी पंक्ति), सीधी रेखाएं (तीसरी पंक्ति), और अर्ध वृत्त (चौथी पंक्ति)। इन व्यक्तिगत स्ट्रोक को अनुकूलन प्रक्रिया के क्रमिक पुनरावृत्तियों में उनके विकास के माध्यम से ट्रैक किया जा सकता है। विशेष रूप से, मॉडल सहज रूप से उपयुक्त मूल आकृतियों के साथ संश्लेषित स्केच के विभिन्न हिस्सों का प्रतिनिधित्व करता है। उदाहरण के लिए, चित्र 3 में संश्लेषित मोटरसाइकिल के चेसिस और हैंडलबार को सीधी रेखाओं के साथ प्रस्तुत किया गया है, जबकि पहियों को वृत्त और अर्धवृत्त का उपयोग करके चित्रित किया गया है।
हमारा मॉडल आकार या दृश्य विकास की गतिशीलता को कुशलतापूर्वक कैप्चर करता है, स्वतंत्रता की डिग्री के आधार पर लचीलेपन के विभिन्न स्तरों को प्रदर्शित करता है, जो एक आकार में नियंत्रण बिंदुओं की संख्या से जुड़ा होता है। खेत के उदाहरण में (परिशिष्ट चित्र 1 (b) देखें), यह घर की छत और दीवारों जैसी सरल संरचनाओं के लिए सीधी रेखाएं प्रदान करता है, जबकि घास और फसलों जैसे अधिक जटिल तत्व अर्ध-वृत्त के साथ बनाए जाते हैं, जो अधिक लचीलापन प्रदान करते हैं। पेड़ों जैसी और भी जटिल संरचनाएं सबसे लचीले आकार वृत्त का उपयोग करके प्रस्तुत की जाती हैं, जो जटिलता के विभिन्न स्तरों के लिए विभिन्न मूल आकृतियों का उपयोग करने में मॉडल के कौशल को दर्शाती हैं। आकृतियों का यह रणनीतिक उपयोग विस्तृत, सूक्ष्म रेखाचित्र बनाने की मॉडल की क्षमता को बढ़ाता है। मूल आकृति स्तर ट्रैकिंग और समग्र स्केच स्तर ट्रैकिंग के साथ स्केच जनरेशन के अतिरिक्त उदाहरण क्रमशः अतिरिक्त दस्तावेज के चित्र 1 और चित्र 2-5 में दिखाए गए हैं।

चित्र 3. टेक्स्ट प्रॉम्प्ट "एक खड़ी मोटरसाइकिल" के लिए, हमारा CLIPDraw++ अनुकूलन के दौरान प्रत्येक मूल आकार के विकास को ट्रैक करता है: पहली पंक्ति एक ब्लैक-एंड-व्हाइट संश्लेषित स्केच दिखाती है, अगली तीन पंक्तियाँ वृत्त, सीधी रेखाओं और अर्ध-वृत्त के विकास को प्रदर्शित करती हैं, और अंतिम पंक्ति इन तीनों पंक्तियों के संयोजनों को जोड़ती है। यहाँ क्रॉस-अटेंशन मैप बनाने के लिए "मोटरसाइकिल" का उपयोग किया जाता है।
4.2. तुलना
हमारे CLIPDraw++ मॉडल की तुलना पांच संबंधित तरीकों से की जाती है: CLIPDraw [5], जो CLIP-निर्देशित रेखाचित्रों के लिए बेज़ियर वक्रों को अनुकूलित करता है; CLIPasso [31], जो बेज़ियर वक्रों के साथ रेखाचित्रों को सरल बनाता है; CLIPascene [30], जो CLIP एम्बेडिंग्स से दृश्य रेखाचित्र उत्पन्न करता है; VectorFusion [11], जो वेक्टर रेखाचित्रों के लिए एक डिफ्यूजन मॉडल का उपयोग करता है; और SVGDreamer [33], जो स्ट्रोक-आधारित डिफ्यूजन दृष्टिकोण के माध्यम से स्पष्ट रेखाचित्र बनाता है। निष्पक्ष तुलना के लिए सभी मॉडलों का परीक्षण उनकी मूल सेटिंग्स के साथ किया जाता है।
तालिका 1 में, हम मौजूदा साहित्य [5, 33] के बाद विभिन्न मूल्यांकन मेट्रिक्स का उपयोग करके अपने दृष्टिकोण को मान्य करने के लिए मात्रात्मक प्रयोग प्रस्तुत करते हैं, जिसमें कोसाइन समानता (CS) [10], पीक सिग्नल-टू-नॉइज़ रेशियो (PSNR) [9], CLIP-T स्कोर [24], BLIP स्कोर [13], और भ्रम स्कोर (Conf.) [32] शामिल हैं। हमारे CLIPDraw++ ने CS, CLIP-T, और BLIP मेट्रिक्स में अन्य सभी तरीकों को काफी पीछे छोड़ दिया है, और PSNR और Conf में दूसरा सर्वश्रेष्ठ स्थान हासिल किया है, जो इसकी प्रभावशीलता को प्रदर्शित करता है। CS, CLIP-T, और BLIP में उच्च स्कोर इंगित करते हैं कि CLIPDraw++ टेक्स्ट प्रॉम्प्ट के साथ निकटता से संरेखित रेखाचित्र उत्पन्न करता है। हालांकि SVGDreamer सीधे छवि स्थान में अनुकूलित अपने स्ट्रोक-आधारित डिफ्यूजन दृष्टिकोण के कारण थोड़ा अधिक PSNR और भ्रम स्कोर प्राप्त करता है, हमारी विधि अधिक कुशल है और व्यापक अनुकूलन के बिना यथार्थवादी रेखाचित्र प्राप्त करती है। इसके अलावा, हमारा उच्च PSNR कम सुपरसैचुरेशन को इंगित करता है, और भ्रम स्कोर हमारे उत्पन्न रेखाचित्रों के यथार्थवाद को रेखांकित करता है।
तालिका 1. मौजूदा तरीकों के साथ मात्रात्मक तुलना।
विधि / मीट्रिक | CS ↑ | PSNR ↑ | CLIP-T ↑ | BLIP ↑ | Conf. ↑ |
|---|---|---|---|---|---|
CLIPDraw [5] | 0.2578 | 28.1740 | 0.3114 | 0.2611 | 0.49 |
CLIPasso [31] | 0.2250 | 27.5000 | 0.2850 | 0.2783 | 0.45 |
VectorFusion [11] | 0.2283 | 28.3277 | 0.2949 | 0.3894 | 0.44 |
CLIPascene [30] | 0.2000 | 27.0231 | 0.2746 | 0.2551 | 0.42 |
SVGDreamer [33] | 0.2688 | 28.7384 | 0.3132 | 0.4102 | 0.61 |
CLIPDraw++ (हमारा) | 0.2763 | 28.6417 | 0.3365 | 0.4222 | 0.58 |
जैसा कि चित्र 4 में दिखाया गया है, हमारा CLIPDraw++ ऐसे रेखाचित्र तैयार करता है जो CLIPDraw की तुलना में काफ़ी साफ और शब्दार्थ के करीब (जैसा कि CLIP-T स्कोर द्वारा इंगित किया गया है) हैं, जो शायद हमारी विधि के प्रिमिटिव-लेवल ड्रॉपआउट के उपयोग और कम अस्पष्टता पर मूल आकृतियों के इनिशियलाइजेशन के कारण है। CLIPasso की तुलना में, जो बेज़ियर वक्रों का उपयोग करके रेखाचित्रों को सरल बनाता है लेकिन अक्सर बारीक विवरण खो देता है, CLIPDraw++ बिना किसी अत्यधिक स्मूथिंग के स्पष्टता और विवरण दोनों को बनाए रखता है। VectorFusion के विपरीत, जो वेक्टर रेखाचित्रों के लिए एक डिफ्यूजन मॉडल को नियोजित करता है लेकिन अमूर्त और कम सुसंगत निरूपण के साथ संघर्ष करता है, हमारी विधि अधिक सटीक और शब्दार्थ से भरपूर आउटपुट सुनिश्चित करती है। CLIPascene, हालांकि दृश्य-स्तरीय रेखाचित्र उत्पन्न करने में सक्षम है, अक्सर मूल आकृतियों की नियुक्ति के कम प्रभावी नियंत्रण के कारण अव्यवस्था पैदा करता है, जबकि CLIPDraw++ संरचित मूल आकृति इनिशियलाइजेशन के माध्यम से स्पष्टता बनाए रखता है। यद्यपि SVGDreamer स्ट्रोक-आधारित डिफ्यूजन दृष्टिकोण के माध्यम से दृष्टिगत रूप से स्पष्ट रेखाचित्र तैयार करता है, लेकिन इसका अनुकूलन समय काफी लंबा है, और इसमें कभी-कभी शब्दार्थ सटीकता की कमी होती है। इसके विपरीत, CLIPDraw++ लगातार सटीक विवरण और शब्दार्थ के साथ साफ रेखाचित्र प्रदान करता है। हमारे रेखाचित्रों में कम शोर का कारण कम किए गए नियंत्रण बिंदु, मूल आकृतियों के लिए सीखने योग्य अस्पष्टता, और प्रिमिटिव-लेवल ड्रॉपआउट है, जिससे मैन्युअल हस्तक्षेप और पैरामीटर समायोजन की आवश्यकता कम हो जाती है।

चित्र 4. CLIP आधारित दृष्टिकोण CLIPDraw, CLIPasso, CLIPascene, और डिफ्यूजन आधारित दृष्टिकोण VectorFusion, SVGDreamer के साथ हमारे CLIPDraw++ के बीच मात्रात्मक माप के साथ गुणात्मक तुलना। प्रत्येक छवि के ऊपरी-दाएँ कोने में हरे रंग की संख्याएँ टेक्स्ट प्रॉम्प्ट के संदर्भ में CLIP-T स्कोर को दर्शाती हैं। क्रॉस-अटेंशन मैप बनाने के लिए हाइलाइट किए गए शब्दों का उपयोग किया जाता है।
दिखाए गए उदाहरण:
"कपकेक खाता हुआ घोड़ा"
"फास्ट फूड"
"तारों वाले आसमान में उड़ता हुआ एक अंतरिक्ष यान"
"एक पानी के नीचे की पनडुब्बी"
"सेल्फी लेता हुआ येती"
"तीसरी आँख"
"एफिल टॉवर का विस्तृत रेखाचित्र"
4.3. मॉडल एब्लेशंस
इस अनुभाग में, हम अपने मॉडल के चुनिंदा एब्लेशन अध्ययन प्रस्तुत करते हैं। अतिरिक्त एब्लेशन परिणाम अतिरिक्त दस्तावेज के सेक. 3 में हैं।
CLIP-आधारित बनाम डिफ्यूजन-आधारित इनिशियलाइजेशन: CLIPDraw++ में अनुकूलन की गैर-उत्तल (non-convex) प्रकृति इस बात के प्रति संवेदनशील है कि मूल आकृतियों को कैसे इनिशियलाइज किया जाता है। हम दो तरीकों की खोज करते हैं: एक CLIP अटेंशन मैप (चित्र 6 (a)) का उपयोग करता है और दूसरा लेटेंट डिफ्यूजन मॉडल के अटेंशन मैप (चित्र 6 (c)) पर आधारित है। इन मानचित्रों में स्थानीय मैक्सिमा (चित्र 6 (b) और चित्र 6 (d)) प्रमुख लैंडमार्क बिंदुओं की पहचान करते हैं। हमारे निष्कर्ष बताते हैं कि CLIP अटेंशन मैप में सटीकता की कमी है, जो अप्रासंगिक क्षेत्रों पर ध्यान केंद्रित करता है, जबकि डिफ्यूजन मॉडल का अटेंशन अधिक स्थानीयकृत और विस्तृत जानकारी प्रदान करता है। यही सटीकता है जिसके कारण हम रेखाचित्रों को इनिशियलाइज करने के लिए डिफ्यूजन-आधारित अटेंशन मैप को प्राथमिकता देते हैं।

चित्र 5. टेक्स्ट प्रॉम्प्ट "एफिल टॉवर का विस्तृत रेखाचित्र" के लिए प्रिमिटिव-लेवल ड्रॉपआउट (PLD) की प्रभावशीलता। शीर्ष पंक्ति में रेखाचित्र बिना PLD के संश्लेषित किए गए हैं, जबकि निचली पंक्ति में रेखाचित्र PLD के साथ संश्लेषित किए गए हैं।

चित्र 6. CLIP और डिफ्यूजन अटेंशन मैप्स और इनिशियलाइजेशन।
(a) CLIP अटेंशन मैप
(b) CLIP-आधारित लैंडमार्क
(c) डिफ्यूजन अटेंशन मैप
(d) डिफ्यूजन-आधारित लैंडमार्क
पैच-आधारित इनिशियलाइजेशन: CLIPDraw++ में, हम स्ट्रोक इनिशियलाइजेशन के लिए एक पैच-आधारित दृष्टिकोण का उपयोग करते हैं, मूल आकृतियों को अटेंशन मैप पर सीधे लैंडमार्क बिंदुओं के बजाय पैच के भीतर रखते हैं। यह विधि बिंदु-आधारित इनिशियलाइजेशन की विशिष्ट अव्यवस्था और गड़बड़ी को रोकती है। जैसा कि चित्र 7 में दिखाया गया है, पैच-आधारित इनिशियलाइजेशन (चित्र 7 (d)) के साथ बनाए गए रेखाचित्र बिंदु-आधारित इनिशियलाइजेशन (चित्र 7 (b)) की तुलना में अधिक स्पष्ट और अधिक सुसंगत हैं। ध्यान स्थानीय मैक्सिमा (पैच आकार के आधार पर) की एक निर्धारित सीमा के भीतर मूल आकृतियों को वितरित करना अत्यधिक बाधाओं से बचाता है और स्पष्टता बनाए रखने में मदद करता है। यह ऑप्टिमाइज़र को कैनवास का एक स्पष्ट दृष्टिकोण देता है, जिससे मूल आकृतियों के अधिक प्रभावी प्रतिधारण, विकास या निष्कासन को सक्षम किया जा सकता है, जिसके परिणामस्वरूप साफ रेखाचित्र बनते हैं।

चित्र 7. बिंदु-आधारित और पैच-आधारित इनिशियलाइजेशन के लिए 'एफिल टॉवर' और 'टैंक' के परिणामों की तुलना।
(a) बिंदु-आधारित इनिशियलाइजेशन
(b) (a) से संश्लेषित अंतिम रेखाचित्र
(c) पैच-आधारित इनिशियलाइजेशन
(d) (c) से संश्लेषित अंतिम रेखाचित्र
प्रिमिटिव-लेवल ड्रॉपआउट: प्रिमिटिव-लेवल ड्रॉपआउट यह सुनिश्चित करके मूल आकृतियों के उपयोग को बढ़ाता है कि प्रत्येक एक विशिष्ट अवधारणा को एन्कोड करता है, जिससे शोर वाले स्ट्रोक कम होते हैं जो कोई अर्थ नहीं जोड़ते हैं। PLD प्रासंगिक स्ट्रोक की शीघ्र पहचान करके अभिसरण (कन्वर्जेंस) को भी गति प्रदान करता है। जैसा कि चित्र 5 में दिखाया गया है, PLD (निचली पंक्ति) वाले रेखाचित्र अधिक साफ और अधिक यथार्थवादी हैं, जबकि बिना PLD वाले (शीर्ष पंक्ति) अधिक शोर वाले हैं। PLD की प्रभावशीलता का और मूल्यांकन करने के लिए, हमने इसकी तुलना अनुकूलन के दौरान धीरे-धीरे नए स्ट्रोक जोड़ने की रणनीति से की। चित्र 8 में, एब्लेशन से पता चलता है कि PLD दृश्य गुणवत्ता और CLIP-T स्कोर दोनों में इस दृष्टिकोण से बेहतर प्रदर्शन करता है। हमें संदेह है कि अचानक नई मूल आकृतियों को जोड़ने से नुकसान परिदृश्य की सहजता बाधित होती है, जिससे अनुकूलन कठिन हो जाता है और इसके परिणामस्वरूप अधिक शोर वाले रेखाचित्र बनते हैं। अधिक परिणाम अतिरिक्त दस्तावेज के सेक. 3.1 और चित्र 6 में हैं।

चित्र 8. आवश्यकतानुसार क्रमिक रूप से अतिरिक्त मूल आकृतियों को जोड़ने की रणनीति के साथ PLD की प्रभावकारिता की तुलना।
(a) इनिशियलाइजेशन
(b) पहला जोड़
(c) दूसरा जोड़
(d) संश्लेषित रेखाचित्र (0.30)
(e) PLD (0.33)
5. निष्कर्ष
हमने सीधी रेखाएं, वृत्त और अर्धवृत्त जैसी सरल ज्यामितीय मूल आकृतियों का उपयोग करके अनुकूलन के माध्यम से स्केच संश्लेषण के लिए एक मॉडल, CLIPDraw++ पेश किया। हमारा मॉडल इन मूल आकृतियों पर सरल रैखिक परिवर्तनों के माध्यम से अत्यधिक अभिव्यंजक रेखाचित्र बनाता है, जिसमें साफ रेखाचित्रों को संश्लेषित करने के लिए रणनीतिक स्केच कैनवास इनिशियलाइजेशन और कम शोर वाले रेखाचित्र बनाने के लिए प्रिमिटिव-लेवल ड्रॉपआउट (PLD) जैसी तकनीकों को शामिल किया गया है, जो सामूहिक रूप से मॉडल की दक्षता और आउटपुट गुणवत्ता को बढ़ाते हैं। व्यापक प्रयोग और एब्लेशन अध्ययन मौजूदा तरीकों पर मॉडल की श्रेष्ठता को रेखांकित करते हैं, जो सौंदर्य की दृष्टि से आकर्षक और शब्दार्थ से समृद्ध रेखाचित्र बनाने की इसकी क्षमता को प्रदर्शित करते हैं। CLIPDraw++ सहज ज्ञान युक्त डिजाइन सिद्धांतों के साथ उन्नत अनुकूलन को मिलाकर एआई-संचालित कला निर्माण में उत्कृष्ट प्रदर्शन करता है।
संदर्भ
[1] स्टीफन अलानाइज़, मैसिमिलियानो मैनसिनी, अंजन दत्ता, डिएगो मार्कोस, और ज़ेनेप अकाटा। सरल मूल आकृतियों के माध्यम से रेखाचित्रों को अमूर्त करना। ECCV में, 2022।
[2] अंकन कुमार भूनिया, सलमान खान, हिशाम चोलक्कल, राव मुहम्मद अनवर, फहद शाहबाज़ खान, जोर्मा लाकसोनेन, और माइकल फेल्सबर्ग। डूडलफ़ॉर्मर: ट्रांसफ़ॉर्मर्स के साथ रचनात्मक स्केच ड्राइंग। ECCV में, 2022।
[3] कैरोलिन चान, फ्रेडो डूरंड, और फिलिप इसोला। ज्यामिति और शब्दार्थ को संप्रेषित करने वाले रेखाचित्र उत्पन्न करना सीखना। CVPR में, 2022।
[4] शू-यू चेन, वानचाओ सु, लिन गाओ, शिहोंग शिया, और होंगबो फू। डीपफेसड्राइंग: रेखाचित्रों से चेहरे की छवियों की गहरी पीढ़ी। ACM ट्रांस. ग्राफ., 2020।
[5] केविन फ्रैंस, लिसा सोरोस, और ओलाफ विटकोवस्की। CLIPDraw: भाषा-छवि एनकोडर के माध्यम से टेक्स्ट-टू-ड्राइंग संश्लेषण की खोज। NeurIPS में, 2022।
[6] फेडेरिको गैलाटोलो, मारियो सिमिनी, और गिग्लियोला वैग्लिनी। CLIP-निर्देशित जनरेटिव लेटेंट स्पेस सर्च के माध्यम से कैप्शन से चित्र बनाना और इसके विपरीत। ICIPVE में, 2021।
[7] ज़े गाओ, सिहुआंग मान, और अंकी वांग। एआई कला और डिजाइन निर्माण उद्योग: व्यक्तिगत उत्पादन से मानव-मशीन सहजीवन में परिवर्तन। WAC में, 2022।
[8] डेविड हा और डगलस एक। स्केच चित्रों का एक न्यूरल प्रतिनिधित्व। ICLR में, 2018।
[9] एलेन होरे और जेमेल ज़िउ। छवि गुणवत्ता मेट्रिक्स: Psnr बनाम ssim। ICPR में, 2010।
[10] कायी हुआंग, काय्यू सन, एंज़े झी, झेंगगुओ ली, और सिहुई लियू। T2i-compbench: ओपन-वर्ल्ड कंपोजिशनल टेक्स्ट-टू-इमेज जनरेशन के लिए एक व्यापक बेंचमार्क। NeurIPS, 36, 2023।
[11] अजय जैन, एम्बर झी, और पीटर एब्बील। VectorFusion: पिक्सेल-आधारित डिफ्यूजन मॉडल को अमूर्त करके टेक्स्ट-टू-SVG। CVPR में, 2023।
[12] जॉन जम्पर, रिचर्ड इवांस, अलेक्जेंडर प्रित्ज़ेल, टिम ग्रीन, माइकल फिगुरनोव, ओलाफ रोनेबर्गर, कैथरीन तुन्यासुवुनाकुल, रस बेट्स, ऑगस्टिन ज़ीदेक, अन्ना पोटापेंको, एलेक्स ब्रिजलैंड, क्लेमेंस मेयर, साइमन ए. ए. कोहल, एंड्रयू जे. बैलार्ड, एंड्रयू कोवी, बर्नार्डिनो रोमेरा-पारेडेस, स्टैनिस्लाव निकोलोव, रिशुभ जैन, जोनास एडलर, ट्रेवर बैक, स्टिग पीटरसन, डेविड रीमन, एलेन क्लैंसी, मिकाल ज़िलिंस्की, मार्टिन स्टीनइगर, मिकालिना पचोलस्का, तमास बर्घमर, सेबस्टियन बोडेनस्टीन, डेविड सिल्वर, ओरियोल विन्याल्स, एंड्रयू डब्ल्यू सीनियर, कोरे कावुककुओग्लू, पुशमीत कोहली, और डेमिस हसाबिस। AlphaFold के साथ अत्यधिक सटीक प्रोटीन संरचना की भविष्यवाणी। नेचर, 2021।
[13] जुनन ली, डोंगक्सू ली, कैमिंग शियोंग, और स्टीवन होई। Blip: एकीकृत दृष्टि-भाषा समझ और पीढ़ी के लिए बूटस्ट्रैपिंग भाषा-छवि पूर्व-प्रशिक्षण। ICML में, 2022।
[14] मेंगटियन ली, झे लिन, राडोमिर मेक, एरसिन युमेर, और देवा रामनन। फोटो-स्केचिंग: छवियों से समोच्च रेखाचित्रों का अनुमान लगाना। WACV में, 2019।
[15] त्ज़ु-माओ ली, मिकाल लुकाक, घरबी मिकेल, और जोनाथन रागन-केली। संपादन और सीखने के लिए डिफरेंशिएबल वेक्टर ग्राफिक्स रास्टराइजेशन। SIGGRAPH एशिया में, 2020।
[16] यी ली, यी-झे सोंग, टिमोथी एम. हॉस्पेडल्स, और शाओगांग गोंग। विकृत स्ट्रोक मॉडल के साथ फ्री-हैंड स्केच संश्लेषण। IJCV, 2017।
[17] रुनताओ लियू, कियान यू, और स्टेला यू। अनुपयोगी स्केच टू फोटो संश्लेषण। ECCV में, 2020।
[18] पियोत्र मिरोव्स्की, डायलन बनारसे, माटुश मालिनोव्स्की, साइमन ओसिंडेरो, और क्रिसेंथा फर्नांडो। CLIPCLOP: CLIP-निर्देशित कोलाज और फोटोमोंटाज। ICCC में, 2022।
[19] रयान मर्डॉक। द बिग स्लीप: BigGANxCLIP.ipynb, 2021।
[20] अन न्गुयेन, जेसन योसिंस्की, और जेफ क्लून। डीप न्यूरल नेटवर्क आसानी से मूर्ख बन जाते हैं: अपरिचित छवियों के लिए उच्च विश्वास भविष्यवाणियां। CVPR में, 2015।
[21] अन न्गुयेन, एलेक्सी डोसोवित्स्की, जेसन योसिंस्की, थॉमस ब्रोक्स, और जेफ क्लून। डीप जनरेटर नेटवर्क के माध्यम से न्यूरल नेटवर्क में न्यूरॉन्स के लिए पसंदीदा इनपुट का संश्लेषण। NIPS में, 2016।
[22] अन न्गुयेन, जेफ क्लून, योशुआ बेंगियो, एलेक्सी डोसोवित्स्की, और जेसन योसिंस्की। प्लग एंड प्ले जनरेटिव नेटवर्क्स: लेटेंट स्पेस में छवियों की सशर्त पुनरावृत्ति पीढ़ी। CVPR में, 2017।
[23] झियू क्यू, यूलिया ग्र्याडित्सकाया, के ली, काय्यू पांग, ताओ शियांग, और यी-झे सोंग। SketchXAI: मानव रेखाचित्रों के लिए व्याख्यात्मकता पर एक पहली नज़र। CVPR में, 2023।
[24] एलेक रेडफोर्ड, जोंग वुक किम, क्रिस हैलेसी, आदित्य रमेश, गेब्रियल गोह, सांधिनी अग्रवाल, गिरीश शास्त्री, अमांडा आस्केल, पामेला मिश्किन, जैक क्लार्क, आदि। प्राकृतिक भाषा पर्यवेक्षण से हस्तांतरणीय दृश्य मॉडल सीखना। ICML में, 2021।
[25] रॉबिन रोमबाक, एंड्रियास ब्लैटमैन, डोमिनिक लोरेंज, पैट्रिक एस्सर, और ब्योर्न ओमर। लेटेंट डिफ्यूजन मॉडल के साथ उच्च-रिज़ॉल्यूशन छवि संश्लेषण। CVPR में, 2022।
[26] डेविड सिल्वर, अजा हुआंग, क्रिस जे. मैडिसन, आर्थर गुएज़, लॉरेंट सिफ्रे, जॉर्ज वैन डेन ड्रिएशे, जूलियन श्रिटविज़र, इओनिस एंटोनोग्लू, वेद पन्नीरसेल्वम, मार्क लैंक्टोट, सैंडर डिएलेमन, डोमिनिक ग्रेवे, जॉन न्हाम, नल कालचब्रेनर, इल्या सुतस्केवर, टिमोथी लिलिक्रैप, मेडेलीन लीच, कोरे कावुककुओग्लू, थोर ग्रेपेल, और डेमिस हसाबिस। डीप न्यूरल नेटवर्क और ट्री सर्च के साथ गो के खेल में महारत हासिल करना। नेचर, 2016।
[27] नितिश श्रीवास्तव, जेफ्री हिंटन, एलेक्स क्रिज़ेव्स्की, इल्या सुतस्केवर, और रुस्लान सलाखुतदीनोव। ड्रॉपआउट: न्यूरल नेटवर्क को ओवरफिटिंग से बचाने का एक सरल तरीका। JMLR, 2014।
[28] राफेल तांग, अक्षत पांडे, झियिंग जियांग, गेफेई यांग, करुण कुमार, जिमी लिन, और फरहान तुरे। व्हाट द डाम: क्रॉस अटेंशन का उपयोग करके स्थिर प्रसार की व्याख्या करना। arXiv प्रीप्रिंट arXiv:2210.04885, 2022।
[29] झेंगयान टोंग, जुआनहोंग चेन, बिंगबिंग नी, और शियाओहांग वांग। वेक्टर फ्लो और ग्रेस्केल द्वारा निर्देशित ड्राइंग प्रक्रिया के साथ स्केच जनरेशन। AAAI में, 2020।
[30] येल विंकर, युवल अलालुफ, डैनियल कोहेन-ओर, और एरियल शमीर। CLIPascene: विभिन्न प्रकारों और अमूर्तता के स्तरों के साथ दृश्य स्केचिंग। arXiv में, 2022।
[31] येल विंकर, एहसान पजौहेशगर, जेसिका वाई. बो, रोमन क्रिश्चियन बाचमैन, अमित हैम बर्मनो, डैनियल कोहेन-ओर, अमीर ज़मीर, और एरियल शमीर। CLIPasso: शब्दार्थ-जागरूक ऑब्जेक्ट स्केचिंग। SIGGRAPH में, 2022।
[32] शीमिंग शिंग, चुआंग वांग, हैताओ झोउ, जिंग झांग, कियान यू, और डोंग जू। Diffsketcher: लेटेंट डिफ्यूजन मॉडल के माध्यम से टेक्स्ट निर्देशित वेक्टर स्केच संश्लेषण। NeurIPS में, 2023।
[33] शिमिंग शिंग, हैताओ झोउ, चुआंग वांग, जिंग झांग, डोंग जू, और कियान यू। Svgdreamer: डिफ्यूजन मॉडल के साथ टेक्स्ट निर्देशित svg जनरेशन। CVPR में, 2024।