दिखने में सरल लगने वाली एक कंप्यूटर विज़न समस्या को अब व्यापक समाधान मिल रहा है

आधुनिक AI सिस्टम छवियों का वर्णन कर सकते हैं, वस्तुओं की पहचान कर सकते हैं, और पाठ निकाल सकते हैं, लेकिन वस्तुओं की गिनती अब भी सामान्यीकृत रूप में हल करने वाले कठिन दृश्य कार्यों में से एक है। जो मॉडल भीड़ में लोगों की गिनती अच्छी तरह करता है, वह माइक्रोस्कोप के नीचे कोशिकाओं या सैटेलाइट तस्वीरों में वाहनों की गिनती में विफल हो सकता है। यह अंतर महत्वपूर्ण है, क्योंकि गिनती कोई खिलौना समस्या नहीं है। यह मेडिकल इमेजिंग, कृषि, ट्रैफिक विश्लेषण, और वैज्ञानिक काम में सामने आती है, जहाँ सटीकता मायने रखती है।

Count Anything नाम की एक नई शोध प्रणाली इसी सीमा को दूर करने के लिए बनाई गई है, ताकि वस्तु-गणना को एक सामान्य-उद्देश्य क्षमता में बदला जा सके। स्रोत सामग्री के अनुसार, यह मॉडल केवल एक टेक्स्ट प्रॉम्प्ट का उपयोग करके बहुत अलग-अलग प्रकार की छवियों में वस्तुओं की गिनती और लेबलिंग कर सकता है। लक्ष्य एक ऐसी एकल प्रणाली है, जिससे सिर, कार, कोशिकाएँ, या बैक्टीरिया कॉलोनियाँ गिनवाई जा सकें, और हर डोमेन के लिए अलग विशेष मॉडल की ज़रूरत न पड़े।

यही महत्व इसे उल्लेखनीय बनाता है। चुनौती केवल पहचान की नहीं है। चुनौती यह है कि बहुत अलग इमेज स्केल, वस्तु आकार, और दृश्य घनत्व को संभालते हुए दोहरी गिनती और अस्पष्टता से बचा जाए, जो अक्सर गिनती प्रणालियों को तोड़ देती है।

दो गिनती विधियाँ, एक प्रणाली में संयुक्त

Count Anything का मूल डिज़ाइन एक हाइब्रिड है। स्रोत के अनुसार, मॉडल दो पूरक तरीकों को मिलाता है। एक क्षेत्र-आधारित है और बड़े, स्पष्ट रूप से दिखाई देने वाले वस्तुओं के लिए बेहतर काम करता है, उन पर बाउंडिंग बॉक्स खींचकर। दूसरा पिक्सेल-आधारित है और छोटे या अधिक घने लक्ष्यों के लिए बनाया गया है, जो बॉक्स के बजाय बिंदु रखता है। प्रणाली इन दोनों आउटपुट को मिलाकर एक अंतिम गिने गए वस्तुओं का सेट बनाती है।

यह दृष्टिकोण दृश्य AI की एक सामान्य विफलता को संबोधित करता है। बड़े वस्तुओं और बहुत सघन छोटे वस्तुओं के लिए अक्सर अलग-अलग हैंडलिंग की ज़रूरत होती है। भीड़-गणना प्रणाली घनी सिर-गणना में अच्छी हो सकती है, लेकिन बड़े अलग-थलग आइटम में खराब। बॉक्स के लिए प्रशिक्षित डिटेक्टर सूक्ष्म, सघन लक्ष्यों को चूक सकता है। काम को बाँटकर और फिर आउटपुट को मिलाकर, शोधकर्ता दोनों सिरों को कवर करने की कोशिश कर रहे हैं।

Count Anything framework का architecture diagram, जिसमें text-conditioned encoder, region-level sparse counter, pixel-level dense counter, और complementary count fusion दिखाया गया है जो दोनों counting paths को जोड़ता है.
Count Anything एक region-based और pixel-based counter को जोड़ता है, फिर उनके परिणामों को अंतिम point set में मिलाता है। | Image: Lei et al.

मिलान का चरण, दोहरे मॉडल सेटअप जितना ही महत्वपूर्ण है। स्रोत के अनुसार, जब दोनों तरीके एक ही लक्ष्य को चिह्नित करते हैं, तो एक साधारण confidence rule तय करता है कि कौन-सी भविष्यवाणी बनी रहे, ताकि दोहरी गिनती न हो। यह एक व्यावहारिक समस्या का व्यावहारिक समाधान है: यदि दो अलग-अलग counters एक ही वस्तु को देखते हैं, तो सिस्टम को उसे एक ही उत्तर में समेटने का तरीका चाहिए।

Meta के SAM3 पर आधारित

शोधकर्ताओं ने पूरी प्रणाली ज़ीरो से नहीं बनाई। यह मॉडल Meta के pretrained SAM3 को आधार के रूप में उपयोग करता है, जो छवि और टेक्स्ट को साथ संसाधित कर सकता है। पूरे नेटवर्क को फिर से प्रशिक्षित करने के बजाय, टीम ने गिनती कार्य के लिए छोटे adapter components जोड़े।

यह चुनाव AI विकास में एक व्यापक प्रवृत्ति के अनुरूप है। हर नए उपयोग के लिए सामान्य multimodal मॉडल फिर से बनाने के बजाय, शोधकर्ता increasingly एक सक्षम base model से शुरू करके task-specific layers या modules जोड़ रहे हैं। इसके लाभ स्पष्ट हैं: कम प्रशिक्षण लागत, तेज़ प्रयोग, और विभिन्न डोमेन में ज्ञान स्थानांतरित होने की बेहतर संभावना।

इस मामले में स्थानांतरण का लक्ष्य असाधारण रूप से व्यापक है। मॉडल को सैटेलाइट इमेजरी, मेडिकल स्कैन, प्रयोगशाला तस्वीरों, और रोज़मर्रा की तस्वीरों में काम करने के लिए बनाया गया है। यदि यह दृष्टिकोण बड़े पैमाने पर काम करता है, तो यह संकेत देगा कि counting को अलग-अलग vertical tasks की श्रृंखला की बजाय एक सामान्यीकृत visual reasoning function के रूप में देखा जा सकता है।

कस्टम डेटासेट और मज़बूत बेंचमार्क परिणाम

स्रोत के अनुसार, Count Anything को CLOC नामक एक कस्टम डेटासेट पर प्रशिक्षित किया गया और परीक्षणों में इसने कई प्रतिस्पर्धी प्रणालियों से बेहतर प्रदर्शन किया। यह प्रदर्शन दावा महत्वपूर्ण है, क्योंकि अगर सामान्यता सटीकता की कीमत पर आती है, तो उसका लाभ नहीं रहता। गिनती प्रणालियाँ इस बात पर टिकी होती हैं कि वे दृश्य गंदे, भीड़भाड़ वाले, या domain-shifted होने पर भी सटीकता बनाए रख सकें।

छह visual domains का image grid, जिनमें General Scene, Remote Sensing, Histopathology, Cellular Microscopy, Agriculture, और Microbiology के उदाहरण दिखते हैं.
CLOC डेटासेट छह बहुत अलग इमेज डोमेन को जोड़ता है, रोज़मर्रा की तस्वीरों और सैटेलाइट इमेजरी से लेकर माइक्रोस्कोपी और हिस्टोपैथोलॉजी तक। | Image: Lei et al.

साथ ही, रिपोर्ट परिणाम को बढ़ा-चढ़ाकर नहीं बताती। मॉडल अब भी अस्पष्ट शब्दों और बहुत घने दृश्यों में संघर्ष करता है। ये सावधानियाँ इसलिए ज़रूरी हैं, क्योंकि वे समस्या के उस हिस्से को उजागर करती हैं जो अब भी अनसुलझा है। जब भाषा धुंधली हो या दृश्य बहुत अव्यवस्थित हो, तो मनुष्य भी इस पर असहमत हो सकते हैं कि वास्तव में क्या गिनना चाहिए। “वाहनों को गिनो” जैसा प्रॉम्प्ट तब तक सरल लगता है, जब तक उसमें खिलौना कारें, आंशिक रूप से छिपी वस्तुएँ, या दूर की अस्पष्ट आकृतियाँ न आ जाएँ।

घने इमेजरी भी एक लगातार चुनौती है। जब वस्तुएँ बहुत अधिक ओवरलैप करती हैं या लगभग अलग न पहचानने योग्य हो जाती हैं, तो गिनती मानक detection से अधिक statistical estimation जैसी बन जाती है। जो सिस्टम एक प्रकार की घनत्व को अच्छी तरह संभालता है, वह दूसरे पर टूट सकता है। इसलिए हाइब्रिड डिज़ाइन उल्लेखनीय है, भले ही वह edge cases को पूरी तरह न सुलझाए।

सामान्य गिनती का महत्व क्यों है

यदि Count Anything या ऐसे सिस्टम परिपक्व होते हैं, तो प्रभाव बेंचमार्क लीडरबोर्ड से कहीं आगे जा सकता है। चिकित्सा में, विश्वसनीय गिनती छवि-आधारित विश्लेषण में सहायक हो सकती है, जहाँ चिकित्सकों को कोशिकाओं, घावों, या अन्य दिखाई देने वाले लक्ष्यों के अनुमान चाहिए। कृषि में, पौधों या फसल विशेषताओं की गिनती उपज अनुमान में मदद कर सकती है। परिवहन और शहरी नियोजन में, कारों या पैदल यात्रियों की गिनती ट्रैफिक प्रबंधन को सूचित कर सकती है। विज्ञान में, घनी छवियों में छोटे ढाँचों की गिनती एक नियमित लेकिन थकाऊ आवश्यकता है।

प्रॉम्प्ट-आधारित सिस्टम की अपील यह है कि यह उपयोगकर्ता के इरादे और मशीन आउटपुट के बीच की बाधा को कम करता है। एक ही श्रेणी के लिए बने संकीर्ण टूल को चुनने के बजाय, उपयोगकर्ता भाषा में वस्तु निर्दिष्ट कर सकता है और गिनती के साथ दृश्य चिन्ह भी प्राप्त कर सकता है, जो दिखाते हैं कि क्या शामिल किया गया। इस तरह की explainability उपयोगी है, क्योंकि उपयोगकर्ता जाँच सकते हैं कि सिस्टम ने सही चीज़ें गिनी हैं या नहीं, केवल एक संभावित कुल नहीं मिला।

यह शोध गिनती के कठिन हिस्सों को समाप्त नहीं करता, लेकिन उन्हें नए तरीके से प्रस्तुत करता है। गिनती को अलग-अलग niches के संग्रह की तरह देखने के बजाय, यह इसे एक साझा multimodal समस्या के रूप में देखता है, जिसमें domain-specific भिन्नता है। यह एक अधिक महत्वाकांक्षी लक्ष्य है, और स्रोत के अनुसार, शुरुआती परिणाम इतने मज़बूत हैं कि इस प्रयास पर नज़र रखना उचित लगता है।

यह लेख The Decoder की रिपोर्टिंग पर आधारित है। मूल लेख पढ़ें.

Originally published on the-decoder.com