எளிமையாகத் தோன்றும் ஒரு கணினிப் பார்வை சிக்கலுக்கு இப்போது விரிந்த பதில் கிடைக்கிறது
நவீன AI அமைப்புகள் படங்களுக்கு விளக்கம் எழுதவும், பொருட்களை அடையாளம் காணவும், உரையைப் பிரித்தெடுக்கவும் முடியும். ஆனால் பொருள் எண்ணிக்கை இன்னும் பொதுவாகச் செயல்படுத்துவதற்கு கடினமான காட்சி பணிகளில் ஒன்றாகவே உள்ளது. கூட்டத்தில் உள்ள மனிதர்களை நன்றாக எண்ணும் ஒரு மாதிரி, மைக்ரோஸ்கோப்பின் கீழ் உள்ள செல்களை அல்லது செயற்கைக்கோள் படங்களில் உள்ள வாகனங்களை எண்ணுவதில் தோல்வியடையலாம். அந்த இடைவெளி முக்கியமானது, ஏனெனில் எண்ணிக்கை ஒரு விளையாட்டு சிக்கல் அல்ல. அது மருத்துவப் படிமம், வேளாண்மை, போக்குவரத்து பகுப்பாய்வு, மற்றும் துல்லியம் முக்கியமான அறிவியல் பணிகளில் தோன்றுகிறது.
Count Anything எனப்படும் புதிய ஆராய்ச்சி அமைப்பு, பொருள் எண்ணிக்கையை ஒரு பொதுப் பயன்பாட்டு திறனாக மாற்றுவதன் மூலம் அந்த வரம்பை சமாளிக்க வடிவமைக்கப்பட்டுள்ளது. மூலப் பொருளின்படி, இந்த மாதிரி ஒரு உரைத் தூண்டுதலை மட்டும் பயன்படுத்தி மிகவும் வேறுபட்ட பட வகைகளில் பொருட்களை எண்ணவும், லேபிளிடவும் முடியும். தலைகள், கார்கள், செல்கள், அல்லது பாக்டீரியா காலனிகளை எண்ணுமாறு கேட்கக்கூடிய ஒரே அமைப்பு உருவாக்கப்படுவது தான் இலக்கு; ஒவ்வொரு துறைக்கும் தனித்துவமான மாதிரி தேவைப்படக் கூடாது.
இதுவே இந்தப் பணியை குறிப்பிடத்தக்கதாக மாற்றுகிறது. சவால் கண்டறிதல் மட்டும் அல்ல. வெவ்வேறு பட அளவுகள், பொருள் அளவுகள், மற்றும் காட்சி அடர்த்திகளை கையாளும் போது, இரட்டை எண்ணிக்கை மற்றும் குழப்பத்தைத் தவிர்ப்பதே உண்மையான சிக்கல்; அவைதான் எண்ணிக்கை அமைப்புகளை அடிக்கடி கெடுக்கின்றன.
இரண்டு எண்ணிக்கை முறைகள், ஒரே அமைப்பில் இணைந்து
Count Anything இன் மைய வடிவமைப்பு ஒரு கலப்பு முறை. மூலத்தின்படி, இந்த மாதிரி இரண்டு ஒன்றை ஒன்று நிறைவு செய்யும் அணுகுமுறைகளை இணைக்கிறது. ஒன்று region-based ஆகும், பெரியதும் தெளிவாகத் தெரியும் பொருட்களுக்குச் சிறப்பாக வேலை செய்கிறது; அவற்றைச் சுற்றி bounding box-களை வரைகிறது. மற்றொன்று pixel-based ஆகும், சிறிய அல்லது அதிக அடர்த்தி கொண்ட இலக்குகளுக்காக அமைக்கப்பட்டுள்ளது; box-களுக்குப் பதிலாக புள்ளிகளை வைக்கிறது. இறுதியில் அமைப்பு இந்த இரு output-களையும் ஒன்றிணைத்து counted objects-களின் ஒரு முடிவு தொகுப்பை உருவாக்குகிறது.
இந்த அணுகுமுறை காட்சி AI-யின் பொதுவான தோல்வி முறையைச் சரிசெய்கிறது. பெரிய பொருட்களும் நெருக்கமாகக் குவிந்த சிறிய பொருட்களும் பெரும்பாலும் வேறு கையாளுதலைத் தேவைப்படுகின்றன. கூட்ட எண்ணிக்கை அமைப்பு, அடர்த்தியான தலை எண்ணிக்கையில் சிறப்பாக இருந்தாலும், பெரிய தனித்த பொருட்களில் மோசமாக இருக்கலாம். box-களுக்குப் பயிற்சி பெற்ற detector, நெருக்கமாக இருக்கும் நுண்-அளவிலான இலக்குகளைத் தவறவிடலாம். பணியைப் பிரித்து, பின்னர் output-களை இணைப்பதன் மூலம், ஆராய்ச்சியாளர்கள் அளவின் இரு முனைகளையும் கையாள முயல்கிறார்கள்.

மீளச் சேர்க்கும் படியும், இரு மாதிரி அமைப்பைப் போல் முக்கியமானதே. மூலத்தின்படி, இரண்டு முறைகளும் ஒரே இலக்கைச் சுட்டிக்காட்டினால், எளிய confidence rule மூலம் எந்த prediction நிலைத்திருக்க வேண்டும் என்று தீர்மானிக்கப்படுகிறது; இதனால் இரட்டை எண்ணிக்கை தவிர்க்கப்படுகிறது. இது ஒரு நடைமுறைச் சிக்கலுக்கான நடைமுறைத் தீர்வு: இரண்டு தனித்த counters ஒரே பொருளைக் கண்டால், அமைப்பு அதை ஒரே விடையாகக் குறைக்கும் வழி தேவை.
Meta-வின் SAM3 மீது அமைக்கப்பட்டது
ஆராய்ச்சியாளர்கள் இந்த முழு மாதிரியையும் ஆரம்பத்திலிருந்து உருவாக்கவில்லை. அமைப்பு Meta-வின் pretrained SAM3-ஐ அடிப்படையாகக் கொண்டு, படத்தையும் உரையையும் ஒன்றாகச் செயலாக்கும் அதன் திறனைப் பயன்படுத்துகிறது. முழு நெட்வொர்க்கையும் மறுபயிற்சி செய்வதற்குப் பதிலாக, குழு எண்ணிக்கைப் பணிக்கான சிறிய adapter கூறுகளைச் சேர்த்தது.
இந்தத் தேர்வு AI மேம்பாட்டில் காணப்படும் பரந்தப் போக்குடன் ஒத்திருக்கிறது. ஒவ்வொரு புதிய பயன்பாட்டிற்கும் பொதுவான multimodal மாதிரிகளை மறுபடியும் உருவாக்குவதற்குப் பதிலாக, ஆராய்ச்சியாளர்கள் அதிக திறன் கொண்ட அடிப்படை மாதிரியிலிருந்து தொடங்கி task-specific layers அல்லது modules-ஐச் சேர்க்கிறார்கள். இதன் நன்மைகள் தெளிவானவை: குறைந்த பயிற்சி செலவு, வேகமான பரிசோதனை, மற்றும் துறைகள் கடந்து அறிவு பரிமாற்றம் நடக்கும் வாய்ப்பு அதிகம்.
இந்தச் சூழலில் அந்த பரிமாற்ற இலக்கு மிகப் பரந்தது. செயற்கைக்கோள் படங்கள், மருத்துவ ஸ்கேன், ஆய்வுகூடப் புகைப்படங்கள், மற்றும் அன்றாடப் படங்களில் கூட வேலை செய்யும் வகையில் மாதிரி உருவாக்கப்பட்டுள்ளது. இந்த அணுகுமுறை அளவில் வெற்றியடையுமானால், எண்ணிக்கையை தனித்தனி vertical tasks-களின் தொகுப்பாக அல்ல, பொதுவான visual reasoning function-ஆகப் பார்க்க முடியும் என்பதை அது காட்டும்.
தனிப்பயன் தரவுத்தொகை மற்றும் வலுவான அளவுகோல் முடிவுகள்
மூலத்தின்படி, Count Anything CLOC எனப்படும் தனிப்பயன் தரவுத்தொகையில் பயிற்சி பெற்று, சோதனைகளில் பல போட்டி அமைப்புகளை மிஞ்சியது. பொதுவாகச் செயல்படும் திறன் துல்லியத்தை இழக்காமல் வராதால் அதற்கு மதிப்பில்லை என்பதால் இந்த செயல்திறன் கூற்று முக்கியமானது. காட்சி களங்கமடைந்ததும், கூட்டம் மிகுந்ததும், அல்லது domain shift ஏற்பட்டதும் கூட துல்லியத்தைப் பேண முடிந்தால்தான் எண்ணிக்கை அமைப்புகள் வெற்றி பெறும்.

அதே நேரத்தில், அறிக்கை முடிவை மிகைப்படுத்தவில்லை. மாதிரி இன்னும் குழப்பமான சொற்களிலும் மிக அடர்த்தியான காட்சிகளிலும் சிரமப்படுகின்றது. இந்தக் குறிப்பு முக்கியமானது, ஏனெனில் அது இன்னும் தீராத பகுதியை வெளிப்படுத்துகிறது. மொழி மங்கலாக இருந்தால் அல்லது காட்சி மிகக் குழப்பமாக இருந்தால், எதை எண்ண வேண்டும் என்பதில் மனிதர்களுக்கே ஒருமித்த கருத்து இருக்காது. “வாகனங்களை எண்ணு” என்ற தூண்டுதல் எளிதாகத் தோன்றலாம்; ஆனால் toy cars, பகுதி மறைப்பு, அல்லது தொலைவில் தெளிவாகத் தெரியாத வடிவங்கள் வந்தால் நிலை மாறும்.
அடர்த்தியான படங்களும் இன்னொரு தொடர்ச்சியான சவால். பொருட்கள் மிக அதிகமாக ஒருவரை ஒருவர் மூடிக்கொண்டால் அல்லது கிட்டத்தட்ட வேறுபடுத்த முடியாத அளவிற்கு மாறினால், எண்ணிக்கை standard detection-க்கு பதிலாக statistical estimation போல மாறும். ஒரு வகை அடர்த்தியை நன்றாக கையாளும் அமைப்பு, வேறு வகையில் தோல்வியடையலாம். அதனால்தான் இந்த hybrid design குறிப்பிடத்தக்கது, எஜ் கேஸ்களை முழுமையாகத் தீர்க்காவிட்டாலும்.
பொதுவான எண்ணிக்கை ஏன் முக்கியம்
Count Anything அல்லது அதைப் போன்ற அமைப்புகள் முதிர்ந்தால், அதன் தாக்கம் benchmark leaderboards-ஐ விட வெகுதூரம் செல்லலாம். மருத்துவத்தில், நம்பகமான எண்ணிக்கை பட அடிப்படையிலான பகுப்பாய்வுக்கு உதவலாம்; அங்கு மருத்தவர்களுக்கு செல்கள், பாதிப்புகள், அல்லது மற்ற காட்சி இலக்குகளின் மதிப்பீடுகள் தேவைப்படும். வேளாண்மையில், தாவரங்கள் அல்லது பயிர் அம்சங்களை எண்ணுதல் உற்பத்தி மதிப்பீட்டுக்கு உதவும். போக்குவரத்து மற்றும் நகரத் திட்டமிடலில், கார்கள் அல்லது நடக்கிறவர்கள் எண்ணப்படுவது traffic management-ஐத் தகவலளிக்கும். அறிவியலில், அடர்த்தியான படங்களில் சிறிய கட்டமைப்புகளை எண்ணுவது ஒரு வழக்கமான ஆனால் சலிப்பான தேவை.
தூண்டுதல்-அடிப்படையிலான அமைப்பின் ஈர்ப்பு என்னவென்றால், அது பயனர் நோக்கம் மற்றும் இயந்திர வெளியீடு இடையிலான இடைவெளியைக் குறைக்கிறது. ஒரே வகைக்காக உருவாக்கப்பட்ட குறுகிய கருவியைத் தேர்ந்தெடுப்பதற்குப் பதிலாக, பயனர் மொழியில் பொருளைக் குறிப்பிடலாம்; எண்ணிக்கையும், எந்தவை சேர்க்கப்பட்டன என்பதைக் காட்டும் காட்சி குறிகளும் கிடைக்கும். இப்படியான explainability பயனுள்ளதாக இருக்கிறது; ஏனெனில் அமைப்பு சரியானவற்றை எண்ணியதா என்பதைப் பயனர்கள் பரிசோதிக்க முடியும், சாத்தியமான மொத்தத்தைக் கிடைப்பதோடு நின்றுவிடாமல்.
இந்த ஆராய்ச்சி எண்ணிக்கையின் கடினமான பகுதிகளை முற்றிலும் நீக்கவில்லை, ஆனால் அவற்றை மறுபரிசீலனை செய்கிறது. எண்ணிக்கையை தனித்தனி niche-களின் தொகுப்பாகப் பார்ப்பதற்குப் பதிலாக, அது துறைவாரியான மாறுபாடுகளுடன் கூடிய ஒரு பகிரப்பட்ட multimodal பிரச்சினையாகப் பார்க்கிறது. இது அதிக மகத்தான இலக்கு, மேலும் மூலத்தின்படி, ஆரம்ப முடிவுகள் அதை கவனமாகப் பார்க்கத் தகுந்ததாக உள்ளன.
இந்தக் கட்டுரை The Decoder வெளியிட்ட செய்தி அறிக்கையை அடிப்படையாகக் கொண்டது. மூலக் கட்டுரையைப் படிக்கவும்.
Originally published on the-decoder.com


