பெரிய மொழி மாதிரிகள் பணியமர்த்தல் பணிகளில் தங்களுக்கென முன்னறிவுகளை உருவாக்கலாம்
பணியமர்த்தலில் செயற்கை நுண்ணறிவு குறித்து வரும் எச்சரிக்கைகள் பொதுவாக ஒரு பழகிய அபாயத்தைச் சுற்றியே அமைகின்றன: ஒரு மாதிரி பாகுபாடுள்ள வரலாற்றுத் தரவில் பயிற்சியளிக்கப்பட்டால், அது அந்த பாகுபாடுகளை மீண்டும் உருவாக்கி, மேலும் பெரிதாக்கலாம். Gizmodo குறிப்பிட்டுள்ள புதிய ஆய்வு இதைவிட மேலும் கவலைக்கிடமான ஒரு சாத்தியத்தை சுட்டிக்காட்டுகிறது. பெரிய மொழி மாதிரிகள் மனித பாகுபாட்டை வெறுமனே பிரதிபலிப்பதில்லை. சில சூழ்நிலைகளில், அவை தாமாகவே புதிய சமூகப் பாகுபாடுகளை உருவாக்கக்கூடும்.
பிரின்ஸ்டன் பல்கலைக்கழகமும் சிகாகோ பல்கலைக்கழகமும் சேர்ந்த ஆய்வாளர்கள் நடத்திய இந்த ஆராய்ச்சி, மனித பங்கேற்பாளர்களுடன் முன்னர் பயன்படுத்தப்பட்ட ஒரு கட்டுப்படுத்தப்பட்ட பணியமர்த்தல் விளையாட்டில் மொழி மாதிரிகளை சோதித்தது. இந்த அமைப்பு நிஜ உலக இனக்குழுப் பிரிவுகளை நீக்கி, அவற்றுக்குப் பதிலாக கற்பனைக்குரிய குழுக்களை வைத்தது; இதனால் உண்மையான அடிப்படை குழு வேறுபாடுகள் எதுவும் இல்லாதபோது முன்னறிவுகள் எவ்வாறு உருவாகின்றன என்பதை ஆராய்ச்சியாளர்கள் கவனிக்க முடிந்தது.
ஆய்வு சுருக்கத்தின் படி, மொழி மாதிரிகள் மனித பங்கேற்பாளர்களைவிட அதிகமான பாகுபாடுகளை அடிக்கடி உருவாக்கின. இந்தக் கண்டுபிடிப்பு முக்கியமானது, ஏனெனில் அது கொள்கை விவாதத்தின் திசையை மாற்றுகிறது. பிரச்சினை கலங்கிய வரலாற்றுத் தரவுகளால் மட்டுமே ஏற்பட்டிருந்தால், பயிற்சி தரவுக் கூட்டங்களின் சிறந்த தேர்வு, பாகுபாடு நீக்கம், அல்லது தணிக்கை ஆகியவற்றால் பெரும்பாலான சிக்கலைத் தீர்க்கலாம் என்று உருவாக்குநர்கள் வாதிட முடியும். ஆனால் முடிவு சார்ந்த பணிகளில் மாதிரிகள் தங்களின் சொந்த வெகுமதி-தேடும் நடத்தை மூலம் பாகுபாடான வடிவங்களை உருவாக்கினால், நிர்வாகச் சவால் மேலும் பரந்ததாகிவிடுகிறது.
கற்பனை செய்யப்பட்ட மக்கள் தொகைக் குழுக்களுடன் ஒரு கட்டுப்படுத்தப்பட்ட சோதனை
இந்தப் பரிசோதனையில், வேட்பாளர்கள் நான்கு கற்பனை இனக்குழுக்களில் ஒன்றாக ஒதுக்கப்பட்டனர்: Tufa, Aima, Reku, அல்லது Weki. மற்ற எல்லா அம்சங்களிலும், எந்தப் பணியிலும் வெற்றி பெறும் வாய்ப்பு அவர்களுக்கு சமமாக இருந்தது. மனிதர் அல்லது இயந்திரம் எனப் பங்கேற்பாளர்கள், விண்ணப்பதாரர்களை வேலைகளுக்கு ஒதுக்க வேண்டும்; பின்னர் அந்தப் பணியமர்த்தல் முடிவு வெற்றியா இல்லையா என்பது குறித்து பின்னூட்டம் பெற்றனர்.
அந்த பின்னூட்ட வளையம் மிகவும் முக்கியமானது. ஒரு குறிப்பிட்ட கற்பனைக்குழுவின் உறுப்பினரை ஒரு குறிப்பிட்ட வேடத்தில் வைத்த பிறகு மோசமான முடிவு கிடைத்தவுடன், அதே இணைப்பை மீண்டும் தேர்வு செய்யும் வாய்ப்பு அவர்கள் பல நேரங்களில் குறைந்தது. விளையாட்டின் முந்தைய பதிப்பில் மனிதர்களும் இதே倾向த்தை காட்டினர்; விளையாட்டு முடிந்த பிறகும் சில நேரங்களில் அந்தக் கற்றுக் கொண்ட பாகுபாடுகளைத் தொடர்ந்து எடுத்துச் சென்றனர்.
மொழி மாதிரிகள் இதேபோல் நடந்துகொண்டன, ஆனால் மேலும் தீவிரமாக. ஆய்வு சுருக்கம் கூறுவது, மாதிரிகள் மனிதர்களைவிட அதிக பாகுபாட்டு விகிதங்களை காட்டின, மேலும் முற்றிலும் செயற்கையான குழுக்களைச் சுற்றி தானாகவே சமூக முன்னறிவுகளை உருவாக்க முடிந்தது. குழுக்கள் கற்பனையானவை என்பதும், வேட்பாளர்கள் வடிவமைப்பின்படி சம தகுதி கொண்டவர்களாக இருந்ததும் காரணமாக, காணப்பட்ட வேறுபாடு உண்மையான குழு வேறுபாடுகளால் விளக்க முடியாது.
இது முடிவுக்கு அபூர்வமான வலிமையை அளிக்கிறது. அரிய பின்னூட்டத்திலிருந்து நிலையான வகைப்பாட்டு ஊகங்களுக்குச் செல்லும் திறன் மாதிரிக்கு இருக்கலாம் என்பதை இது சுட்டுகிறது; அந்த ஊகங்களுக்கு எந்த உண்மைப் பின்புலமும் இல்லாவிட்டாலும் கூட. நடைமுறை ரீதியில், மீண்டும் மீண்டும் பணியாளர் முடிவுகளை எடுக்க வடிவமைக்கப்பட்ட ஒரு அமைப்பு, நிச்சயமற்ற நிலையில் ஒரு எளிய குறுக்குவழியாக மங்கலான வடிவமைப்பை நோக்கி சறுக்கக்கூடும்.
“ஆராய்ச்சி-பயன்படுத்தல்” சமநிலை ஏன் முக்கியம்
இந்த முடிவை ஆராய்ச்சியாளர்கள் decision science-இல் “explore-exploit tradeoff” எனப்படும் ஒரு பாரம்பரியக் கோட்பாட்டுடன் இணைக்கின்றனர். நிச்சயமற்ற சூழல்களில், ஒரு செயற்பாட்டாளர் either explore செய்யலாம், அதாவது குறைவாகத் தெரிந்த விருப்பங்களை முயற்சிக்கலாம், அல்லது exploit செய்யலாம், அதாவது முன்பு வேலை செய்ததாகத் தோன்றும் தேர்வுகளிலேயே நிலைத்திருக்கலாம்.
மனிதர்கள் இதை எப்போதும் செய்கிறார்கள். ஆனால் purely reward-maximizing நடத்தை குறைய, மக்கள் முடிவுகளில் நெறிமுறைகள், தயக்கம், மற்றும் சமூக கட்டுப்பாடுகளையும் கொண்டு வருகிறார்கள். AI அமைப்புகள் explore செய்ய குறைவாக ஊக்கமளிக்கப்படுகின்றன என்றும், கிடைக்கும் குறைந்த பின்னூட்டம் எதைச் சிறப்பாகச் செய்கிறது எனத் தோன்றுகிறதோ அதனை அடிப்படையாகக் கொண்டு optimize செய்ய அதிகமாக முனைவதாகவும் ஆய்வு வாதிடுகிறது. இது முன்னறிவு உருவாக்கத்துக்கான பாதையை உருவாக்குகிறது.
ஒரு குறிப்பிட்ட வகை ஒரு வேலையில் வெற்றி அல்லது தோல்வியுடன் தொடர்புடையதாக இருக்கலாம் என்று மாதிரி கருதினால், அந்த ஊகத்தை சவாலிடுவதற்குப் பதிலாக அதை exploit செய்துகொண்டே இருக்கலாம். அபாயம் அந்த ஊகம் தவறானது என்பதிலேயே முடிவடைவதில்லை. அமைப்பு சீரற்ற தன்மையை ஒரு விதியாக மாற்றி, பின்னர் அந்த விதி அர்த்தமுள்ளதாக இருப்பதுபோல் நடக்க முடியும் என்பதுதான்.
இது நியமனம் தொடர்பான மென்பொருள், résumé screening tools, மற்றும் விண்ணப்பதாரர்களைச் சுருக்கவோ தரவரிசைப்படுத்தவோ பயன்படுத்தப்படும் AI assistants-க்கு தெளிவான தாக்கங்களை ஏற்படுத்துகிறது. வடிவமைப்பாளர்கள் race, gender, அல்லது பிற பாதுகாக்கப்பட்ட பண்புகளுக்கான வெளிப்படையான குறிப்புகளை நீக்கினாலும் கூட, பணிப்பாய்வில் categoryக்கள் அல்லது proxyகள் தோன்றும்போது மாதிரிகள் மாற்றுப் பண்புகளை உருவாக்கலாம். bias பயிற்சி களஞ்சியத்திலிருந்து மட்டுமல்ல, முடிவு செயல்முறையிலிருந்தும் உருவாகலாம் என்பதை இந்த ஆய்வு காட்டுகிறது.
மேலும் திறன் கொண்ட மாதிரிகள் அவசியமாக பாதுகாப்பானவை அல்ல
மூலச் சுருக்கத்தின் இன்னொரு குறிப்பிடத்தக்க அம்சம் என்னவென்றால், ஆராய்ச்சியாளர்கள் OpenAI, Anthropic, DeepSeek, Meta, Google, மற்றும் Alibaba உள்ளிட்ட முக்கிய வழங்குநர்களிடமிருந்து 15 மாதிரிகளை சோதித்தனர். மிகவும் கவனிக்கத்தக்க கண்டுபிடிப்புகளில் ஒன்று, அதிக reasoning திறன்களைக் கொண்ட புதியதும் பெரியதுமான மாதிரிகள், ஒரே மாதிரி குடும்பத்தினுள், மேலும் பாகுபாடான முடிவுகளை உருவாக்கும்傾向ம் கொண்டிருந்தன என்பதுதான்.
இது, மேம்பட்ட மாதிரிகள் உணர்வுபூர்வமான துறைகளில் இயல்பாகவே அதிக நம்பகத்தன்மை பெறுகின்றன என்ற பொதுவான கருத்துக்கு எதிராக உள்ளது. சிறந்த reasoning பல பணிகளில் மேம்பாட்டை அளிக்கலாம், ஆனால் இந்த ஆய்வு அது குறுகிய, வெகுமதி-அதிகபட்ச உத்திகளைக் கைவிட்டு அவற்றில் நிலைத்திருக்கும் வகையில் மாதிரியை மேலும் திறமையாக்கக்கூடும் என்றும், அவை பாகுபாடான நடத்தையாக உறையக்கூடும் என்றும் கூறுகிறது.
சுருக்கம் குறிப்பாக OpenAI-ன் o3 reasoning model, சோதிக்கப்பட்ட அமைப்புகளில் கற்பனை விண்ணப்பதாரர்களை மிகக் கடுமையாக அடுக்கினதாக தெரிவிக்கிறது. அதனால் மட்டும் எந்த ஒரு model-ம் production hiring product-இல் எப்படி நடக்கும் என்பது தீர்மானிக்கப்படாது. ஆனால் ஒரு பெரிய பாடத்தை அது வலியுறுத்துகிறது: benchmark gains மற்றும் reasoning performance, உண்மையான முடிவு சூழல்களில் fairness testing-க்கு மாற்றாகாது.
நிறுவனங்களும் ஒழுங்குமுறை அமைப்புகளும் இதிலிருந்து எதை எடுத்துக்கொள்ள வேண்டும்
வேலை வழங்குநர்களுக்கு உடனடி செய்தி என்னவென்றால், “AI-assisted” என்பது bias-neutral என்பதல்ல. ஒரு அமைப்பு வெளிப்படையான மனித பாகுபாட்டைத் தவிர்க்கிறது என்ற விற்பனையாளர் கூற்று மிகவும் குறுகிய அளவுகோலாகும்; ஏனெனில் அந்த மாதிரி மீண்டும் மீண்டும் கிடைக்கும் பின்னூட்ட வளையங்கள் மூலம் வகை சார்ந்த முன்னுரிமைகளை உருவாக்க முடியும். கொள்முதல் குழுக்கள், ஒரு மாதிரி காலப்போக்கில் எப்படி நடக்கிறது, அது வடிவங்களை எவ்வாறு புதுப்பிக்கிறது அல்லது வலுப்படுத்துகிறது, மற்றும் தவறான பொதுமைப்படுத்தல்கள் மக்களின் வாய்ப்புகளை நேரடியாக பாதிக்கும் துறையில் அது பயன்படுத்தப்படுகிறதா என்பதை கேட்க வேண்டும்.
ஒழுங்குமுறை அமைப்புகளுக்கு, இந்த ஆய்வு நிலையான audits-ஐ மட்டும் நம்பாமல், மேலும் முன்னேற வேண்டியதைக் காட்டுகிறது. உறைந்த தரவுத்தொகுப்பில் ஒரு முறை செய்யப்படும் சோதனை, outcomes, user prompts, அல்லது downstream optimization signals உடன் தொடர்பு கொள்ளும்போது மேலும் பாகுபாடானதாக மாறும் அமைப்பை தவறவிடலாம். கண்காணிப்பில் simulation-based stress tests, தொடர்ச்சியான monitoring, மற்றும் உயர்ந்த பங்குள்ள screening-இல் AI எப்போது முற்றிலும் விலக்கப்பட வேண்டும் என்பதற்கான தெளிவான விதிமுறைகள் சேர்க்கப்பட வேண்டியிருக்கலாம்.
பெரிய பிரச்சினை கருத்தியல் சார்ந்தது. பொதுப் பேச்சு பெரும்பாலும் AI bias-ஐ வரலாற்று மீதமுள்ள ஒரு பிரச்சினையாகவே வடிவமைத்துள்ளது: சமூகம் அநியாயமானது, தரவு அந்த அநியாயத்தைப் பதிவு செய்தது, மற்றும் மாதிரிகள் அதை மரபாக எடுத்தன. இந்த ஆராய்ச்சி சில அமைப்புகள் புதிய அநியாயங்களின் இயந்திரங்களாகவும் இருக்கலாம் எனக் கூறுகிறது; அவை மெலிந்த சைகைகளிலிருந்து முன்னறிவுகளைச் சேர்க்கின்றன, ஏனெனில் ஒரு பணியின் உள்ளே அப்படிச் செய்வது கருவி ரீதியாக பயனுள்ளதாக இருக்கும்.
அந்த சாத்தியம், பணியமர்த்தலில் language models-ன் ஏற்றுக்கொள்ளத்தக்க பயன்பாட்டு வழிகளைக் குறைக்க வேண்டும். குறைந்தபட்சமாக, அது மிகக் கடுமையான மனித மதிப்பாய்வையும், தானியங்கி ranking குறித்த சந்தேகத்தையும் வலியுறுத்துகிறது. மோசமான நிலையில், சில வேலைவாய்ப்பு முடிவுகள், இரைச்சலை சமூக தீர்ப்பாக மாற்றக்கூடிய அமைப்புகளிடம் ஒப்படைக்கத் தக்க அளவுக்கு மிக நுணுக்கமானவை அல்ல என்ற பொருளைக் கொடுக்கலாம்.
இந்தக் கட்டுரை Gizmodo செய்தித்தகவலை அடிப்படையாகக் கொண்டது. அசல் கட்டுரையைப் படிக்கவும்.
Originally published on gizmodo.com



