ஒரு சாட்போட்டின் பிடித்த வாக்கியம் தான் செய்தியாக மாறும் போது
ChatGPT-இன் பாணி சார்ந்த மீளுரைகள் ஆங்கிலத்தில் பரிச்சயமானவை. ஆனால் Wired வெளியிட்ட செய்தியின்படி, சீனப் பயனர்களுக்கும் இதேபோலவே மீண்டும் மீண்டும் வரும், அவர்களுக்கு அதே அளவு எரிச்சலூட்டும் சொற்றொடர்கள் உள்ளன. அதில் மிகவும் குறிப்பிடத்தக்க உதாரணம், சொல்லுக்கு சொல் மொழிபெயர்த்தால் “நான் உன்னை உறுதியாகப் பிடித்துக்கொள்வேன்” என்று வரும் ஒரு வரி. பல தாய்மொழி பேசுவோர் அதை அசிங்கமாக அன்பானது, சூழலுக்கு பொருந்தாதது என்று கூறுகின்றனர். உதவியாகத் தோன்றுவதற்குப் பதிலாக, அது கட்டாயமாக, மீளுரையாக, மற்றும் தாளத்தில் விசித்திரமாக உணரப்படலாம்.
அந்த எதிர்வினை இணைய மீமாக மாறும் அளவுக்கு வலுப்பெற்றுள்ளது. செய்திக்கமைய, சீனப் பயனர்கள் அந்தச் சொற்றொடரைப் பொதுவாகவே கிண்டல் செய்கிறார்கள். ஒரு படத்தில் ChatGPT-ஐ, மக்கள் விழும் போது அவர்களைப் பிடிக்கக் காத்திருக்கும் inflatable rescue airbag போல காட்டப்பட்டுள்ளது. ஒரு காலத்தில் மாடலின் வித்தியாசமான பழக்கமாக இருந்த ஒரு சொற்றொடர், நடைமுறையில் AI உருவாக்கும் மொழியின் பண்பாட்டு விமர்சனமாக மாறிவிட்டது.
தெளிவான மொழித் திறனின் வரம்புகள்
ChatGPT சீன மொழியில் கேள்விகளுக்கு நன்றாக பதிலளிக்க முடியும் என்பதை அந்த செய்தி தெளிவாக்குகிறது. அதுவே, அரசு தடை இருந்தபோதிலும் அது சீனாவில் பரவலாகப் பயன்படுத்தப்படுவதற்கான ஒரு காரணம். ஆனால் இலக்கணத் திறன் அல்லது பணிகளை முடிப்பதிலான திறன், இயல்பான பாணியை உறுதி செய்யாது. இங்கு பயனர்களைச் சிரமப்படுத்துவது அடிப்படை தொடர்புத் தோல்வி அல்ல. மாறாக, உணர்ச்சிப் பெருக்கமாக, சூழலுக்கு அந்நியமாக, அல்லது மிக நெருக்கமாகத் தோன்றும் வெளிப்பாடுகள் மீண்டும் மீண்டும் பயன்படுவதாகும்.
அந்த வித்தியாசம் முக்கியமானது. ஒரு மாடல் இலக்கண ரீதியாக தெளிவாகத் தோன்றலாம்; ஆனால் சமூக ரீதியாக தவறாக ஒலிக்கலாம். பலமொழி AI அமைப்புகளில், இத்தகைய பொருத்தமின்மை வெளிப்படைப் பிழையைவிடவும் அதிகமாக சொல்லிக்கொடுப்பதாக இருக்கலாம். ஏனெனில் அது மொழி உருவாக்கம் மற்றும் பண்பாட்டு பொருத்தம் ஆகியவற்றுக்கிடையிலான இடைவெளியை வெளிப்படுத்துகிறது.
மீளுரையிலிருந்து மீமுக்கு
Wired, அதிகமாகப் பயன்படுத்தப்படும் சீன சொற்றொடர்களின் பிற உதாரணங்களையும் குறிப்பிடுகிறது; அதில் மாடல் அடிக்கடி மீண்டும் சொல்லும் ஒரு பொதுவான e-commerce slogan கூட உள்ளது. இதன் தாக்கம் சேர்க்கை விளைவாக அதிகரிக்கிறது. ஒரு சொற்றொடர் மீண்டும் மீண்டும் தோன்றுவதை பயனர்கள் கவனித்தவுடன், அது தொடர்பு கருவியாக இயங்குவதை நிறுத்தி, ஒரு சின்னமாக மாறுகிறது. அது உரையை இயந்திரம் உருவாக்கியதாக குறிக்கிறது மற்றும் மாடல் நம்பகமாக உருவாக்கக்கூடிய குரல் வரம்பைச் சுருக்குகிறது.
அதனால்தான் இந்த நிகழ்வு ஒரு மீமாக வளர்ந்தது. AI வெளியீட்டில் மீளுரை என்பது வெறும் தொழில்நுட்பக் குறை மட்டுமல்ல; அது சமூகமாக வாசிக்கக்கூடிய ஒரு குறியீடு. பயனர்கள் அதை முன்கூட்டியே எதிர்பார்க்கத் தொடங்குகிறார்கள், கிண்டல் செய்கிறார்கள், பகிர்கிறார்கள். அது நடந்தவுடன், அந்த மொழிப் பழக்கம் மாடலின் பொது அடையாளத்தின் ஒரு பகுதியாகிவிடுகிறது.
நடைமுறையில் “mode collapse” எப்படி தெரிகிறது
இந்தப் போக்கை Pangram நிறுவனத்தின் cofounder மற்றும் CEO Max Spero, mode collapse என்ற ஒரு வடிவமாக விவரிப்பதாக கட்டுரை குறிப்பிடுகிறது. எளிய சொற்களில், மாடல்கள் post-training-இல் ஒருகாலத்தில் பாராட்டப்பட்ட சொற்றொடர்களை பிடித்துக்கொண்டு, அவை இயல்பற்றதாக உணரப்படும் அளவுக்கு அதிகமாகப் பயன்படுத்தலாம். இங்குள்ள அடிப்படை சிக்கல், “நல்ல எழுத்து” என்பது ஒரு வாக்கியம் வேலை செய்கிறதா இல்லையா என்பதோடு முடிவதில்லை. அதில் மாறுபாடு, அளவு, மற்றும் ஒருமுறை பயனாக இருந்த உத்தியை எப்போது மீண்டும் பயன்படுத்தக்கூடாது என்ற புரிதலும் அடங்கும்.
இந்தக் கவனிப்பு, AI alignment மற்றும் style tuning ஆகியவற்றில் இருக்கும் ஒரு விரிவான சவாலை சுட்டிக்காட்டுகிறது. பயிற்சியின்போது safety, helpfulness, warmth ஆகியவற்றை வலுப்படுத்தலாம். ஆனால் அவை வெளியீட்டில் மிகைப்படுத்தப்பட்டு விடலாம். அதன் விளைவாக, தொழில்நுட்ப ரீதியாக ஒத்திசைந்த ஆனால் உணர்ச்சிப்பூர்வமாக மிகையாக நிர்ணயிக்கப்பட்ட மொழி உருவாகிறது.
சீன சூழல் ஏன் முக்கியம்
இது ஒரே ஒரு வித்தியாசமான சொற்றொடரின் கதை மட்டும் அல்ல. AI தயாரிப்புகள் மொழிகளையும் சமூக சூழல்களையும் கடந்து எவ்வாறு பயணம் செய்கின்றன என்பதின் கதை இது. ஆங்கிலத்தில் பயனர்கள் சில பிடித்த rhetorical structures அல்லது அதிகமாகப் பயன்படுத்தப்படும் உருவகங்களைப் பற்றி புகார் கூறலாம். சீனத்தில் பிரச்சினை வேறு சொற்களில் தோன்றுகிறது, ஆனால் அடிப்படை இயக்கம் ஒன்றே: மாடலின் கற்ற பழக்கங்களை வெளிப்படையாகக் காட்டும் பாணிச் சுவடுகள்.
அதனால் உலகளாவிய AI அமைப்புகளுக்கு இது மிகவும் முக்கியமானது. பல மொழிகளில் இயங்கும் ஒரு chatbot, நேரடி மொழிபெயர்ப்பின் தரத்தையே நம்ப முடியாது. அது ஒவ்வொரு பயன்பாட்டு சூழலிலும் விசித்திரமாக நெருக்கமாக, மிக அதிகமாக script செய்யப்பட்டதுபோல, அல்லது பண்பாட்டு ஒத்திசைவின்றி ஒலிக்காமல் இருக்கவும் வேண்டும்.
பயனர்களே பொதுவெளியில் கண்டறிகின்றனர்
அந்த அறிக்கையில் மிகவும் வெளிச்சம் போடும் விவரம் என்னவென்றால், அந்தச் சொற்றொடர் Chongqing-இல் உள்ள 20 வயது developer ஒருவரை April Fools-க்கு Jiezhu, அல்லது “catch”, என்ற open-source prompt engineering project ஒன்றை உருவாக்கத் தூண்டியது. அந்த நகைச்சுவை வேலை செய்தது, ஏனெனில் அந்தச் சொற்றொடர் ஏற்கனவே பரவலாக அறியப்பட்டிருந்தது. வேறு வார்த்தைகளில் சொன்னால், அதிகாரப்பூர்வ விளக்கத்திற்கு முன்பே பயனர்கள் கூட்டாக ஒரு மாடல் நடத்தையை அடையாளம் கண்டு, அதற்கு பெயரிட்டிருந்தனர்.
நுகர்வோர் AI பொதுவெளியில் இப்போது இப்படித்தான் audit செய்யப்படுகிறது. pattern-களை கண்டறிய பயனர்களுக்கு training pipeline-களுக்கான அணுகல் தேவையில்லை. அவர்கள் output-களை ஒப்பிடுகிறார்கள், screenshot-களை பகிர்கிறார்கள், மற்றும் மீளுரையை folk analysis ஆக மாற்றுகிறார்கள். இவ்வாறு, ஒரு மாடலின் குரல் எங்கு தழுவும் தன்மையை இழந்து, தானே சிக்கிக்கொண்டதுபோல் உணரப்படத் தொடங்குகிறது என்பதை அவர்கள் வெளிப்படுத்துகிறார்கள்.
ஒரு பெரிய வடிவமைப்பு பிரச்சினையின் சிறு அறிகுறி
பாடம் என்னவென்றால், AI-க்கு ஒருபோதும் அடையாளமுள்ள குரல் இருக்கக்கூடாது என்பதல்ல. குரல் சூழலை மீறி நிற்கும் மீளுரைக் சூத்திரங்களாக சுருங்கும் போது தான் அது ஒரு ஆபத்தாகிறது. ChatGPT-இன் சீன காட்சிவாக்கியங்கள் இந்த failure mode-இன் தெளிவான ஆய்வு மாதிரி. ஆதரவாக ஒலிக்க வேண்டிய ஒரு அமைப்பு, மீளுரை தென்படத் தொடங்கியவுடன் எவ்வளவு விரைவாக இயந்திரத்தனமாகவும், பிடிவாதமாகவும் கூட ஒலிக்கத் தொடங்கும் என்பதை அவை காட்டுகின்றன.
AI நிறுவனங்களுக்கு இது ஒரு ஆர்வத் தகவல் மட்டுமல்ல; ஒரு எச்சரிக்கை. பலமொழி அமைப்புகளில் tone control என்பது மேற்பரப்புச் சிக்கல் அல்ல. அது நம்பிக்கை, பயன்பாட்டு வசதி, மற்றும் பயனர்கள் அந்த மாடலை உண்மையிலேயே உதவிகரமாக உணர்கிறார்களா அல்லது வெறும் pattern-ஆக மட்டுமா உணர்கிறார்கள் என்பதை வடிவமைக்கிறது. மில்லியன் கணக்கானோர் ஒரே சொற்றொடருக்கு கண்களை உருட்டத் தொடங்கும்போது, அந்தப் பொருள் அதன் படைப்பாளிகள் எண்ணியதைவிட அதன் பயிற்சியைப் பற்றி அதிகம் வெளிப்படுத்திவிட்டதாக அர்த்தம்.
இந்தக் கட்டுரை Wired-இன் செய்தியறிக்கையை அடிப்படையாகக் கொண்டது. மூலக் கட்டுரையைப் படிக்கவும்.
Originally published on wired.com




