கற்பனை நிபுணர்கள் இணையத்தில் உண்மையான தடங்களை விட்டுச் செல்கிறார்கள்

ஒரு புதிய preprint, generative AI-யின் ஒரு விசித்திரமான துணை விளைவைக் குறித்து எச்சரிக்கை எழுப்புகிறது: மொழி மாதிரிகள் அதே கற்பனை அடையாளங்களை மீண்டும் மீண்டும் உருவாக்குவதால், அவை கல்வி மற்றும் ஆன்லைன் பதிவுகளின் சில பகுதிகளை மாசுபடுத்தத் தொடங்கியுள்ளன. 2026 ஆகஸ்ட் 27 அன்று வெளியான செய்தியின்படி, Elena Vasquez மற்றும் Marcus Chen போன்ற பெயர்கள் உண்மையான நபர்களுக்கு சொந்தமல்லாதபோதிலும், AI-ஆல் உருவாக்கப்பட்ட நூற்றுக்கணக்கான கட்டுரைகள், articles மற்றும் books-இல் தோன்றியுள்ளன.

Samsung மற்றும் University of Warsaw-இன் இந்தக் கட்டுரையின் பின்னணியில் உள்ள ஆராய்ச்சியாளர்கள், இந்த மீண்டும் மீண்டும் தோன்றும் அடையாளங்களை AI-யின் ஒரு வகையான haunting என்று விவரிக்கின்றனர். அவர்களின் மைய வாதம், பெரிய மொழி மாதிரிகள் பெயர்களை உருவாக்குகின்றன என்பதல்ல, அது எதிர்பார்க்கப்படுவது; மாறாக, அவை ஒரே வகையான சூழல்களில் அதே பெயர்களையே மீண்டும் மீண்டும் உருவாக்கும் பழக்கத்தைக் கொண்டுள்ளன என்பதுதான். காலப்போக்கில், அந்த மீளுருவாக்கம் தேடல் முடிவுகள், repositories மற்றும் மேலோட்டமாகப் பார்க்கையில் நம்பத்தகுந்ததாகத் தோன்றும் வெளியீடுகளில் பொய்யான அதிகாரத்தை விதைக்க முடியும்.

பெயர்கள் நம்பிக்கையைச் சுமக்கின்றன என்பதால் இது முக்கியமானது. கல்வி வெளியீடு மற்றும் ஆய்வு தொடர்பாடலில், வாசகர்கள் பெரும்பாலும் ஒரு ஆசிரியரின் பெயர், நிறுவனப் பங்கு அல்லது பொருள் சார்ந்த நிபுணத்துவத்தை நம்பகத்தன்மைக்கான குறுக்கு வழியாகப் பயன்படுத்துகிறார்கள். AI அமைப்புகள் நம்பத்தகுந்ததாக ஒலிக்கும் நிபுணர்களை மீண்டும் மீண்டும் உருவாக்கி, அந்தப் பெயர்கள் முறையான ஆவணங்கள் போலத் தோன்றும் பதிவுகளில் நுழைந்தால், கற்பனை உள்ளடக்கத்துக்கும் உண்மையான கல்வி பதிவுக்கும் இடையிலான எல்லை மேலும் மங்கலாகிறது.

மீண்டும் தோன்றும் பெயர் வடிவங்கள் எவ்வாறு உருவாகின்றன

இந்தக் கட்டுரை correlated name priors என்று ஆசிரியர்கள் அழைக்கும் ஒன்றில் கவனம் செலுத்துகிறது. எளிய சொற்களில் சொல்வதானால், சில மாதிரிகள் கற்பனை அடையாளங்களை சீரற்ற முறையில் உருவாக்குவதில்லை. குறிப்பிட்ட வகை நிபுணர்கள், ஆசிரியர்கள் அல்லது கதாபாத்திரங்களைப் பற்றி கேட்கும்போது, அவை சில பெயர்களை நோக்கிச் சாய்வைக் காட்டுகின்றன. செய்தி அறிக்கை பல உதாரணங்களை வழங்குகிறது: model மற்றும் prompt context-ஐப் பொறுத்து Elena Vasquez, Marcus Chen, Elara Voss, Aris Thorne, Lena Petrova மற்றும் Elena Amara Okafor ஆகிய பெயர்கள் அசாதாரணமான தொடர்ச்சியுடன் தோன்றுகின்றன என்று தெரிவிக்கப்படுகிறது.

இந்த நிகழ்வு தனிப் பெயர்களைத் தாண்டுகிறது. மாதிரிகள் “correlated character ensembles” என்பதையும் உருவாக்குகின்றன, அதாவது சில பெயர்கள் ஒன்றாகத் தோன்ற அதிக வாய்ப்புள்ளது என்று ஆராய்ச்சியாளர்கள் கூறுகின்றனர். இதன் பொருள், மாதிரிகள் தனித்தனி அடையாளக் குறிச்சொற்களை மட்டும் மீண்டும் பயன்படுத்தவில்லை, அடையாளப் பழக்கங்களின் குழுக்களையும் மறுஉற்பத்தி செய்கின்றன என்பதாகும். அது நடந்துவிட்டால், போலி authorship மேலும் அளவுபடுத்தக்கூடியதாக மாறுகிறது. கல்வி-பாணி உரை, புத்தகங்கள், வாழ்க்கை வரலாறுகள் அல்லது websites உருவாக்கும் பயனருக்கு, ஒரே அதிகாரபூர்வமாகத் தோன்றும் கற்பனை நபர்களின் அதே நடிகர் குழு மீண்டும் மீண்டும் கிடைக்கலாம்.

இந்தப் பிரச்சினையை மேலும் தீவிரமாக்குவது அதன் நிலைத்தன்மை. ஒரு AI output-இல் உருவாக்கப்பட்ட போலி நிபுணர் தனிப்பட்ட முறையில் சிறிய விஷயமாகத் தோன்றலாம். ஆனால் அதே அடையாளம் repositories, websites மற்றும் ஆவணங்களில் மீண்டும் தோன்றினால், அது ஒரு digital footprint-ஐச் சேர்க்கத் தொடங்குகிறது. பின்னர் search engines மற்றும் citation systems அந்த மாயையை பெருக்கி, ஒரு source கற்பனையா அல்லது வெறுமனே அரிதானதா என்பதை வாசகர்கள் தீர்மானிப்பதை கடினமாக்கலாம்.

மாதிரி வித்தியாசத்திலிருந்து வெளியீட்டு பிரச்சினை வரை

இந்தக் கட்டுரை அந்த வடிவத்தை நேரடியாக கல்வி வெளியீட்டு உட்கட்டமைப்புடன் இணைக்கிறது. models அடிக்கடி உருவாக்கும் என்று அறிந்திருந்த பெயர்களை ஆராய்ச்சியாளர்கள் தரவுத்தளங்களில் தேடியதாகவும், அந்தப் பெயர்கள் AI-ஆல் உருவாக்கப்பட்ட பல்வேறு பொருட்களில் புதைந்திருந்ததாகவும் தெரிவிக்கப்படுகிறது. குறிப்பிடப்பட்ட மிகத் திகைப்பூட்டும் உதாரணங்களில் ஒன்று Zenodo. இது CERN இயக்கும் repository, உண்மையான DataCite DOIs-ஐ வழங்குகிறது. குழு ghost authors-க்கு நிகர்வாக்கப்பட்டு, கற்பனையான publication dates கொண்ட nonexistent journals-உடன் இணைக்கப்பட்ட 1,655 records-ஐ கண்டறிந்ததாக கூறுகிறது.

இந்த விவரம் முக்கியமானது, ஏனெனில் DOI என்பது அறிவியல் தொடர்பாடலில் நம்பகத்தன்மையின் மிக வலுவான சைகைகளில் ஒன்று. அது தரத்தை உறுதி செய்யாது, ஆனால் ஒரு record ஒழுங்கமைக்கப்பட்ட வெளியீட்டு மற்றும் index செய்யும் சூழலில் நுழைந்துள்ளது என்பதைக் காட்டுகிறது. கற்பனையான journals, dates மற்றும் authors உண்மையான DOI infrastructure-ன் மேல் சுமக்க முடிந்தால், நம்பிக்கை தோல்விகள் இனி spam blogs அல்லது குறைந்த தர content farms-க்கு மட்டும் கட்டுப்படவில்லை. அவை ஆராய்ச்சியாளர்கள், நூலகர்கள் மற்றும் நிறுவனங்கள் பயன்படுத்தும் அமைப்புகளைத் தொடத் தொடங்குகின்றன.

From The Ghost Couple: Correlated LLM Name Priors and Their Haunting of the Web and Academic Publishing
From The Ghost Couple: Correlated LLM Name Priors and Their Haunting of the Web and Academic Publishing

இந்தக் கட்டுரை AI-ஆல் உருவாக்கப்பட்ட “research” மனிதர்களால் தயாரிக்கப்பட்டது போல விற்கப்பட்டதைப் பற்றிய முந்தைய செய்திகளுடனும் இந்த வடிவத்தை இணைக்கிறது. குறிப்பிடப்பட்ட ஒரு வழக்கில், மருத்துவ ஆராய்ச்சியை வழங்குவதாகக் கூறிய ஒரு நிறுவனம், இல்லை என்ற Elena Vasquez என்ற நிறுவனர் மற்றும் முன்னணி முறையியல் நிபுணரை பட்டியலிட்டிருந்தது. இது குறித்து செய்தியளிக்கப்பட்ட பிறகு, அந்தப் பெயர் நிறுவனத்தின் தளத்திலிருந்து நீக்கப்பட்டதாக கூறப்படுகிறது. மற்றொரு உதாரணத்தில், Facebook-இல் பரவிய ஒரு பொய்யான அறிக்கை, இல்லாத “executive director Dr. Elena Vasquez” என்பவருக்கு சொந்தமானது எனக் கூறப்பட்டது.

இந்த வழக்குகளை ஒன்றாகப் பார்த்தால், பிரச்சினை முழுமையாக கல்வி சார்ந்ததல்ல என்பது தெளிவாகிறது. அதே கற்பனை அடையாளங்கள் சுகாதாரக் கோரிக்கைகள், சமூக வதந்திகள், வணிக சேவைகள் மற்றும் வெளியீட்டு தளங்கள் வழியாக நகர முடியும். இந்தத் துறைகளுக்கு அப்பாற்பட்ட பரவல்தான் இந்த நிகழ்விற்கு விரிவான முக்கியத்துவத்தை அளிக்கிறது.

மாசுபாட்டு ஆபத்து ஏன் அதிகரிக்கிறது

Generative AI, நம்பத்தகுந்த உரையை பெரிய அளவில் உருவாக்கும் செலவைக் குறைக்கிறது. அதில் கட்டுரைகள், reports, web pages மற்றும் நிறுவன வடிவங்களைப் பின்பற்றக்கூடிய புத்தகநிலை ஆவணங்களும் அடங்கும். மாதிரிகளும் சிறிய அளவு மனதைத் தூண்டும் கற்பனைப் பெயர்களை மீண்டும் பயன்படுத்தும் பழக்கத்தைக் கொண்டிருந்தால், தீய நோக்கமுள்ளவர்கள் ஒவ்வொரு முறையும் புதிய persona-வை உருவாக்க வேண்டிய அவசியமே இருக்காது. ஏற்கனவே நம்பத்தகுந்ததாக ஒலிக்கும் மீண்டும் வரும் அடையாளங்களை வழங்கி, மாதிரியே அவர்களுக்காக பணியின் ஒரு பகுதியைச் செய்கிறது.

ஆபத்து திட்டமிட்ட மோசடிக்கு மட்டும் கட்டுப்பட்டது அல்ல. குறிப்பாக விரைவாக வரைவு உள்ளடக்கம் உருவாக்கும்போது, சில பயனர்கள் உருவாக்கப்பட்ட பெயர்களை நெருக்கமாகச் சரிபார்க்காமல் விடலாம். தானியங்கிய அல்லது அரை-தானியங்கிய வெளியீட்டு செயல்முறைகளில், அந்த நபர் உண்மையில் உள்ளாரா என்பதை யாரும் பார்க்காவிட்டால், ஒரு போலி நிபுணர் public records-இல் நழுவிச் செல்ல முடியும். ஒருமுறை வெளியானதும், அந்த அடையாளம் மேற்கோளிடப்பட்டு, scrape செய்யப்பட்டு, index செய்யப்படவும், பிற இடங்களில் மீண்டும் பயன்படுத்தப்படவும் முடியும்.

இது ஒரு feedback loop-ஐ உருவாக்குகிறது. மாதிரிகளின் மீளுருவாக்கம் web-இல் மீளுருவாக்கத்தை ஏற்படுத்துகிறது, மேலும் web-இல் இருக்கும் மீளுருவாக்கம் எதிர்கால மாதிரிகள் சந்திக்கும் உள்ளடக்கத்தை வலுப்படுத்துகிறது. காலப்போக்கில், நேரடி verification-ஐ விட search-ஐ நம்பும் எவருக்கும், model artifact மற்றும் documented person இடையிலான வேறுபாடு மங்கலாகலாம்.

ஆராய்ச்சி அமைப்புகளுக்கான நேர்மைத்தன்மை சவால்

இந்த செய்தி முழுமையான தீர்வை முன்வைப்பதில்லை, ஆனால் integrity பிரச்சினையின் அளவைப் புறக்கணிக்க முடியாததாக மாற்றுகிறது. Academic publishing நீண்ட காலமாக plagiarism, paper mills மற்றும் fake peer review ஆகியவற்றை எதிர்கொண்டுள்ளது. AI ghost authors, மனித atribuition பற்றிய கருதுகோள்களை மையமாகக் கொண்டு கட்டப்பட்ட அமைப்புகளுக்குள் synthetic identity pollution என்ற வேறுபட்ட தோல்வியை அறிமுகப்படுத்துகின்றன.

இந்தச் சவால் repositories, editors, publishers, indexing services மற்றும் search platforms அனைத்தையும் தொடுகிறது. வலுவான author verification, fabricated journals-க்கு மேலான screening மற்றும் சந்தேகத்துக்குரிய அளவுக்கு மீண்டும் தோன்றும் identity patterns-க்கு அதிகமான scrutiny ஆகியவை அனைத்தும் அவசியமாகலாம். பெரிய கருத்து என்னவெனில், AI misuse என்பது உரை machine-ஆல் எழுதப்பட்டதா என்பதிலேயே முடிவடையவில்லை. அந்த உரையுடன் இணைக்கப்பட்ட நபர்கள் உண்மையில் உள்ளனரா என்பதையும் அது பற்றியது.

இந்த preprint-இன் கண்டுபிடிப்புகள் நுட்பமான ஆனால் கட்டமைப்பு ரீதியாக முக்கியமான மாற்றத்தை விவரிப்பதால் எதிரொலிக்கக்கூடும். Language models இப்போது தவறான prose அல்லது fabricated citations மட்டும் உருவாக்கவில்லை. அவை போலி நிபுணர்களை நிலையான வடிவமாக மாற்றி, அமைதியாக knowledge ecosystem-இல் சேர்த்துவிடவும் முடியும். இந்தச் செயல்முறை கட்டுப்பாடின்றி தொடர்ந்தால், தவறுகள் மிகவும் சாதாரணமாகத் தோன்றுவதால், கல்வி பதிவை audit செய்வதே கடினமாகிவிடலாம்.

இந்தக் கட்டுரை 404 Media-வின் செய்தியிடலை அடிப்படையாகக் கொண்டது. மூலக் கட்டுரையைப் படிக்கவும்.

Originally published on 404media.co