AI ஏஜெண்ட்கள் ஆராய்ச்சி மென்பொருள் பராமரிப்பில் பயனுள்ளதாகி வருகின்றன

OpenAI மற்றும் கல்வி கூட்டாளர்களின் ஒரு புதிய புல அறிக்கை, AI கோடிங் அமைப்புகளுக்கு ஒரு நடைமுறையான, கண்ணைக் கவராத பயன்பாட்டைச் சுட்டிக்காட்டுகிறது: அறிவியல் ஆராய்ச்சியின் பெரும்பகுதியைத் தாங்கி நிற்கும் புறக்கணிக்கப்பட்ட மென்பொருளை சரிசெய்து நவீனப்படுத்துவது. இந்த அறிக்கை, இந்த அமைப்புகளை தன்னாட்சி அறிவியல் சிந்தனையாளர்களாகக் காட்டவில்லை. அதற்கு பதிலாக, அவை குறியீட்டை மறுசீரமைக்க, பழைய கருவிகளை மாற்ற, கட்டமைப்புகளை மாற்றி அமைக்க, சில சந்தர்ப்பங்களில் கணிசமான செயல்திறன் உயர்வை வழங்கக் கூடிய வேகமான மென்பொருள் பணியாளர்களாக செயல்படுகின்றன என்பதை காட்டுகிறது.

அந்த வேறுபாடு முக்கியமானது. பல ஆராய்ச்சி கருவிகள் முதலில் ஒரு கட்டுரையையோ அல்லது குறுகிய ஆய்வக பணிப்பாய்வையோ ஆதரிக்க எழுதப்பட்ட குறியீடாகத் தொடங்கின. காலப்போக்கில், அந்த கருவிகள் நீண்டகால பராமரிப்பு, சோதனை அல்லது எடுத்துச் செல்லும் வசதி ஆகியவற்றை மனதில் வைத்து உருவாக்கப்படாதபோதும், பரந்த அறிவியல் குழாய்களில் உட்பொதிந்தன. அசல் ஆசிரியர்கள் நகர்ந்து செல்லும் போது, நிதி குறைவாக இருக்கும் போது, ஆய்வகங்கள் இன்னும் முக்கியத்துவம் வாய்ந்த, ஆனால் மிகவும் நெகிழ்வான codebases-ஐ நம்பி இருக்க வேண்டிய நிலை ஏற்படுகிறது.

அறிக்கையில் விவரிக்கப்பட்டுள்ள நிகழ்வுகள், இந்த வகையான நிலுவைப் பணிகளுக்கு கோடிங் ஏஜெண்ட்கள் மிகச் சரியாகப் பொருந்தக்கூடும் என்பதைச் சுட்டிக்காட்டுகின்றன. அவை பெரிய codebases-ஐப் படிக்க முடியும், மேம்படுத்தல்களை முன்மொழிய முடியும், ஒரு framework அல்லது மொழியிலிருந்து மற்றொன்றுக்கு மொழிபெயர்க்க முடியும், மேலும் build systems, installation steps, tests போன்ற சுற்றியுள்ள உட்கட்டமைப்புகளையும் உருவாக்க முடியும். ஆனால் இவ்வமைப்புகள் என்ன செய்ய முடியும், என்ன செய்ய முடியாது என்பதற்கும் அறிக்கை ஒரு தெளிவான எல்லையை வரைகிறது. அவை மென்பொருளை விரைவாக மறுபடியும் எழுத முடியும்; ஆனால் மறுபடியும் எழுதப்பட்ட அமைப்பின் அறிவியல் நடத்தை உண்மையில் சரியா என்பதை நம்பத்தகுந்த வகையில் தீர்மானிக்க முடியாது.

Build cleanup-இலிருந்து முழுமையான மறுஎழுத்து வரை

இந்த அறிக்கை எட்டு case studies-ஐ உள்ளடக்கியது; அவற்றில் பெரும்பாலானவை உயிரியல் துறையில் உள்ளன. இந்த வேலை, ஒப்பீட்டளவில் குறுகிய பராமரிப்பு பணிகளிலிருந்து, பழைய அறிவியல் மென்பொருளின் பெரிய மறுஎழுத்துகள் வரை பரவியுள்ளது.

ஒரு எளிய எடுத்துக்காட்டில் cyvcf2 இடம்பெற்றது, இது மரபணுத் தரவுகளைப் படிக்க பயன்படும் ஒரு Python library. அந்தச் சூழலில் GPT-5.5, பழைய build மற்றும் installation அமைப்பை மேலும் நவீனமான ஒன்றாக மாற்றியது. இப்படியான வேலை பெரும்பாலும் சலிப்பூட்டுவதாக இருந்தாலும் முக்கியமானது: மென்பொருளை நிறுவவும் compile செய்யவும் கடினமாகிவிட்டால், அது அறிவியல் ரீதியாகப் பொருத்தமானதாக இருந்தாலும் செயல்பாட்டு ரீதியாக நெகிழ்வாகி விடலாம்.

மேலும் சிக்கலான ஒரு திட்டம் MHCflurry மையமாக இருந்தது; இது நோயெதிர்ப்பு செல்கள் எந்த இலக்குகளை அடையாளம் காணும் என்பதை கணிக்கப் பயன்படும் ஒரு immunology model. அறிக்கையின் படி, Claude Code மற்றும் Codex, developer மற்றும் reviewer வேடங்களில் மாறிமாறி செயல்பட்டு, TensorFlow-இலிருந்து PyTorch-க்கு சுமார் 10,000 code வரிகளை port செய்தன. இது பல அணிகள் பல ஆண்டுகள் தள்ளிப் போடும் வகையான migration; ஏனெனில் அது செலவானது, ஆபத்தானது, மற்றும் உடைக்க எளிதானது.

ஒரு காலவரிசை எட்டு case study-களை, பராமரிப்பு மற்றும் உள்ளூர் மேம்பாட்டிலிருந்து, compatibility migration, reimplementation, workflow redesign, மற்றும் புதிய system development வரை துறையின் அடிப்படையில் வகைப்படுத்துகிறது. திட்டங்கள் cyvcf2, hifiasm, HI.SIM, MHCflurry, bayesm, rustar-aligner, RustQC, மற்றும் HelixForge ஆகும்.
எட்டு திட்டங்களும் எளிய build modernization-இலிருந்து முழுமையான GPU-native மறுஎழுத்து வரை பரவுகின்றன. | Image: OpenAI

மூல உரையில் குறிப்பிடப்பட்ட மிக லட்சியமான எடுத்துக்காட்டு rustar-aligner ஆகும்; இது STAR-இன் Rust மறுஎழுத்து. STAR என்பது genome locations-க்கு sequencing reads-ஐ map செய்யப் பெரிதும் பயன்படுத்தப்படும் ஒரு கருவி. STAR-இல் 20,000-க்கும் அதிகமான C மற்றும் C++ வரிகள் உள்ளன, மேலும் பல ஆராய்ச்சி pipelines-இன் ஒரு பகுதியாகத் தொடர்ந்தாலும், அது இனி செயல்பாட்டிலான பராமரிப்பில் இல்லை. இப்படியான ஒரு கருவியை மீண்டும் உருவாக்குவது வெறும் மென்பொருள் பயிற்சி அல்ல. முடிவுகள் வேறுபட்டால் downstream analyses-ஐ மாற்றக்கூடிய நுண்ணிய மாற்றங்களை அது அறிமுகப்படுத்தும் அபாயம் உள்ளது.

செயல்திறன் உயர்வுகள் உண்மையானவை, ஆனால் நம்பிக்கை சம்பாதிக்கப்பட வேண்டும்

அறிக்கையிடப்பட்ட முன்னேற்றங்கள், ஆய்வகங்கள் ஏன் இதில் ஆர்வம் காட்டுகின்றன என்பதை விளக்க போதுமான அளவு கணிசமானவை. மூல உரையில், கோடிங்-ஏஜெண்ட் தலைமையிலான முயற்சிகள் சில நிகழ்வுகளில் 60 மடங்கு அதிக வேக உயர்வை ஏற்படுத்தின என்று கூறப்படுகிறது. மிகவும் தெளிவான எடுத்துக்காட்டு RustQC; இது 15 தனித்த தரக் கட்டுப்பாட்டு கருவிகளை ஒரே program-ஆக ஒருங்கிணைத்தது. ஒரு பெரிய dataset-இல், runtime 15 மணி 34 நிமிடங்களிலிருந்து 14 நிமிடம் 54 விநாடிகளாக குறைந்தது. பெரிய உயிரியல் dataset-களுடன் பணிபுரியும் ஆராய்ச்சியாளர்களுக்கு, இப்படியான குறைப்பு பகுப்பாய்வுகள் எத்தனை முறை இயக்கப்படுகின்றன மற்றும் பரிசோதனைகள் எவ்வளவு விரைவாகச் சுழல்கின்றன என்பதில் கணிசமான மாற்றத்தை ஏற்படுத்த முடியும்.

ஆனால் வேகமே முக்கியமான கதை அல்ல. மறுஎழுதப்பட்ட கருவிகள் அசல் கருவிகளை அறிவியல் ரீதியாகப் பொருத்தமான வழிகளில் போலவே நடக்கிறதா என்பதே இன்னும் முக்கியமான கேள்வி. அந்தச் சரிபார்ப்பு பணியை அறிக்கை விருப்பத்திற்கானதாக அல்ல, மையமானதாகக் கருதுகிறது.

rustar-alignerக்காக, yeast cells-இலிருந்து பெறப்பட்ட 10,000 short sequencing reads-ஐப் பயன்படுத்தி குழு அந்த மறுஎழுத்தை STAR-உடன் ஒப்பிட்டது. single-end reads-க்கு, புதிய கருவி 99.815 சதவீத நிகழ்வுகளில் STAR-ஐ ஒத்திருந்தது. paired-end reads-க்கு, ஒப்புமை 99.883 சதவீதத்தை எட்டியது. இந்த ஒப்பீடு genome-இல் map செய்யப்பட்ட இடங்களுக்கே மட்டுப்படுத்தப்படவில்லை. ஒவ்வொரு read-க்கும் உருவாக்கப்பட்ட பல முக்கிய output fields-களும் இதில் சேர்க்கப்பட்டன. மேலும், ஒரு கருவி map செய்யாத reads-ஐ மற்றொன்று map செய்யவில்லை என்பதையும் மூல உரை குறிப்பிடுகிறது.

இவை வலுவான இணக்கத் தரவுகள், ஆனால் AI உருவாக்கிய அறிவியல் மென்பொருளின் அடிப்படை வரம்பையும் அவை காட்டுகின்றன. ஒரு model வலுவான code-ஐ, hatta நம்பத்தகுந்த சோதனைகளைக் கூட உருவாக்கலாம்; ஆனாலும் equivalence என்றால் என்ன என்பதை வரையறுப்பது, சரியான benchmarks-ஐத் தேர்ந்தெடுப்பது, edge cases-ஐ ஆய்வு செய்வது, மற்றும் விலகல்கள் அறிவியல் ரீதியாக முக்கியமா என்பதை முடிவு செய்வது மனிதர்களின் பொறுப்பாகவே இருக்கும்.

ஐந்து bar charts BamSurgeon மற்றும் HelixForge-ஐ ஒப்பிடுகின்றன. 10 Mb window-க்கு runtime 1,610 விநாடிகளிலிருந்து 27 விநாடிகளாக குறைகிறது, mean VAF error 0.076-இலிருந்து 0.034 ஆகக் குறைகிறது, மற்றும் INDEL correlation 0.80-இலிருந்து 0.99 ஆக உயர்கிறது. realignment fingerprint 100 சதவீதத்திலிருந்து சுமார் 0 சதவீதமாக விழுகிறது, confirmed mutations 99.7 சதவீதத்திலிருந்து 100 சதவீதமாக உயர்கின்றன.
GPU-native மறுஎழுத்து, வேகத்தை மட்டுமல்லாமல், அளவிடப்பட்ட ஒவ்வொரு பரிமாணத்திலும் நிலைபெற்ற CPU கருவியை மிஞ்சுகிறது. | Image: OpenAI

தடை coding-இலிருந்து review-க்கு நகர்கிறது

அதுவே அறிக்கையின் மிக முக்கியமான விளைவாக இருக்கலாம். கோடிங் ஏஜெண்ட்கள் தொடர்ந்து மேம்பட்டால், ஆராய்ச்சி மென்பொருளில் மிக அரிதான வளம் raw implementation time ஆக இனி இல்லாமல் போகலாம். உண்மையான bottleneck expert verification ஆக மாறலாம்.

அந்த உலகில், ஆய்வகங்கள் மென்பொருளை ஒரு ஏஜெண்டிடம் ஒப்படைத்து முடிவை ஏற்றுக்கொள்வதில்லை. அதற்கு பதிலாக, model candidate implementations-ஐ மிக வேகமாக உருவாக்கும் ஒரு workflow-ஐ அவர்கள் கண்காணிக்கிறார்கள்; domain experts outputs-ஐச் சரிபார்க்கவும், முந்தைய நடத்தை மீண்டும் உருவாக்கவும், மறுஎழுத்தில் எந்த அறிவியல் கருதுகோள்களும் மறைந்து சேர்க்கப்படவில்லை என்பதை உறுதிப்படுத்தவும் தங்கள் முயற்சியைச் செலுத்துகிறார்கள். Workflow மாறுகிறது, ஆனால் expert oversight தேவையில்லை என்று ஆகிவிடுவதில்லை.

இது குறிப்பாக ஆராய்ச்சி சூழல்களில் பொருத்தமானது, ஏனெனில் code correctness என்பது பிரச்சினையின் ஒரு அடுக்கு மட்டுமே. ஒரு refactor syntax ரீதியாக சுத்தமாகவும், computationally வேகமாகவும், இருந்தும் numerical behavior, default parameters, அல்லது மறைந்த கருதுகோள்களை மாற்றினால் அறிவியல் ரீதியாக தவறாக இருக்க முடியும். ஆகவே இந்த அமைப்புகள் அறிவியல் சரியா என்பதைத் தீர்மானிக்க முடியாது என்ற அறிக்கையின் எச்சரிக்கை வெறும் caveat அல்ல. அவற்றை பொறுப்புடன் பயன்படுத்த வேண்டிய நிபந்தனையே அது.

இது அறிவியல் உட்கட்டமைப்புக்கு என்ன அர்த்தம் கொண்டிருக்கலாம்

இந்த கண்டுபிடிப்புகள் பொதுவாக பொருந்தினால், கோடிங் ஏஜெண்ட்கள் கல்வி உலகிற்கு மதிப்புமிக்க உட்கட்டமைப்பு கருவிகளாக மாறக்கூடும். அறிவியல் துறைகள் பெரும்பாலும் புறக்கணிக்க முடியாத அளவுக்கு முக்கியமான, ஆனால் கைமுறையாக நவீனப்படுத்த போதுமான அளவு நிதியளிக்கப்படாத மென்பொருள்களைச் சார்ந்திருக்கின்றன. புதிய அறிவியலைக் கண்டுபிடிப்பதல்ல, பழைய, நெகிழ்வான code-ஐ இயக்க, மதிப்பாய்வு செய்ய, விரிவாக்க எளிதான வடிவங்களுக்கு மொழிபெயர்ப்பதே பிரச்சினையாக இருக்கும் அந்த பராமரிப்பு இடைவெளியில் AI அமைப்புகள் குறிப்பாக பயனுள்ளதாக இருக்கலாம்.

வாக்குறுதி பெரிதானது: வேகமான migrations, மேம்பட்ட performance, மீண்டும் உயிர் பெற்ற toolchains, மற்றும் குறைவான abandoned codebases. ஆனால் அதற்குப் பதிலாக நம்பிக்கை இன்னும் மெதுவான முறையிலேயே உருவாக்கப்பட வேண்டும். அறிவியல் மென்பொருளை அது நன்றாக படிக்கிறது அல்லது சுத்தமாக compile ஆகிறது என்பதால் மட்டும் ஏற்றுக்கொள்ள முடியாது. அது உண்மையான workloads-க்கு எதிராக சோதிக்கப்பட வேண்டும்; அறிவியலையும் code-ஐயும் நன்கு புரிந்தவர்களால் மதிப்பிடப்பட வேண்டும்.

அதனால் இந்த புல அறிக்கை தானியங்கி கண்டுபிடிப்பு பற்றிய கதையாக அல்ல, பணிப்பிரிவின் கதையாக மாறுகிறது. AI மென்பொருள் நவீனப்படுத்தல் பணியின் அதிக பகுதியை கையாளலாம். விளைவாக உருவாகும் அமைப்புகள் அறிவியல் பதிவின் ஒரு பகுதியாக இருக்கத் தகுதியானவையா என்பதை நிறுவுவது ஆராய்ச்சியாளர்களின் பொறுப்பாகவே இருக்கும்.

இந்தக் கட்டுரை The Decoder வழங்கிய செய்திக்குறிப்பை அடிப்படையாகக் கொண்டது. மூலக் கட்டுரையைப் படிக்கவும்.

Originally published on the-decoder.com