క్యాటలిస్ట్ కనుగొనడానికైన AIకి డేటా నాణ్యత సమస్య ఉంది

ఉత్తమ క్యాటలిస్ట్‌ల కోసం అన్వేషణను, ముఖ్యంగా వాతావరణం మరియు పరిశ్రమల కార్బన్ తగ్గింపుతో సంబంధం ఉన్న ప్రతిక్రియల కోసం, వేగవంతం చేసే మార్గంగా కృత్రిమ మేధస్సును తరచుగా చూపిస్తారు. కానీ కొత్త బహుళ-ప్రయోగశాల అధ్యయనం, ఆ మోడళ్లకు ఇన్పుట్‌గా వచ్చే ప్రయోగాల స్థిరత్వమే మోడల్ రూపకల్పనకన్నా పెద్ద bottleneck కావచ్చని సూచిస్తోంది.

Nature Catalysisలో ప్రచురితమైన పనిపై నివేదిస్తూ, Phys.org యునైటెడ్ స్టేట్స్‌లోని నాలుగు ప్రయోగశాలల సహకారాన్ని వివరించింది. వారు కార్బన్ డయాక్సైడ్‌ను ఇంధనాల వైపు మార్పిడిలో ఉపయోగించే కార్బన్ మోనాక్సైడ్ ఉత్పత్తి చేసే ఒక క్యాటలిస్ట్‌ను పరీక్షించారు. ప్రధాన కనుగొనం స్పష్టంగా ఉంది: ప్రోటోకాల్ మరియు పరికరాలలోని తేడాలు, వచ్చిన డేటా ఆధారంగా నిర్మించే AI మరియు మెషిన్-లెర్నింగ్ అంచనాల విశ్వసనీయతను దెబ్బతీయగలంత మార్పును సృష్టించవచ్చు.

క్యాటలిస్ట్ పరిశోధన AIకి ఆదర్శ వినియోగ సందర్భంగా ఎక్కువగా భావించబడుతున్నందున ఆ నిర్ణయం ముఖ్యమైనది. సిద్ధాంతపరంగా, ఒక మోడల్ ఉష్ణోగ్రత, ప్రతిక్రియా సమయం, మరియు క్యాటలిస్ట్ ఫార్ములేషన్ వంటి చరరాశులను స్వీకరించి, ఏ కలయికలు అత్యంత ఆశాజనకమో అంచనా వేయగలదు. ఆ అంచనాలను ఉపయోగించి పరిశోధకులు ప్రయోగాలను కేంద్రీకరించవచ్చు, ఖర్చులను తగ్గించవచ్చు, మరియు సాధ్యమైన రసాయనాలను వేగంగా చేరవచ్చు. కానీ ఈ వాగ్దానం, మూల డేటా అనుకూలంకాని కొలమాన పరిస్థితుల మిశ్రమం కాకుండా స్థిరమైన వాస్తవాన్ని ప్రతిబింబిస్తుందనే ఆలోచనపై ఆధారపడి ఉంటుంది.

నాలుగు-ల్యాబ్ అధ్యయనం ఆ అనుమానం బలహీనమని సూచిస్తోంది. ప్రయోగ అసంగతత కేవలం పట్టించుకోనవసరం లేని చిన్న సమస్య కాదు. అది AI వ్యవస్థ “నేర్చుకునేది” ఏమిటో నేరుగా ఆకారమివ్వగలదు; ఫలితంగా, రసాయన శాస్త్రానికి బదులుగా పరికరాల లేదా స్థానిక విధానాల ప్రత్యేకతల నుండి వచ్చిన నమూనాలపై నమ్మకం ఏర్పడే ప్రమాదం ఉంది.

AI వర్క్‌ఫ్లోలోకి వచ్చినప్పుడు పునరుత్పాదకత ఎందుకు మరింత ముఖ్యం అవుతుంది

సాంప్రదాయ ప్రయోగశాస్త్రం ఎప్పటినుంచో పునరుత్పాదకతను ప్రాధాన్యంగా చూసింది, కానీ AI సమస్య పరిమాణాన్ని మారుస్తుంది. ఒక్క తప్పుదారి పట్టించే డేటాసెట్ ఒక మోడల్‌ను పక్షపాతంతో నింపగలదు. పెద్ద మొత్తంలో అసమానమైన డేటాసెట్ల సేకరణ ఆ అసంగతతలను భారీ స్థాయిలో సంకేతీకరించి, అంచనాలను కఠినమైనవిగా కనిపింపజేస్తూ, పరిశోధకులు నిజంగా అర్థం చేసుకోవాలనుకునే భౌతిక ప్రవర్తన నుండి దూరం చేయగలదు.

ఈ అధ్యయం కార్బన్ డయాక్సైడ్ నుండి కార్బన్ మోనాక్సైడ్ ఉత్పత్తి చేసే ఒక క్యాటలిస్ట్‌పై దృష్టి పెట్టింది, ఇది CO2ను ఉపయోగకరమైన ఇంధనాలుగా మార్చడంలో కీలకమైన తొలి అడుగుగా వివరించబడింది. ఈ రకమైన రసాయనం తక్కువ-కార్బన్ పారిశ్రామిక ప్రక్రియలు మరియు శక్తి మార్గాలను సృష్టించే విస్తృత ప్రయత్నాలలో వ్యూహాత్మకంగా ముఖ్యమైనది. AI సాధనాలు క్యాటలిస్ట్‌ల దీర్ఘకాలిక స్థిరత్వం మరియు పనితీరును ర్యాంక్ చేయడంలో సహాయపడాలంటే, అవి ప్రయోగశాలలు, కాలపరిమాణాలు, మరియు ఆపరేటింగ్ సెటప్‌ల across సరిపోలే శిక్షణ డేటాను అవసరం చేస్తాయి.

అది వినిపించినంత సులభం కాదు. Phys.org నివేదిక ప్రకారం, ఎక్కువ ప్రయోగశాల క్యాటలిసిస్ అధ్యయనాలు రోజుల్లో కొలిచే తక్కువ కాలాలను పరిశీలిస్తాయి; అదే సమయంలో, మలినాలు పేరుకుపోవడం మరియు పదార్థాలు పదేపదే అధిక ఉష్ణోగ్రతలకు గురవడం వల్ల క్యాటలిస్ట్ నిష్క్రియత నెలలు లేదా సంవత్సరాల పాటు కొనసాగవచ్చు. AI మోడళ్లు ఆకర్షణీయంగా ఉండే కారణాల్లో ఒకటి, అవి చేతితో పునరుత్పత్తి చేయడం కష్టమైన పరిస్థితులను అన్వేషించగలగడం. కానీ శిక్షణకు ఉపయోగించే తక్కువకాల డేటా ల్యాబ్ నుండి ల్యాబ్‌కు అసంగతంగా ఉంటే, దీర్ఘకాల ప్రవర్తనకు extrapolate చేయడం మరింత ప్రమాదకరం అవుతుంది.

మిషిన్-లెర్నింగ్ వ్యవస్థలకు శాస్త్రవేత్తలు ఏ సమాచారాన్ని అందిస్తున్నారో దానిపై జాగ్రత్తగా ఉండాలని ఈ పత్రం రచయితలు హెచ్చరిస్తున్నారు. పరిశోధనలో AI పట్ల ఉత్సాహం కొన్నిసార్లు డేటా ఉత్పత్తి క్రమశిక్షణను మించిపోతున్న సమయంలో ఈ హెచ్చరిక వచ్చింది. అనేక రంగాల్లో, ప్రయోగశాలలకు దశాబ్దాల వారసత్వ పద్ధతులు, అనుకూల పరికరాలు, మరియు స్థానిక ఆపరేటింగ్ అలవాట్లు ఉన్నాయి. ఇవి వ్యక్తిగత పత్రాల పరంగా నిర్వహించదగినవే అయినా, డేటాను ఒక ఊహాజనిత ఇంజిన్‌లో కలిపినప్పుడు తీవ్రమైన అడ్డంకులుగా మారవచ్చు.

సంభావ్య సాంకేతికతగా ప్రామాణీకరణ

ఈ అధ్యయనంలోని అత్యంత ముఖ్యమైన సూచనల్లో ఒకటి, ప్రామాణీకరణను బ్యూరోక్రాటిక్ ఓవర్‌హెడ్‌గా చూడకూడదని. ఇది శాస్త్రీయ AIకి సహాయక సాంకేతికత.

For AI to drive science discoveries, highly reproducible data is key
దేశవ్యాప్తంగా నాలుగు ప్రయోగశాలల్లో నిర్వహించిన అధ్యయం, ప్రయోగ ప్రోటోకాల్ మరియు పరికరాల ప్రామాణీకరణ ఫలితాల వ్యత్యాసాన్ని ఎలా నియంత్రిస్తుందో చూపించింది. వాస్తవ ప్రపంచ డేటాను AI/మెషిన్ లెర్నింగ్ మోడళ్లలో చేర్చేటప్పుడు ఈ వ్యత్యాసాన్ని గుర్తించడం అత్యంత అవసరం. Credit: Adam Hoffman and Greg Stewart/SLAC National Accelerator Laboratory

నివేదిక ప్రకారం, నాలుగు-ల్యాబ్ ప్రయత్నం, ప్రోటోకాల్ మరియు పరికరాల ప్రామాణీకరణ ద్వారా ఫలితాల వ్యత్యాసం ఎలా నియంత్రించబడుతుందో ప్రదర్శించింది. ఇది సమస్యను పునర్నిర్వచిస్తుంది. కొన్ని డేటాసెట్లు మరికొన్నిటికంటే శబ్దంతో ఉన్నాయనే విషయం మాత్రమే కాదు. డేటాను ఉత్పత్తి చేయడానికి ఉపయోగించే విధానాలే AI మోడల్ రసాయన శాస్త్రాన్ని నేర్చుకుంటుందా లేదా ల్యాబ్-స్పెసిఫిక్ ప్రత్యేకతలను నేర్చుకుంటుందా అన్నదాన్ని నిర్ణయించగలవు.

పరిశోధనా సంస్థల కోసం దీనికి కార్యకలాప సంబంధిత ప్రభావాలు ఉన్నాయి. పదార్థాల శాస్త్రానికి ఉపయోగకరమైన AIని నిర్మించాలంటే, పెద్ద మోడలింగ్ ప్రయత్నాలు ప్రారంభమయ్యే ముందు సమన్వయపరచిన ప్రయోగ రూపకల్పన, భాగస్వామ్య బెంచ్‌మార్క్‌లు, మెటాడేటా క్రమశిక్షణ, మరియు స్థలాల మధ్య ధృవీకరణలో పెట్టుబడి అవసరం కావచ్చు. మరొక మాటలో చెప్పాలంటే, మెరుగైన AIకి వెళ్లే దారి పెద్ద కంప్యూట్ క్లస్టర్లకన్నా మంచి ల్యాబ్ ప్రాసెస్ కంట్రోల్‌తో ప్రారంభమవచ్చు.

ఇది బహుళ సంస్థల నుండి డేటాను సమీకరించాలని ఆశించే పబ్లిక్-ప్రైవేట్ పరిశోధన కార్యక్రమాలకు మరింత వర్తిస్తుంది. సమాచారాన్ని కలపడం నమూనా పరిమాణాన్ని పెంచుతుంది, కానీ కలిపిన రికార్డులు నిజంగా సరిపోలగలవైతే మాత్రమే. అది లేకపోతే, ఎక్కువ డేటా ఒక బాధ్యతగా మారి, మోడళ్లకు విస్తృత పరిధి ఉన్నట్లు కనిపింపజేస్తూ, భాగస్వామ్యుల మధ్య ఉన్న వ్యవస్థాగత భేదాభిప్రాయాన్ని దాచివేయగలదు.

శాస్త్రీయ AIకి మరింత వాస్తవిక చిత్రం

ఈ అధ్యయం క్యాటలిస్ట్ కనుగొనడంలో AIకి వ్యతిరేకంగా వాదించదు. వాస్తవానికి, AI నిజంగా ఉపయోగకరంగా మారే పరిస్థితులను ఇది స్పష్టంచేస్తుంది. మంచి డేటాతో, మోడళ్లు ప్రయోగ అన్వేషణను సన్నిహితం చేయగలవు, సమయాన్ని మరియు ఖర్చును తగ్గించగలవు, మరియు ల్యాబ్‌లో చేరడం కష్టమైన పరిధులను అన్వేషించగలవు. ఆ ప్రయోజనాలు ఇంకా బలంగానే ఉన్నాయి. నాలుగు-ల్యాబ్ పోలిక మోడల్ నాణ్యత అనేది డేటా మూలం మరియు కొలమాన ఆచరణ నుండి విడదీయరాని అంశమని గుర్తుచేస్తుంది.

ఆ సందేశం క్యాటలిసిస్‌ను దాటి మరింత విస్తరిస్తుంది. అనేక శాస్త్రీయ రంగాలు ఇప్పుడు ఆటోమేటెడ్ ప్రయోగాలు, మెషిన్ లెర్నింగ్, మరియు భాగస్వామ్య డేటాసెట్లను కలపాలని కోరుకుంటున్నాయి. కొలతలు స్థానిక పరికరాలు, కాలిబ్రేషన్ విధానాలు, లేదా అంతర్గత ప్రాసీజురల్ ఎంపికలపై ఆధారపడిన ప్రతిచోటా అదే ప్రమాదం వర్తిస్తుంది. ఆ తేడాలు బయటపడకపోతే మరియు నియంత్రించబడకపోతే, AI వ్యవస్థలు దాగి ఉన్న అసంగతతలను పరిష్కరించకుండా మరింత పెంచవచ్చు.

ప్రయోగాత్మకంగా చూస్తే, ఈ కొత్త పని నిధి సంస్థలు, జాతీయ ప్రయోగశాలలు, మరియు విశ్వవిద్యాలయ సమాఖ్యలను పునరుత్పాదకత మౌలిక సదుపాయాలపై ఎక్కువ దృష్టి పెట్టేలా చేయవచ్చు. శాస్త్రీయ AIలో ఆకర్షణీయమైన పొర ఎక్కువగా మోడల్. స్థిరమైన పొర మాత్రం నమ్మదగిన మోడలింగ్‌ను సాధ్యం చేసే కొలమాన వ్యవస్థ.

తరువాత ఏముంది

ఈ అధ్యయనం నుండి తక్షణ పాఠం AI నుండి వెనక్కి తగ్గడం కాదు, కానీ ప్రయోగం మరియు మోడలింగ్ మధ్య లూప్‌ను మరింత బిగించడమే. ప్రయోగశాలల మధ్య బెంచ్‌మార్క్‌లు, అంగీకరించిన పరీక్ష పరిస్థితులు, మరియు పరికరాలు, విధానం గురించి స్పష్టమైన మెటాడేటా క్యాటలిస్ట్ డేటాసెట్లను మరింత నమ్మదగినవిగా చేయగలవు. ఒక వాతావరణంలో శిక్షణ పొందిన మోడల్, వేరే చోట సృష్టించిన డేటాను ఎదుర్కొన్నప్పుడు కూడా పనిచేస్తుందో లేదో ప్రత్యేకంగా పరీక్షించే ధృవీకరణ పద్ధతులు కూడా సహాయపడతాయి.

కార్బన్ డయాక్సైడ్ మార్పిడి పరిశోధన కోసం, ఆ మెరుగుదలలు అపార విలువ కలిగివుండవచ్చు. ఈ రంగం తక్కువకాల ప్రయోగంలో మాత్రమే క్రియాశీలంగా ఉండే క్యాటలిస్ట్‌లను కాకుండా, స్థిరమైన, స్కేల్ చేయగలిగిన, మరియు దీర్ఘకాల ఆపరేషన్ విండోల్లో ప్రాక్టికల్‌గా ఉండే వాటిని వెతుకుతోంది. AI ఇంకా అలాంటి అభ్యర్థులను వేగంగా గుర్తించడంలో సహాయపడవచ్చు. కానీ శాస్త్రవేత్తలు పునరుత్పాదకతను మోడల్‌లో భాగంగా పరిగణించినప్పుడు మాత్రమే అది జరుగుతుందని ఈ కొత్త అధ్యయం సూచిస్తోంది.

ఇదే ఇక్కడి లోతైన పరిశ్రమ సంకేతం. పరిశోధన AIలో, మెరుగైన అంచనాలు ఆల్గోరిథం నడిచినప్పుడు ప్రారంభం కావు. ఫలితం ఏమి అర్థం చేసుకోవాలో మరో ల్యాబ్, మరో పరికరం, మరియు చివరికి మరో మోడల్ నమ్మగలిగేలా మొదటి ప్రయోగం రూపకల్పన చేసినప్పుడు అవి ప్రారంభమవుతాయి.

ఈ వ్యాసం Phys.org నివేదికపై ఆధారపడింది. మూల వ్యాసాన్ని చదవండి.

Originally published on phys.org