AI బెంచ్‌మార్క్ లీకేజీని మూసివేయడానికి Google ముందుకు వస్తోంది

పరీక్ష ప్రశ్నల్నీ, మోడల్‌నీ కూడా బయటపెట్టకుండా ఆధునిక AI వ్యవస్థలను మూల్యాంకనం చేసే కొత్త మార్గాన్ని తాము పరీక్షిస్తున్నామని Google Deepmind చెబుతోంది. స్వంత frontier AI మోడల్‌పై నిర్వహిస్తున్న తొలి డబుల్-బ్లైండ్ మూల్యాంకనంగా వివరించబడిన ఈ పైలట్, రంగంలోని అత్యంత స్థిరమైన కొలమానం సమస్యలలో ఒకటైన benchmark contamination‌ను లక్ష్యంగా పెట్టుకుంది.

సమస్య సులభమే, కానీ దాని ప్రభావం తీవ్రమైనది. ఒక మోడల్ శిక్షణ లేదా ఆప్టిమైజేషన్ సమయంలో ఇప్పటికే బెంచ్‌మార్క్ ప్రశ్నలను గ్రహించి ఉంటే, బలమైన స్కోర్లను అర్థం చేసుకోవడం కష్టమవుతుంది. అటువంటి ఫలితం విస్తృత సామర్థ్యాన్ని కాకుండా జ్ఞాపకశక్తిని, ప్రత్యక్ష పరిచయాన్ని, లేదా పరీక్ష-నిర్దిష్ట ట్యూనింగ్‌ను ప్రతిబింబించవచ్చు. కంపెనీలు, పరిశోధకులు, నియంత్రణ సంస్థలు, మరియు బయటి మూల్యాంకనకర్తల కోసం, మోడళ్లను పోల్చడానికి మరియు ప్రమాదాన్ని అంచనా వేయడానికి ఉపయోగించే ప్రధాన సాధనాల్లో ఒకటైన దీని మీద నమ్మకాన్ని ఇది బలహీనపరుస్తుంది.

ఇచ్చిన నివేదిక ప్రకారం, Google యొక్క విధానం గోప్యమైన పరీక్షా పదార్థాలను cryptographically protected వాతావరణంలో ఉంచుతుంది, తద్వారా మోడల్ ప్రొవైడర్ ముందుగానే ప్రాంప్ట్లను పరిశీలించలేడు. అదే సమయంలో, మూల్యాంకనకర్తకు model weights‌కు ప్రవేశం ఉండదు. ఈ అమరిక, బాహ్య పరీక్షలో దీర్ఘకాలంగా ఉన్న ఒక సమతుల్యతను తొలగించడానికి ఉద్దేశించబడింది; సాధారణంగా ఒక వైపు sensitive benchmark data‌ను వదులుకోవాలి లేదా proprietary model assets‌ను పంచుకోవాలి.

Gemini Flash Lite కేంద్రంగా పైలట్

ఈ పైలట్ ప్రాజెక్ట్ Gemini Flash Lite శ్రేణికి చెందిన ఒక మోడల్‌ను ఉపయోగిస్తుంది, అలాగే Singapore AI Safety Institute సహా భాగస్వాములతో confidential benchmarks‌పై నడుస్తుంది. రెండు పక్షాల గోప్యతను కాపాడుతూ కఠినమైన బయటి మూల్యాంకనాన్ని సాధించడమే నివేదించబడిన లక్ష్యం. ఆచరణలో, బెంచ్‌మార్క్ Google‌కు దాచబడుతుంది, మరియు మోడల్ అంతర్గతాలు మూల్యాంకనకర్తకు దాచబడతాయి.

ఇది ముఖ్యమైనది, ఎందుకంటే ఆధునిక మోడల్ పరీక్ష increasingly sensitive materials‌పై ఆధారపడుతోంది. cybersecurity, misuse potential, లేదా ప్రభుత్వ నిర్వహిత మూల్యాంకనాలు వంటి రంగాల్లో, benchmark prompts స్వయంగా విలువైనవిగా లేదా ప్రమాదకరమైనవిగా ఉండవచ్చు. ఆ ప్రశ్నలు లీక్ అయితే, పరీక్ష తన విలువలో చాలా భాగాన్ని కోల్పోతుంది. model weights‌ను అప్పగించమని మోడల్ ప్రొవైడర్లను కోరితే, వారు తమ intellectual property మరియు security ఆందోళనలను ఎదుర్కోవలసి వస్తుంది.

ఈ కొత్త ప్రక్రియను ఒకేసారి రెండు సమస్యలను పరిష్కరించే ప్రయత్నంగా వ్యాసం చూపిస్తోంది. Google Cloud యొక్క confidential computing portfolioలోని Confidential Space‌ను ఉపయోగించి రక్షిత execution environment‌ను సృష్టిస్తున్నట్లు Google చెబుతోంది. దీని ఉద్దేశ్యం కేవలం విధానపరమైన గోప్యత లేదా ఒప్పందపరమైన పరిమితి మాత్రమే కాదు, cryptographic verification ఆధారంగా ఉన్న సాంకేతిక వేర్పాటు.

Benchmark contamination ఎందుకు పెద్ద సమస్యగా మారింది

Machine learning‌లో benchmark contamination కొత్త ఆందోళన కాదు, కానీ మోడళ్లు పెద్దవిగా మారడం, శిక్షణ డేటా విస్తరించడం, మరియు పోటీ ఒత్తిడి పెరగడం వల్ల ఇది మరింత తీవ్రంగా మారుతుంది. Proprietary frontier systems, internet-scale మరియు curated data యొక్క విస్తారమైన పరిమాణాలపై శిక్షణ పొందుతాయి. దీని వల్ల benchmark-లాంటి పదార్థాలు, లేదా వాటి దగ్గరి రూపాలు, ఇప్పటికే training pipeline‌లోకి ప్రవేశించి ఉండే అవకాశం పెరుగుతుంది.

ఒక benchmark నేరుగా చేర్చబడకపోయినా, fine-tuning, human feedback loops, synthetic training material, లేదా test formats‌పై పునరావృత ప్రజా చర్చ ద్వారా ప్రేరేపితమైన optimization ద్వారా leakage జరగవచ్చు. అలా జరిగితే, ప్రధాన శీర్షికల్లో కనిపించే స్కోర్లు నిజ జీవిత సామర్థ్యాన్ని అధికంగా చూపించవచ్చు. బయటి పరిశీలకుల కోసం, ప్రధాన ప్రశ్న benchmark సాధారణీకరణను కొలుస్తోందా లేక rehearsal‌ను కొలుస్తోందా అన్నదే.

Google ప్రతిపాదించిన సమాధానం ప్రక్రియాపరమైనదీ, సాంకేతికమైనదీ కూడా: పరీక్షను మోడల్ డెవలపర్‌కు బ్లైండ్‌గా ఉంచడం, మరియు మోడల్‌ను పరీక్ష యజమానికి అపారదర్శకంగా ఉంచడం. ఇది ప్రతి మూల్యాంకన సమస్యను తొలగించదు, కానీ అత్యంత హానికరమైన వాటిలో ఒకదాన్ని నేరుగా లక్ష్యంగా చేస్తుంది. మోడల్ ముందుగానే ప్రాంప్ట్లను చూడలేకపోతే, ఆ అంశాల కోసం ప్రత్యేకంగా optimize చేయడానికి ప్రొవైడర్‌కు తక్కువ అవకాశాలు ఉంటాయి.

సున్నితమైన బయటి మూల్యాంకనాలకు ముందు ఒక సర్దుబాటు అవసరమయ్యేదని నివేదిక కూడా పేర్కొంటుంది. మూల్యాంకనకర్తలు ప్రాంప్ట్లను అప్పగించి, ప్రొవైడర్ వాటిని నిల్వ చేయకూడదని లేదా దుర్వినియోగం చేయకూడదని నమ్మాల్సివచ్చేది; లేదా ప్రొవైడర్లు model weights‌ను పంచుకొని, దానికి సంబంధించిన exposure‌ను అంగీకరించాల్సివచ్చేది. డబుల్-బ్లైండ్ అమరిక ఆ ఎంపికను తొలగించడమే లక్ష్యంగా పెట్టుకుంది.

ఇది Google సమస్య మాత్రమే కాదు, పరిశ్రమ నమ్మక సమస్య

దీని విస్తృత ప్రాధాన్యం ఏమిటంటే, AI benchmarking ఇప్పుడు కేవలం leaderboard అంశం కాకుండా, governance అంశంగా మారింది. స్కోర్లను product launches, enterprise procurement, safety debates, మరియు policy discussions‌లో ఎక్కువగా ఉదహరిస్తున్నారు. ఆ దావాల వెనుక ఉన్న పరీక్షలు నమ్మదగినవిగా లేకపోతే, AI పనితీరు చుట్టూ ఉన్న ప్రజా evidence base‌లో పెద్ద భాగం తక్కువ విశ్వసనీయంగా మారుతుంది.

Anthropic యొక్క Fable 5 కోసం ఇటీవల ARC-AGI మూల్యాంకనంలో ఆలస్యం వచ్చిన ఉదాహరణను వ్యాసం సూచిస్తుంది; అక్కడ data-retention పరిమితులు స్వతంత్ర పరీక్షను క్లిష్టం చేశాయి. బలమైన మోడళ్లు మరియు గోప్యమైన బయటి బెంచ్‌మార్క్‌లు ఎదురైనప్పుడు కలిగే కార్యాచరణ సంబంధ friction‌ను ఆ ఉదాహరణ చూపిస్తుంది. ఇచ్చిన నివేదికనుంచి తీసుకునే inference: Google తన పైలట్‌ను ఆ మూల్యాంకనాలను రెండు వైపులా అసౌకర్యకరమైన disclosure‌కు దారితీయకుండా సులభంగా నిర్వహించడానికి మార్గంగా నిలబెడుతోంది.

ఇక్కడ ఒక standard-setting ఆశయం కూడా ఉంది. ఈ ప్రయత్నం పరిశ్రమకు మరింత నమ్మకమైన, విస్తృతంగా విశ్వసించబడిన AI systems‌ను నిర్మించడంలో సహాయపడుతుందని Google చెబుతోంది. ఆ దావాను జాగ్రత్తగా చదవాలి. ఒక pilot అనేది మొత్తం రంగానికి పరిష్కారం కాదు, మరియు benchmark పట్ల నమ్మకం కేవలం ప్రాంప్ట్ గోప్యతపై మాత్రమే ఆధారపడదు. test design నాణ్యత, statistical rigor, reproducibility, benchmark scope, మరియు evaluator independence ఇంకా ముఖ్యమే. కానీ పరీక్ష ప్రక్రియ చుట్టూ ఉండే సాంకేతిక రక్షణ stack‌లో అర్థవంతమైన భాగంగా మారవచ్చు.

తర్వాత ఏమి గమనించాలి

అత్యంత ముఖ్యమైన తదుపరి ప్రశ్న, ఈ విధానం ఒకే పైలట్‌ను దాటి విస్తరిస్తుందా అన్నదే. ఇతర ప్రధాన మోడల్ డెవలపర్లు, స్వతంత్ర సంస్థలు, మరియు ప్రభుత్వ మూల్యాంకనకర్తలు ఇలాంటి mechanism‌లను స్వీకరిస్తే, ఈ approach frontier-model oversight‌లో సాధారణ భాగంగా మారవచ్చు. అది ఒక్కసారిగా చేసిన ప్రదర్శనలకే పరిమితమైతే, దాని ప్రభావం తక్కువగానే ఉంటుంది.

మరొక తెరిచి ఉన్న ప్రశ్న, ఏ రకాల మూల్యాంకనాలు ఎక్కువ ప్రయోజనం పొందుతాయన్నదే. ప్రాంప్ట్లు స్వయంగా sensitive కావచ్చునని కారణంగా cybersecurity మరియు government testing ప్రత్యేకంగా బలమైన candidates అని వ్యాసం సూచిస్తోంది. అదే తర్కం కొన్ని biosecurity, national security, లేదా commercial red-team పరిస్థితులకు కూడా విస్తరించవచ్చు, అయితే ఇచ్చిన పాఠ్యం ఆ రంగాలను నేరుగా పేర్కొనలేదు.

ఇప్పటికి ప్రధాన అభివృద్ధి స్పష్టంగా ఉంది: Google Deepmind, AI benchmarking‌ను trust-me ఏర్పాట్ల నుండి దూరం చేసి, సాంకేతికంగా అమలు చేసిన గోప్యత వైపు మార్చడానికి ప్రయత్నిస్తోంది. పనితీరు గురించి చేసే దావాలు తాము కూడా వ్యవస్థలంతే తీవ్రంగా చర్చించబడే రంగంలో, ఇది గణనీయమైన మార్పు. ఈ పైలట్ AI సామర్థ్యాన్ని ఎలా కొలవాలన్న పెద్ద వాదనను పరిష్కరించదు, కానీ అది ఒక ప్రాథమిక విశ్వసనీయత లోపాన్ని పరిష్కరిస్తుంది. ఒక benchmark, మోడల్ ఏమి చేయగలదో పరీక్షించడానికి ఉద్దేశించబడితే, మోడల్ ముందుగానే ఆ పరీక్షను తెలుసుకుని ఉండకూడదు.

ఈ వ్యాసం The Decoder నివేదిక ఆధారంగా ఉంది. మూల వ్యాసాన్ని చదవండి.

Originally published on the-decoder.com