AI బెంచ్మార్క్ లీకేజీని మూసివేయడానికి Google ముందుకు వస్తోంది
పరీక్ష ప్రశ్నల్నీ, మోడల్నీ కూడా బయటపెట్టకుండా ఆధునిక AI వ్యవస్థలను మూల్యాంకనం చేసే కొత్త మార్గాన్ని తాము పరీక్షిస్తున్నామని Google Deepmind చెబుతోంది. స్వంత frontier AI మోడల్పై నిర్వహిస్తున్న తొలి డబుల్-బ్లైండ్ మూల్యాంకనంగా వివరించబడిన ఈ పైలట్, రంగంలోని అత్యంత స్థిరమైన కొలమానం సమస్యలలో ఒకటైన benchmark contaminationను లక్ష్యంగా పెట్టుకుంది.
సమస్య సులభమే, కానీ దాని ప్రభావం తీవ్రమైనది. ఒక మోడల్ శిక్షణ లేదా ఆప్టిమైజేషన్ సమయంలో ఇప్పటికే బెంచ్మార్క్ ప్రశ్నలను గ్రహించి ఉంటే, బలమైన స్కోర్లను అర్థం చేసుకోవడం కష్టమవుతుంది. అటువంటి ఫలితం విస్తృత సామర్థ్యాన్ని కాకుండా జ్ఞాపకశక్తిని, ప్రత్యక్ష పరిచయాన్ని, లేదా పరీక్ష-నిర్దిష్ట ట్యూనింగ్ను ప్రతిబింబించవచ్చు. కంపెనీలు, పరిశోధకులు, నియంత్రణ సంస్థలు, మరియు బయటి మూల్యాంకనకర్తల కోసం, మోడళ్లను పోల్చడానికి మరియు ప్రమాదాన్ని అంచనా వేయడానికి ఉపయోగించే ప్రధాన సాధనాల్లో ఒకటైన దీని మీద నమ్మకాన్ని ఇది బలహీనపరుస్తుంది.
ఇచ్చిన నివేదిక ప్రకారం, Google యొక్క విధానం గోప్యమైన పరీక్షా పదార్థాలను cryptographically protected వాతావరణంలో ఉంచుతుంది, తద్వారా మోడల్ ప్రొవైడర్ ముందుగానే ప్రాంప్ట్లను పరిశీలించలేడు. అదే సమయంలో, మూల్యాంకనకర్తకు model weightsకు ప్రవేశం ఉండదు. ఈ అమరిక, బాహ్య పరీక్షలో దీర్ఘకాలంగా ఉన్న ఒక సమతుల్యతను తొలగించడానికి ఉద్దేశించబడింది; సాధారణంగా ఒక వైపు sensitive benchmark dataను వదులుకోవాలి లేదా proprietary model assetsను పంచుకోవాలి.
Gemini Flash Lite కేంద్రంగా పైలట్
ఈ పైలట్ ప్రాజెక్ట్ Gemini Flash Lite శ్రేణికి చెందిన ఒక మోడల్ను ఉపయోగిస్తుంది, అలాగే Singapore AI Safety Institute సహా భాగస్వాములతో confidential benchmarksపై నడుస్తుంది. రెండు పక్షాల గోప్యతను కాపాడుతూ కఠినమైన బయటి మూల్యాంకనాన్ని సాధించడమే నివేదించబడిన లక్ష్యం. ఆచరణలో, బెంచ్మార్క్ Googleకు దాచబడుతుంది, మరియు మోడల్ అంతర్గతాలు మూల్యాంకనకర్తకు దాచబడతాయి.
ఇది ముఖ్యమైనది, ఎందుకంటే ఆధునిక మోడల్ పరీక్ష increasingly sensitive materialsపై ఆధారపడుతోంది. cybersecurity, misuse potential, లేదా ప్రభుత్వ నిర్వహిత మూల్యాంకనాలు వంటి రంగాల్లో, benchmark prompts స్వయంగా విలువైనవిగా లేదా ప్రమాదకరమైనవిగా ఉండవచ్చు. ఆ ప్రశ్నలు లీక్ అయితే, పరీక్ష తన విలువలో చాలా భాగాన్ని కోల్పోతుంది. model weightsను అప్పగించమని మోడల్ ప్రొవైడర్లను కోరితే, వారు తమ intellectual property మరియు security ఆందోళనలను ఎదుర్కోవలసి వస్తుంది.
ఈ కొత్త ప్రక్రియను ఒకేసారి రెండు సమస్యలను పరిష్కరించే ప్రయత్నంగా వ్యాసం చూపిస్తోంది. Google Cloud యొక్క confidential computing portfolioలోని Confidential Spaceను ఉపయోగించి రక్షిత execution environmentను సృష్టిస్తున్నట్లు Google చెబుతోంది. దీని ఉద్దేశ్యం కేవలం విధానపరమైన గోప్యత లేదా ఒప్పందపరమైన పరిమితి మాత్రమే కాదు, cryptographic verification ఆధారంగా ఉన్న సాంకేతిక వేర్పాటు.
Benchmark contamination ఎందుకు పెద్ద సమస్యగా మారింది
Machine learningలో benchmark contamination కొత్త ఆందోళన కాదు, కానీ మోడళ్లు పెద్దవిగా మారడం, శిక్షణ డేటా విస్తరించడం, మరియు పోటీ ఒత్తిడి పెరగడం వల్ల ఇది మరింత తీవ్రంగా మారుతుంది. Proprietary frontier systems, internet-scale మరియు curated data యొక్క విస్తారమైన పరిమాణాలపై శిక్షణ పొందుతాయి. దీని వల్ల benchmark-లాంటి పదార్థాలు, లేదా వాటి దగ్గరి రూపాలు, ఇప్పటికే training pipelineలోకి ప్రవేశించి ఉండే అవకాశం పెరుగుతుంది.
ఒక benchmark నేరుగా చేర్చబడకపోయినా, fine-tuning, human feedback loops, synthetic training material, లేదా test formatsపై పునరావృత ప్రజా చర్చ ద్వారా ప్రేరేపితమైన optimization ద్వారా leakage జరగవచ్చు. అలా జరిగితే, ప్రధాన శీర్షికల్లో కనిపించే స్కోర్లు నిజ జీవిత సామర్థ్యాన్ని అధికంగా చూపించవచ్చు. బయటి పరిశీలకుల కోసం, ప్రధాన ప్రశ్న benchmark సాధారణీకరణను కొలుస్తోందా లేక rehearsalను కొలుస్తోందా అన్నదే.
Google ప్రతిపాదించిన సమాధానం ప్రక్రియాపరమైనదీ, సాంకేతికమైనదీ కూడా: పరీక్షను మోడల్ డెవలపర్కు బ్లైండ్గా ఉంచడం, మరియు మోడల్ను పరీక్ష యజమానికి అపారదర్శకంగా ఉంచడం. ఇది ప్రతి మూల్యాంకన సమస్యను తొలగించదు, కానీ అత్యంత హానికరమైన వాటిలో ఒకదాన్ని నేరుగా లక్ష్యంగా చేస్తుంది. మోడల్ ముందుగానే ప్రాంప్ట్లను చూడలేకపోతే, ఆ అంశాల కోసం ప్రత్యేకంగా optimize చేయడానికి ప్రొవైడర్కు తక్కువ అవకాశాలు ఉంటాయి.
సున్నితమైన బయటి మూల్యాంకనాలకు ముందు ఒక సర్దుబాటు అవసరమయ్యేదని నివేదిక కూడా పేర్కొంటుంది. మూల్యాంకనకర్తలు ప్రాంప్ట్లను అప్పగించి, ప్రొవైడర్ వాటిని నిల్వ చేయకూడదని లేదా దుర్వినియోగం చేయకూడదని నమ్మాల్సివచ్చేది; లేదా ప్రొవైడర్లు model weightsను పంచుకొని, దానికి సంబంధించిన exposureను అంగీకరించాల్సివచ్చేది. డబుల్-బ్లైండ్ అమరిక ఆ ఎంపికను తొలగించడమే లక్ష్యంగా పెట్టుకుంది.
ఇది Google సమస్య మాత్రమే కాదు, పరిశ్రమ నమ్మక సమస్య
దీని విస్తృత ప్రాధాన్యం ఏమిటంటే, AI benchmarking ఇప్పుడు కేవలం leaderboard అంశం కాకుండా, governance అంశంగా మారింది. స్కోర్లను product launches, enterprise procurement, safety debates, మరియు policy discussionsలో ఎక్కువగా ఉదహరిస్తున్నారు. ఆ దావాల వెనుక ఉన్న పరీక్షలు నమ్మదగినవిగా లేకపోతే, AI పనితీరు చుట్టూ ఉన్న ప్రజా evidence baseలో పెద్ద భాగం తక్కువ విశ్వసనీయంగా మారుతుంది.
Anthropic యొక్క Fable 5 కోసం ఇటీవల ARC-AGI మూల్యాంకనంలో ఆలస్యం వచ్చిన ఉదాహరణను వ్యాసం సూచిస్తుంది; అక్కడ data-retention పరిమితులు స్వతంత్ర పరీక్షను క్లిష్టం చేశాయి. బలమైన మోడళ్లు మరియు గోప్యమైన బయటి బెంచ్మార్క్లు ఎదురైనప్పుడు కలిగే కార్యాచరణ సంబంధ frictionను ఆ ఉదాహరణ చూపిస్తుంది. ఇచ్చిన నివేదికనుంచి తీసుకునే inference: Google తన పైలట్ను ఆ మూల్యాంకనాలను రెండు వైపులా అసౌకర్యకరమైన disclosureకు దారితీయకుండా సులభంగా నిర్వహించడానికి మార్గంగా నిలబెడుతోంది.
ఇక్కడ ఒక standard-setting ఆశయం కూడా ఉంది. ఈ ప్రయత్నం పరిశ్రమకు మరింత నమ్మకమైన, విస్తృతంగా విశ్వసించబడిన AI systemsను నిర్మించడంలో సహాయపడుతుందని Google చెబుతోంది. ఆ దావాను జాగ్రత్తగా చదవాలి. ఒక pilot అనేది మొత్తం రంగానికి పరిష్కారం కాదు, మరియు benchmark పట్ల నమ్మకం కేవలం ప్రాంప్ట్ గోప్యతపై మాత్రమే ఆధారపడదు. test design నాణ్యత, statistical rigor, reproducibility, benchmark scope, మరియు evaluator independence ఇంకా ముఖ్యమే. కానీ పరీక్ష ప్రక్రియ చుట్టూ ఉండే సాంకేతిక రక్షణ stackలో అర్థవంతమైన భాగంగా మారవచ్చు.
తర్వాత ఏమి గమనించాలి
అత్యంత ముఖ్యమైన తదుపరి ప్రశ్న, ఈ విధానం ఒకే పైలట్ను దాటి విస్తరిస్తుందా అన్నదే. ఇతర ప్రధాన మోడల్ డెవలపర్లు, స్వతంత్ర సంస్థలు, మరియు ప్రభుత్వ మూల్యాంకనకర్తలు ఇలాంటి mechanismలను స్వీకరిస్తే, ఈ approach frontier-model oversightలో సాధారణ భాగంగా మారవచ్చు. అది ఒక్కసారిగా చేసిన ప్రదర్శనలకే పరిమితమైతే, దాని ప్రభావం తక్కువగానే ఉంటుంది.
మరొక తెరిచి ఉన్న ప్రశ్న, ఏ రకాల మూల్యాంకనాలు ఎక్కువ ప్రయోజనం పొందుతాయన్నదే. ప్రాంప్ట్లు స్వయంగా sensitive కావచ్చునని కారణంగా cybersecurity మరియు government testing ప్రత్యేకంగా బలమైన candidates అని వ్యాసం సూచిస్తోంది. అదే తర్కం కొన్ని biosecurity, national security, లేదా commercial red-team పరిస్థితులకు కూడా విస్తరించవచ్చు, అయితే ఇచ్చిన పాఠ్యం ఆ రంగాలను నేరుగా పేర్కొనలేదు.
ఇప్పటికి ప్రధాన అభివృద్ధి స్పష్టంగా ఉంది: Google Deepmind, AI benchmarkingను trust-me ఏర్పాట్ల నుండి దూరం చేసి, సాంకేతికంగా అమలు చేసిన గోప్యత వైపు మార్చడానికి ప్రయత్నిస్తోంది. పనితీరు గురించి చేసే దావాలు తాము కూడా వ్యవస్థలంతే తీవ్రంగా చర్చించబడే రంగంలో, ఇది గణనీయమైన మార్పు. ఈ పైలట్ AI సామర్థ్యాన్ని ఎలా కొలవాలన్న పెద్ద వాదనను పరిష్కరించదు, కానీ అది ఒక ప్రాథమిక విశ్వసనీయత లోపాన్ని పరిష్కరిస్తుంది. ఒక benchmark, మోడల్ ఏమి చేయగలదో పరీక్షించడానికి ఉద్దేశించబడితే, మోడల్ ముందుగానే ఆ పరీక్షను తెలుసుకుని ఉండకూడదు.
ఈ వ్యాసం The Decoder నివేదిక ఆధారంగా ఉంది. మూల వ్యాసాన్ని చదవండి.
Originally published on the-decoder.com







