सरकारी दबाव आणि मॉडेल सुरक्षेच्या मर्यादा
Fable 5 मॉडेलच्या प्रकाशनावरून अमेरिकी अधिकारी आणि Anthropic यांच्यात झालेला वाद frontier AI धोरणातील एक मूलभूत ताण स्पष्ट करतो: व्यापक प्रकाशनापूर्वी सरकारांना अत्यंत सक्षम प्रणाली प्रभावीपणे unhackable असाव्यात असे वाटू शकते, पण तंत्रज्ञान त्या मानकाला पाठबळ देत असल्याचे दिसत नाही.
स्रोत सामग्रीनुसार, प्रशासनातील अधिकारी Anthropic वर अलीकडेच जारी झालेल्या Trump cyber executive order कडे दुर्लक्ष केल्याचा आरोप करत आहेत, कारण कंपनीने Fable 5 सरकारच्या clearinghouse कडून तपासणी होईपर्यंत थांबण्याऐवजी थेट प्रकाशित केला. अहवालात म्हटले आहे की मॉडेल प्रसिद्ध केले गेले तेव्हा oversight framework अद्याप पूर्णपणे तयार झाले नव्हते.
ही टीका केवळ प्रक्रियेपुरती मर्यादित नाही. स्रोतात उद्धृत केलेल्या एका अधिकाऱ्याच्या म्हणण्यानुसार Anthropic ला jailbreak होऊ शकतो हे माहीत होते आणि तरीही त्यांनी पुढे जाण्याचा निर्णय घेतला. संबंधित विशिष्ट jailbreak चे अस्तित्व आणि तीव्रता मूळ मजकुरात पुष्टी केलेली नव्हती, पण हा आरोप policy expectations आणि large language model वर्तनाच्या वास्तवातील वाढत्या संघर्षाकडे निर्देश करतो.
मूळ तांत्रिक समस्या
हा वाद Anthropic च्या निर्णयांइतकाच सरकारच्या AI समजुतीबद्दलही आहे, असा स्रोताचा युक्तिवाद आहे. कारण सरळ आहे: advanced language models सोबत जवळून काम करणारे लोक सामान्यतः prompt injection आणि jailbreaks यांना पूर्णपणे सुटलेल्या समस्यांपेक्षा सततचे धोके मानतात.
लेखात नमूद केले आहे की OpenAI ने इशारा दिला आहे की prompt injection कदाचित कधीच पूर्णपणे सुटणार नाही. हे महत्त्वाचे आहे, कारण “unhackable” frontier models ची मागणी अशी पातळी ठरवते जी प्रत्यक्षात, किमान सध्याच्या architectures आणि deployment methods सोबत, साध्य करणे कठीण किंवा अशक्य असू शकते. त्यामुळे वास्तव प्रश्न असा नाही की एखादे शक्तिशाली मॉडेल कधी पूर्णपणे सुरक्षित होऊ शकते का; तर अपयश किती गंभीर असतात, countermeasures किती जलद लागू होतात, आणि कोणत्या use cases साठी अधिक कडक containment आवश्यक आहे हा आहे.
Frontier models साठी stakes का जास्त आहेत
मॉडेल्स विज्ञान, तंत्रज्ञान किंवा जीवशास्त्राशी संबंधित कामात मदत करू शकत असतील तेव्हा policy tension अधिक तीव्र होते. स्रोत आठवण करून देतो की Anthropic CEO Dario Amodei यांनी 2023 मध्ये सांगितले होते की त्या भागांतील safety protocols चुकवले गेले, तर jailbreak जीवन-मरणाचा प्रश्न ठरू शकतो.
यातून अधिकारी oversight आणि release discipline वर इतका जोर का देत आहेत हे स्पष्ट होते. तसेच industry jailbreak चिंता केवळ नेहमीची इंटरनेट खोड म्हणून फेटाळू शकत नाही हेही दिसते. frontier पातळीवरील अपयशांचा dual-use knowledge, misuse, किंवा स्वेच्छाधारित governance frameworks वरील विश्वास खच्ची होणे यावर परिणाम होऊ शकतो.
हे security test इतकेच governance test देखील आहे
Commerce Department चे अधिकारी आणि Anthropic चे कर्मचारी चर्चा करत असल्याचे अहवालात म्हटले आहे, तसेच CIA आणि science adviser Michael Kratsios यांच्या सहभागासह आणखी बैठका नियोजित आहेत. Fable 5 साठी export controls ची मागणी करणाऱ्या open letter वर 100 हून अधिक security experts आणि tech executives यांनी स्वाक्षऱ्या केल्याचेही यात नमूद आहे.
हे तपशील एकत्र पाहिले तर हा वाद केवळ एका मॉडेल प्रकाशनाबद्दल नाही हे स्पष्ट होते. acceptable risk कोण ठरवणार, औपचारिक संस्था अस्तित्वात येण्यापूर्वी voluntary oversight कसे चालेल, आणि विश्वास ढासळवून न टाकता AI कंपन्या सरकारांपेक्षा वेगाने पुढे जाऊ शकतात का, हाही प्रश्न यात आहे.
- US officials म्हणतात की Anthropic ने planned review mechanism ची वाट न पाहता Fable 5 प्रकाशित केले.
- वादाचा केंद्रबिंदू jailbreak risk आणि government oversight आहे.
- खरोखर unhackable LLMs ची मागणी तांत्रिकदृष्ट्या अवास्तव असू शकते, असा स्रोताचा युक्तिवाद आहे.
मोठा धडा अस्वस्थ करणारा, पण उपयुक्त आहे. Frontier AI security कदाचित safe-or-unsafe या द्वैतात बसणार नाही. त्याऐवजी layered mitigation, मर्यादित deployment choices, monitoring, आणि post-release response यांचा समुच्चयच राहण्याची शक्यता आहे. हा सांगायला कठीण governance model आहे, पण स्रोतामध्ये वर्णन केलेल्या तंत्रज्ञानाशी तो अधिक सुसंगत आहे.
नीतिनिर्माते जर स्वभावत:च पूर्ण सुरक्षेला प्रतिकार करणाऱ्या प्रणालींकडून absolute security मागत राहिले, तर असे संघर्ष अधिक सामान्य होतील. AI governance चा पुढचा टप्पा यावर अवलंबून असू शकतो की दोन्ही बाजू अशक्य मानके सोडून अंमलात आणता येतील अशी, तांत्रिकदृष्ट्या भक्कम मानके स्वीकारू शकतात का.
हा लेख The Decoder च्या वार्तांकनावर आधारित आहे. मूळ लेख वाचा.
Originally published on the-decoder.com
