AI मॉडेल चाचणी औपचारिक करण्याकडे NIST चे पाऊल

अमेरिकेच्या नॅशनल इन्स्टिट्यूट ऑफ स्टँडर्ड्स अँड टेक्नॉलॉजीने एक नवीन कृत्रिम बुद्धिमत्ता मूल्यमापन प्लॅटफॉर्म सुरू केला आहे, ज्याचा उद्देश संशोधक आणि विकसकांना मॉडेल कार्यक्षमता आणि सुरक्षितता तपासण्याचा अधिक संरचित मार्ग देणे हा आहे. AI Technology Evaluation, किंवा AITE, नावाचा हा कार्यक्रम 27 जुलै रोजी जाहीर करण्यात आला आणि तो एक ऐच्छिक चाचणी व्यासपीठ म्हणून तयार करण्यात आला आहे, ज्यामध्ये मॉडेल्सचे मूल्यमापन ब्लाइंड डेटाचा वापर करून अलग ठेवलेल्या वातावरणात केले जाईल.

ही पुढाकार महत्त्वाची आहे, कारण ती AI प्रशासन आणि तैनातीतील वाढत्या समस्येला संबोधित करते: मॉडेल क्षमतेबाबतचे अनेक दावे विविध प्रयोगशाळा, विक्रेते, आणि वापरप्रकरणांमध्ये तुलना करणे कठीण असते. बेंचमार्क इन्फ्लेशन, असमान चाचणी अटी, आणि प्रशिक्षण पाइपलाइनमध्ये आधीच समाविष्ट झालेली असू शकणारी सार्वजनिक डेटासेट्स यांचा वापर, मुख्य कार्यक्षमता आकड्यांना ते दिसतात तितके अर्थपूर्ण नसू शकतो.

AITE अधिक नियंत्रित पर्याय देण्यासाठी आहे. स्रोत मजकुरानुसार, हा प्लॅटफॉर्म समान डेटा, मेट्रिक्स, आणि स्कोअरिंग देईल, जेणेकरून विकसकांना त्यांच्या प्रणाली कशा काम करतात हे अधिक चांगल्या प्रकारे समजेल. प्लॅटफॉर्मद्वारे पुरवलेला चाचणी डेटा प्रशिक्षण डेटामध्ये रूपांतरित होण्यासाठी नाही, हा मूल्यमापन स्वायत्त ठेवण्यासाठी एक महत्त्वाचा डिझाइन निर्णय आहे.

AITE काय करण्यासाठी सज्ज आहे

NIST या प्रणालीचे वर्णन एका अलग ठेवलेल्या टेस्टबेड म्हणून करते, जिथे AI मॉडेल्सना ब्लाइंड डेटा प्रक्रिया करताना विविध आदेशांविरुद्ध मूल्यमापन करता येईल. ही रचना क्षमता आणि सुरक्षितता-संबंधित वर्तन या दोन्हींवर वस्तुनिष्ठ अंतर्दृष्टी निर्माण करण्यासाठी आहे. फक्त खुले, व्यापकपणे प्रसारित बेंचमार्क्सवर अवलंबून न राहता, हा प्लॅटफॉर्म सार्वजनिकरित्या उपलब्ध नसलेली डेटासेट्स वापरतो.

याचा व्यावहारिक परिणाम सरळ आहे: मॉडेल्सवर त्यांनी आधीच पाहिले असण्याची शक्यता असलेल्या सामग्रीच्या आधारे निर्णय होण्याची शक्यता कमी राहते, आणि संशोधकांना निकालांची तुलना करण्यासाठी अधिक सक्षम आधार मिळतो. AI मूल्यमापनात हा एक महत्त्वाचा फरक आहे. एखादा बेंचमार्क सर्वात उपयुक्त तेव्हाच असतो, जेव्हा तो दाखवतो की मॉडेल खरोखर अपरिचित कार्ये कशी हाताळते, आणि नाही की ते आपल्या वजनांमध्ये आधीच असलेल्या डेटामधील नमुने किती चांगल्या प्रकारे पुन्हा निर्माण करते.

AITE ची सुरुवात मोठ्या व्हिजन-लॅंग्वेज मॉडेल्ससाठी इमेज-विश्लेषण कामांपासून होईल, तीन क्षेत्रांमध्ये: क्वांटम विज्ञान, जीनोमिक्स, आणि सार्वजनिक सुरक्षा. NIST म्हणते की नंतर अधिक कामे जोडली जातील. प्रारंभिक लक्ष एक व्यावहारिक निवड दर्शवते. व्हिजन-लॅंग्वेज प्रणाली व्यावसायिक आणि सरकारी दोन्ही संदर्भांमध्ये अधिक महत्त्वाच्या होत आहेत, तरीही क्षेत्र-विशिष्ट कार्यक्षमतेसाठी मूल्यमापन मानके असमान आहेत.

ब्लाइंड डेटा चर्चेला का बदलतो

या प्लॅटफॉर्मचा सर्वात निर्णायक घटक म्हणजे त्याचा ब्लाइंड डेटासेट्सचा वापर असू शकतो. AI मध्ये, सार्वजनिक बेंचमार्क्स मानकीकरणासाठी उपयुक्त असतात, परंतु ते थेट परीक्षेसाठी अनुकूलन करण्याची प्रेरणाही निर्माण करतात. त्यामुळे प्रत्यक्ष सामान्यीकरण आणि बेंचमार्क-विशिष्ट ट्युनिंग यांच्यातील फरक धूसर होऊ शकतो. सार्वजनिकरित्या उपलब्ध नसलेल्या मूळ डेटासेट्सचा वापर करून, AITE हे विकृतीकरण कमी करण्याचा प्रयत्न करते.

कार्यक्रमात सहभागी होणाऱ्या डेटा पुरवठादारांनी त्या डेटासेट्ससाठी योग्य अर्थपूर्ण कामांसह मूळ, गैर-सार्वजनिक डेटासेट्स सादर करणे अपेक्षित आहे. त्याउलट, मॉडेल विकसक आपली मॉडेल्स त्या सामग्रीवर चाचणीसाठी सादर करतात. NIST ची भूमिका चाचणी पायाभूत सुविधा आणि समान स्कोअरिंग चौकट उपलब्ध करून देणे आहे.

या मांडणीचे दोन परिणाम आहेत. पहिले, ते डेटा मालकांना त्यांचा क्षेत्र-विशिष्ट मूल्यमापन साहित्य सार्वजनिक प्रशिक्षण साधनात रूपांतरित न करता योगदान देण्याचा मार्ग देते. दुसरे, ते मॉडेल विकसकांना तृतीय-पक्ष कार्यप्रदर्शन संकेत मिळवण्याचा मार्ग देते, जे स्व-नोंदवलेल्या बेंचमार्क निकालांपेक्षा अधिक विश्वासार्ह असू शकतात.

याचा अर्थ असा नाही की AITE हे AI मूल्यमापनाचे सार्वत्रिक उत्तर आहे. बराचसा भाग डेटासेटची गुणवत्ता, कामाची रचना, आणि निवडलेल्या स्कोअरिंग पद्धती प्रत्यक्षात महत्त्वाच्या अपयश प्रकारांचे प्रतिबिंब करतात का यावर अवलंबून असतो. पण एक चौकट म्हणून, ती मूल्यमापनाला अधिक वास्तववादी आणि अधिक कठीण चाचणी परिस्थितीकडे ढकलते.

स्वैच्छिक AI सुरक्षा पायाभूत सुविधांमध्ये संघीय भूमिका

हे लॉन्च व्यापक संघीय रणनीतीशीही जुळते, ज्याचा केंद्रबिंदू प्रमुख AI विकसकांशी स्वैच्छिक सहकार्य आहे. स्रोत मजकुरात AITE ला ट्रम्प प्रशासनाच्या स्वैच्छिक मॉडेल सादरीकरणांद्वारे मॉडेल सुरक्षितता पुढे नेण्याच्या दृष्टिकोनातील सर्वात अलीकडचा टप्पा म्हणून वर्णन केले आहे. हे मे महिन्यातील Commerce Department च्या घोषणेनंतर येते, ज्यात Google DeepMind, Microsoft, आणि xAI यांचा Center for AI Standards and Innovation मार्फत मॉडेल्सचे मूल्यमापन करण्यासाठी पुनर्निगोशिएट केलेल्या व्यवस्थेत समावेश होता.

तो संदर्भ महत्त्वाचा आहे. अमेरिकन सरकार केवळ बाजूने मार्गदर्शन जारी करत नाही; ते सामायिक चाचणी पायाभूत सुविधा उभारत आहे, ज्याचा उद्देश मॉडेल गुणवत्ता आणि सुरक्षितता कशी मोजली जाते हे घडवणे आहे. स्वैच्छिक कार्यक्रम औपचारिक नियमनापेक्षा जलद पुढे जाऊ शकतात, विशेषतः अशा क्षेत्रात जिथे मॉडेल आर्किटेक्चर आणि तैनातीचे नमुने वेगाने बदलतात. त्याच वेळी, त्यांचा प्रभाव प्रमुख विकसक सहभागी होतात का आणि परिणामी मूल्यमापन व्यापक परिसंस्थेत विश्वासार्ह मानले जातात का यावर अवलंबून असतो.

NIST ची संस्थात्मक भूमिका या प्रयत्नाला अधिक वजन देते. तांत्रिक क्षेत्रांमध्ये मोजमाप, मानके, आणि मूल्यमापन चौकटींमध्ये ही संस्था दीर्घकाळ केंद्रस्थानी राहिली आहे. तीच परंपरा AI वर लागू करणे ही तर्कसंगत चाल आहे, विशेषतः जेव्हा धोरणकर्ते, संस्था, आणि एंटरप्राइझ खरेदीदार विपणन दाव्यांपलीकडे जाऊन प्रणालींची तुलना करण्यासाठी चांगली साधने शोधत आहेत.

पहिला टप्पा काय सूचित करतो

प्रारंभिक क्षेत्रांची निवड NIST जवळच्या काळातील मूल्यमापन आव्हान कसे पाहते याचे संकेत देते. क्वांटम विज्ञान आणि जीनोमिक्स दोन्हीही विशेष ज्ञान आणि गुंतागुंतीच्या डेटा अर्थ लावण्याशी संबंधित आहेत, त्यामुळे ती व्हिजन-लॅंग्वेज मॉडेल्स तज्ज्ञ संदर्भात विश्वासार्हपणे काम करू शकतात का यासाठी उपयुक्त चाचणी प्रकरणे ठरतात. सार्वजनिक सुरक्षा अधिक कार्यात्मक परिमाण जोडते, जिथे चुका अधिक तातडीचे परिणाम घडवू शकतात.

तिथून सुरुवात करून, AITE स्वतःला केवळ एक सामान्य बेंचमार्क हब म्हणून नाही, तर कार्य-विशिष्ट, उच्च-धोका मूल्यमापनासाठीच्या ठिकाण म्हणून मांडत असल्याचे दिसते. हे सरकारी खरेदी आणि संशोधन निधीसाठी संभाव्यतः महत्त्वाचे आहे, जिथे संस्थांना वाढत्या प्रमाणात असा पुरावा हवा असतो की एखादे मॉडेल मर्यादित, क्षेत्र-संबंधित परिस्थितींमध्ये कार्य करू शकते.

पहिली मूल्यमापने ऑगस्ट 2026 मध्ये सुरू होणार आहेत, त्यामुळे प्रारंभिक निकाल लवकर येऊ शकतात. त्या निष्कर्षांमुळेच AITE हे एक विशिष्ट तांत्रिक कार्यक्रम राहते की यू.एस. AI देखरेख आणि मॉडेल तुलना यामधील अधिक मध्यवर्ती संदर्भ बिंदू बनते, हे ठरण्याची शक्यता आहे.

पुढे काय पाहावे

तत्काळ प्रश्न म्हणजे सहभाग. स्वैच्छिक मूल्यमापन चौकट ही त्यात सादर होणाऱ्या डेटासेट्सच्या गुणवत्तेइतकीच आणि ते आकर्षित करणाऱ्या मॉडेल्सच्या दर्जाइतकीच प्रभावी असते. आघाडीचे विकसक ब्लाइंड कामांवरील स्वतंत्र स्कोअरिंगमध्ये मूल्य पाहतात, तर AITE खरेदीदार, नियामक, आणि संशोधकांसाठी एक महत्त्वाचा संकेत ठरू शकतो. सहभाग मर्यादित राहिला, तर त्याचा प्रभाव मर्यादितच राहू शकतो.

आणखी एक प्रश्न विस्ताराचा आहे. NIST ने सांगितले आहे की काळानुसार अधिक कामे जोडली जातील. जर हा प्लॅटफॉर्म अतिरिक्त मोडॅलिटीज आणि क्षेत्रांमध्ये वाढला, तर तो मॉडेल कार्यक्षमतेबद्दल चर्चा करण्यासाठी अधिक टिकाऊ समान भाषा तयार करण्यात मदत करू शकतो. अशी गोष्ट विशेषतः त्या उद्योगात उपयुक्त ठरेल, जिथे “state of the art” हा शब्द मोजण्यापेक्षा म्हणणे अधिक सोपे असते.

सध्या, AITE व्यापक AI-सुरक्षा चर्चेतून ऑपरेशनल मूल्यमापन पायाभूत सुविधेकडे झालेला ठोस बदल दर्शवतो. बेंचमार्क्स आणि स्पर्धात्मक दाव्यांनी भरलेल्या बाजारात, NIST चालवत असलेला ब्लाइंड-डेटा टेस्टबेड AI मूल्यमापन अधिक कठोर बनवण्याच्या महत्त्वाच्या प्रयोगांपैकी एक ठरू शकतो.

हा लेख Defense One च्या वार्तांकनावर आधारित आहे. मूळ लेख वाचा.

Originally published on defenseone.com