सामान्य-उद्देश AI ने विशेष क्लिनिकल टूल्सपेक्षा सरस कामगिरी केली
Nature Medicine मध्ये प्रकाशित झालेल्या एका नवीन स्वतंत्र मूल्यांकनानुसार, फ्रंटियर सामान्य-उद्देश मोठ्या भाषा मॉडेल्सनी तीन वेगवेगळ्या वैद्यकीय बेंचमार्क्समध्ये दोन विशेष क्लिनिकल AI उत्पादने मागे टाकली. या अभ्यासात OpenEvidence आणि UpToDate Expert AI यांची तुलना GPT-5.2, Gemini 3.1 Pro Preview, आणि Claude Opus 4.6 यांच्याशी करण्यात आली.
हा निकाल उद्योगातील एका सामान्य गृहितकाला छेद देतो: वैद्यकासाठी खास तयार केलेली क्लिनिकल उत्पादने, डोमेन-विशिष्ट प्रशिक्षण किंवा रिट्रीव्हल सिस्टीममुळे, व्यापक मॉडेल्सपेक्षा सातत्याने चांगली कामगिरी करतील. या मूल्यांकनात तसे झाले नाही.
हे पेपर रुग्णालये, चिकित्सक, आणि आरोग्य प्रणालींसाठी एक व्यावहारिक इशारा म्हणून मांडते, जी मजबूत बाह्य पडताळणीशिवाय मालकीच्या वैद्यकीय AI ची झपाट्याने अंमलबजावणी करण्याचा विचार करत असतील. लेखकांचे म्हणणे आहे की श्रेष्ठ क्लिनिकल कामगिरीचे दावे स्वतंत्रपणे तपासले गेले पाहिजेत, विशेषतः जेव्हा अंतर्निहित आर्किटेक्चर आणि प्रशिक्षण पाइपलाइन सार्वजनिक नसतात.
तुलना कशी करण्यात आली
मूल्यांकन तीन टप्प्यांत झाले. प्रथम, संशोधकांनी वैद्यकीय ज्ञान तपासण्यासाठी 500 MedQA प्रश्नांचा वापर केला. दुसऱ्या टप्प्यात, मॉडेल आउटपुट चिकित्सकांशी किती जुळतात हे मोजण्यासाठी 500 HealthBench घटक वापरले. तिसऱ्या टप्प्यात, प्रत्यक्ष क्लिनिकल वातावरणात एक सामान्य-उद्देश भाषा मॉडेलला चिकित्सकांनी विचारलेल्या 100 ओळख काढलेल्या प्रश्नांपासून एक वास्तव क्लिनिकल प्रश्न बेंचमार्क तयार करण्यात आला.
तो तिसरा टप्पा या पेपरचा सर्वात लक्षवेधी भाग आहे, कारण तो अमूर्त बेंचमार्क गुणांपलीकडे जाण्याचा प्रयत्न करतो. वास्तव क्लिनिकल प्रश्न संचासाठी, 12 अमेरिकन चिकित्सकांनी मॉडेल आउटपुटचे यादृच्छिक, अंध पुनरावलोकन केले, ज्यातून 1,800 मॉडेल-प्रश्न अॅनोटेशन्स तयार झाल्या.
तिन्ही मूल्यांकनांमध्ये, फ्रंटियर सामान्य-उद्देश मॉडेल्सनी दोन्ही क्लिनिकल AI टूल्सपेक्षा चांगली कामगिरी केली. वास्तव क्लिनिकल प्रश्न बेंचमार्कवर क्लिनिकल टूल्सनी Google Search AI Overview इतकीच कामगिरी केल्याचेही पेपर सांगते.
हा निकाल का महत्त्वाचा आहे
विशेष क्लिनिकल AI आधीच वैद्यकीय प्रॅक्टिसमध्ये येत आहे, पण स्वतंत्र वास्तविक-जगातील मूल्यांकन अजूनही दुर्मीळ आहे, असे पेपर म्हणते. हा फरक महत्त्वाचा आहे, कारण आरोग्य प्रणालींना अशा टूल्सवर विश्वास ठेवायला सांगितले जात आहे ज्यांची अंतर्गत रचना, प्रशिक्षण डेटा, आणि मॉडेल निवडी बहुतेक वेळा अस्पष्ट असतात.
हा अभ्यास असे म्हणत नाही की सामान्य-उद्देश मॉडेल्स निरीक्षणाशिवाय वैद्यकीय वापरासाठी आपोआप सुरक्षित आहेत. उलट, त्याचा मुख्य मुद्दा अधिक मर्यादित आणि अधिक महत्त्वाचा आहे: विशेषीकरणालाच चांगल्या कामगिरीचा पुरावा मानू नये. एखादे उत्पादन स्वतःला वैद्यकीयदृष्ट्या ट्यून केलेले म्हणून मांडत असेल, तरी प्रत्यक्षात ते क्लिनिकलदृष्ट्या संबंधित कामांवर चांगले काम करते हे दाखवण्याची जबाबदारी अजूनही विक्रेते आणि खरेदीदारांवरच राहते.
याचे खरे परिणाम खरेदी आणि प्रशासनावर होतात. एक रुग्णालय ब्रँडेड क्लिनिकल असिस्टंट आणि संस्थात्मक सुरक्षा उपायांसह असलेल्या फ्रंटियर मॉडेलमधील निवड करत असेल, तर ती निवड स्पष्टपणे वेगळ्या कामगिरीच्या पातळ्यांमधील निवड असेलच असे नाही. या मूल्यांकनानुसार, अधिक सामान्य प्रणाली अर्थपूर्ण मोजमापांवर विशेष प्रणालींशी बरोबरी करू शकतात किंवा त्यांना मागे टाकू शकतात.
मालकीच्या फायद्यावर आव्हान
हे पेपर AI मधील व्यापक बदलाकडेही निर्देश करते. फ्रंटियर मॉडेल्सना अतिशय मोठ्या प्रशिक्षण कॉर्पस आणि विस्तृत संरेखन कामाचा लाभ मिळाला आहे. लेखक सुचवतात की हे लाभ आता इतके मजबूत झाले असावेत की संकीर्ण पुनःप्रशिक्षणाशिवायही डोमेन-विशिष्ट उत्पादनांना आव्हान देऊ शकतात.
याचा अर्थ असा नाही की प्रत्येक सामान्य-उद्देश मॉडेल प्रत्येक परिस्थितीत प्रत्येक क्लिनिकल टूलला हरवेल. पण याचा अर्थ असा आहे की विशेषीकरणानेच अनिवार्यपणे निर्णायक फायदा निर्माण होतो, हा जुना युक्तिवाद अनेक खरेदीदारांनी गृहित धरल्यापेक्षा कमकुवत दिसतो.
ही तुलना विशेषतः महत्त्वाची आहे, कारण क्लिनिकल टूल्स आधीच मोठ्या प्रमाणावर वैद्यकीय प्रॅक्टिससाठी उत्पादने म्हणून सादर केली जात आहेत. त्या संदर्भात, कमी कामगिरी हा केवळ शैक्षणिक निकाल नसतो. तो सुरक्षितता, मूल्य, आणि तज्ज्ञतेभोवतीचे ब्रँडिंग पुराव्यापेक्षा पुढे जात आहे का, असे प्रश्न निर्माण करतो.
आरोग्य प्रणालींनी यामधून काय घ्यावे
या अभ्यासातून सर्वात योग्य निष्कर्ष हा नाही की वैद्यकाने विशेष AI सोडून द्यावे. तो असा आहे की मूल्यांकन मानके अधिक कठोर व्हायला हवीत. वास्तववादी क्लिनिकल कामांवर स्वतंत्र चाचणी, कोणतीही प्रणाली प्रत्यक्ष वापरात विश्वासार्ह मानण्याआधी, अत्यावश्यक दिसते.
हेच या पेपरचे सर्वात मोठे योगदान आहे. ते विपणन श्रेणींपेक्षा वास्तविक-जगातील पुराव्याला पुढे ठेवते आणि खरेदीदारांना आठवण करून देते की मॉडेलवरील लेबलपेक्षा मोजलेली कामगिरी कमी-जास्त महत्त्वाची ठरू शकते. अशा क्षेत्रात जिथे चुका गंभीर परिणाम घडवतात, तो फरक सैद्धांतिक नाही.
- Nature Medicine ने दोन विशेष क्लिनिकल AI टूल्सची तीन फ्रंटियर सामान्य-उद्देश मॉडेल्सशी तुलना केली.
- फ्रंटियर मॉडेल्सनी MedQA, HealthBench, आणि एका वास्तव क्लिनिकल प्रश्न बेंचमार्कवर क्लिनिकल टूल्सना मागे टाकले.
- अभ्यासाच्या वास्तविक-जगातील टप्प्यात 100 ओळख काढलेले डॉक्टरांचे प्रश्न आणि 1,800 चिकित्सक अॅनोटेशन्स वापरण्यात आले.
- क्लिनिकल AI वापरात आणण्यापूर्वी अधिक मजबूत स्वतंत्र मूल्यांकनाची गरज असल्याचे लेखक म्हणतात.
हा लेख Nature Medicine च्या रिपोर्टिंगवर आधारित आहे. मूळ लेख वाचा.
Originally published on nature.com

