चिकित्सा कृत्रिम बुद्धिमत्ता के लिए एक नया मानक
वर्षों से, चिकित्सा कृत्रिम बुद्धिमत्ता (एआई) के क्षेत्र को एक अद्वितीय प्रश्न द्वारा परिभाषित किया गया है: क्या एल्गोरिदम विशेषज्ञ चिकित्सकों के प्रदर्शन से मेल खा सकते हैं? दर्जनों अध्ययनों ने रेडियोलॉजिस्ट, पैथोलॉजिस्ट और त्वचा विशेषज्ञों के खिलाफ गहन शिक्षण मॉडल का परीक्षण किया है, अक्सर पूर्वव्यापी डेटासेट पर प्रभावशाली परिणामों के साथ। लेकिन नेचर मेडिसिन में हाल की एक टिप्पणी का तर्क है कि चिकित्सा एआई की पहली पीढ़ी ने गलत बेंचमार्क निर्धारित किया। अगली पीढ़ी, यह तर्क देती है, का न्याय इस बात पर नहीं किया जाना चाहिए कि क्या मशीनें मानव विशेषज्ञता की नकल कर सकती हैं, बल्कि इस बात पर कि क्या सावधानीपूर्वक डिज़ाइन की गई मानव-एआई प्रणालियाँ रोगी के परिणामों में सुधार कर सकती हैं।
लुंड विश्वविद्यालय के नैदानिक रेडियोलॉजी विभाग की डॉ. क्रिस्टीना लैंग द्वारा लिखित, यह टिप्पणी चिकित्सा में एआई के पहले यादृच्छिक परीक्षणों में से एक से सबक लेती है और यह तर्क देती है कि नैदानिक एआई का मूल्यांकन और कार्यान्वयन कैसे किया जाए, इसमें गहरा बदलाव आवश्यक है। यह सटीकता मेट्रिक्स से आगे बढ़ने और उन उपायों की ओर बढ़ने का आह्वान है जो वास्तव में मायने रखते हैं: रुग्णता, मृत्यु दर, जीवन की गुणवत्ता, और देखभाल वितरण की दक्षता और समानता।
पहली पीढ़ी: एल्गोरिदम जो चिकित्सकों की नकल करते हैं
प्रारंभिक चिकित्सा एआई अनुसंधान इस विचार पर हावी था कि एक मॉडल का मूल्य उसके आउटपुट की सीधे मानव विशेषज्ञों के साथ तुलना करके स्थापित किया जा सकता है। अध्ययनों ने संवेदनशीलता, विशिष्टता, और रिसीवर ऑपरेटिंग विशेषता वक्र के तहत क्षेत्र की सूचना दी, अक्सर यह निष्कर्ष निकाला कि एआई प्रणाली चिकित्सकों के "बराबर" या "बेहतर" थी। इन निष्कर्षों ने अपार उत्साह पैदा किया और रेडियोलॉजी, कार्डियोलॉजी और अन्य विशिष्टताओं में सैकड़ों एआई उपकरणों के लिए नियामक मंजूरी का नेतृत्व किया।
फिर भी एल्गोरिथम समकक्षता नैदानिक लाभ के समान नहीं है। एक मॉडल जो एक छवि की व्याख्या करने में रेडियोलॉजिस्ट से मेल खाता है, वह एक बार व्यस्त अस्पताल के कार्यप्रवाह में एकीकृत होने के बाद समग्र नैदानिक प्रक्रिया में सुधार करने में विफल हो सकता है। यह अलर्ट उत्पन्न कर सकता है जिन्हें अनदेखा किया जाता है, कार्यभार बढ़ा सकता है, या रोगी प्रबंधन में नई त्रुटियां पेश कर सकता है। पूर्वव्यापी अध्ययन का नियंत्रित वातावरण इन वास्तविक दुनिया की जटिलताओं को पकड़ नहीं सकता है। जैसा कि लैंग लिखते हैं, पहली पीढ़ी ने न्याय किया कि क्या एआई चिकित्सकों से मेल खा सकता है; अगली पीढ़ी को यह न्याय करना चाहिए कि क्या यह रोगियों की मदद कर सकता है।
एआई में यादृच्छिक परीक्षणों का उदय
यादृच्छिक नियंत्रित परीक्षण (आरसीटी) चिकित्सा हस्तक्षेपों के मूल्यांकन के लिए स्वर्ण मानक हैं। वे भ्रम को समाप्त करते हैं, मानव व्यवहार के लिए जिम्मेदार हैं, और नैदानिक अभ्यास को बदलने के लिए आवश्यक साक्ष्य का स्तर प्रदान करते हैं। हालांकि, एआई की दुनिया में, आरसीटी दुर्लभ रहे हैं। एआई उपकरणों के लिए अधिकांश साक्ष्य पूर्वव्यापी या संभावित एकल-हाथ अध्ययनों से आए हैं जिनमें सीमित बाहरी वैधता है। यह बदलना शुरू हो रहा है, और लैंग आरसीटी के उद्भव को एक महत्वपूर्ण विकास के रूप में उजागर करते हैं।
सबसे उल्लेखनीय उदाहरणों में से एक MASAI परीक्षण है, जो स्वीडन में आयोजित एक यादृच्छिक अध्ययन है जिसने एआई-समर्थित मैमोग्राफी स्क्रीनिंग के उपयोग की जांच की। 2023 में द लैंसेट ऑन्कोलॉजी में प्रकाशित उस परीक्षण में, रोगियों को एआई-समर्थित स्क्रीनिंग या मानक डबल रीडिंग प्राप्त करने के लिए यादृच्छिक किए जाने वाले पहले लोगों में से एक है। परीक्षण ने एल्गोरिथ्म की कैंसर का पता लगाने की दर से अधिक मापा; इसने स्क्रीन-पता लगाए गए कैंसर, अंतराल कैंसर, रिकॉल दर और कार्यभार जैसे परिणामों को मापा। परिणामों ने सुझाव दिया कि एआई रेडियोलॉजिस्ट के लिए कार्यभार को कम कर सकता है जबकि कैंसर का पता लगाने को बनाए रखता है या संभावित रूप से सुधारता है, लेकिन असली सबक व्यापक था: केवल एक यादृच्छिक डिजाइन समग्र रूप से मानव-एआई प्रणाली के बारे में विश्वसनीय उत्तर प्रदान कर सकता है।
लैंग की टिप्पणी अतिरिक्त हालिया आरसीटी का हवाला देती है, जिसमें द लैंसेट डिजिटल हेल्थ में 2025 का एक अध्ययन और द लैंसेट में 2026 का एक अध्ययन शामिल है, जो एक उभरते साक्ष्य आधार के हिस्से के रूप में है। ये परीक्षण अनुसंधान की एक नई लहर का प्रतिनिधित्व करते हैं जो एआई को एक स्टैंडअलोन तकनीक के रूप में नहीं, बल्कि एक नैदानिक मार्ग में एम्बेडेड हस्तक्षेप के रूप में मानता है, जिसका मूल्यांकन रोगी-उन्मुख अंत बिंदुओं के खिलाफ किया जाता है।
फ्रंट लाइन से सबक
रेडियोलॉजिस्ट और एआई स्क्रीनिंग परीक्षणों में एक प्रमुख अन्वेषक दोनों के रूप में अपने दृष्टिकोण से, लैंग सांख्यिकीय महत्व से परे जाने वाले प्रमुख सबक की पहचान करता है। पहला, रोगी के परिणाम सर्वोपरि हैं। यह दिखाने के लिए पर्याप्त नहीं है कि एक एआई प्रणाली छवियों को तेज़ी से या अधिक सटीक रूप से वर्गीकृत कर सकती है; यह दिखाया जाना चाहिए कि यह रोगी की यात्रा में सुधार करता है, प्रारंभिक पहचान से उपचार और उत्तरजीविता तक।
दूसरा, मानव-एआई इंटरैक्शन का डिज़ाइन महत्वपूर्ण है। एक एल्गोरिथ्म केवल उस प्रणाली के रूप में अच्छा है जो इसके आसपास है। अलर्ट कैसे प्रस्तुत किए जाते हैं, चिकित्सकों को जवाब देने के लिए कैसे प्रशिक्षित किया जाता है, और जवाबदेही कैसे वितरित की जाती है, यह सब अंतिम परिणाम को प्रभावित करता है। "सावधानीपूर्वक डिज़ाइन किए गए मानव-एआई सिस्टम" पर लैंग का जोर मॉडल से ध्यान केंद्रित करने की ओर इशारा करता है जिसमें यह संचालित होता है सामाजिक-तकनीकी वातावरण पर।
तीसरा, कार्यान्वयन विज्ञान मायने रखता है। एक सफल परीक्षण सफल तैनाती की गारंटी नहीं देता है। मौजूदा नैदानिक कार्यप्रवाह में एआई को एकीकृत करने, प्रतिपूर्ति सुरक्षित करने, और चिकित्सकों और रोगियों के बीच विश्वास बनाए रखने की चुनौतियाँ किसी भी एल्गोरिथम प्रगति के रूप में महत्वपूर्ण हैं। लैंग, जो स्वीडिश राष्ट्रीय स्तन कैंसर स्क्रीनिंग दिशानिर्देशों की अध्यक्षता करते हैं और सीमेंस हेल्थिनियर्स जैसी कंपनियों के लिए सलाहकार बोर्ड में सेवा कर चुके हैं, इन अनुवाद संबंधी बाधाओं को प्रत्यक्ष रूप से समझते हैं।
एक नए युग के लिए मूल्यांकन पर पुनर्विचार
टिप्पणी का तर्क है कि चिकित्सा एआई के मूल्यांकन को दवाओं और उपकरणों पर लागू समान कठोर मानकों को अपनाना चाहिए। इसका मतलब है अधिक आरसीटी, लेकिन उपयुक्त तुलनित्र, नैदानिक रूप से सार्थक अंत बिंदु, और व्यावहारिक परीक्षण डिजाइनों का उपयोग जो रोजमर्रा के अभ्यास को दर्शाते हैं। नियामक निकाय और पेशेवर समाज इस तरह के साक्ष्य की मांग करना शुरू कर रहे हैं, लेकिन तकनीकी नवाचार की गति और मूल्यांकन की गति के बीच की खाई व्यापक बनी हुई है।
लैंग सुझाव देते हैं कि क्षेत्र को "क्या एआई एक चिकित्सक से बेहतर है?" पूछने से दूर जाना चाहिए और इसके बजाय पूछना चाहिए "क्या यह एआई-चिकित्सक टीम परिणामों में सुधार करती है, नुकसान कम करती है, और संसाधनों का बुद्धिमानी से उपयोग करती है?" इस पुनर्निर्माण का अध्ययन डिजाइन, फंडिंग प्राथमिकताओं और प्रकाशन मानकों के लिए गहरा प्रभाव है। यह डेवलपर्स पर अधिक जिम्मेदारी भी डालता है कि वे ऐसे उपकरण बनाएं जो पारदर्शी, व्याख्या योग्य और नैदानिक आवश्यकताओं के अनुरूप हों।
बेहतर मानव-एआई सिस्टम का निर्माण
टिप्पणी में सबसे सम्मोहक कॉल में से एक फ्रंटलाइन चिकित्सकों के साथ एआई सिस्टम के सह-डिज़ाइन के लिए है। यदि लक्ष्य रोगी के परिणामों में सुधार करना है, तो उपयोगकर्ता इंटरफ़ेस, निर्णय-समर्थन तर्क, और प्रतिक्रिया तंत्र नैदानिक अभ्यास की वास्तविकताओं द्वारा आकार दिया जाना चाहिए। यह कैंसर स्क्रीनिंग जैसे उच्च-दांव वाले क्षेत्रों में विशेष रूप से महत्वपूर्ण है, जहां एआई का उपयोग मामलों को ट्राइएज करने, संदिग्ध निष्कर्षों को ध्वजांकित करने और संभावित रूप से एक रेडियोलॉजिस्ट को समीक्षा करने वाली छवियों की संख्या को कम करने के लिए किया जा रहा है।
लैंग के अपने शोध ने पता लगाया है कि मानव धारणा और विशेषज्ञता मशीन निदान के साथ कैसे बातचीत करते हैं। यूरोपियन रेडियोलॉजी और रेडियोलॉजी में प्रकाशनों सहित प्रारंभिक कार्य, "खोज की संतुष्टि" प्रभाव और रेडियोलॉजिस्ट अन्य असामान्यताओं की उपस्थिति में निष्कर्षों को कैसे याद करते हैं, की जांच की। ये संज्ञानात्मक मनोविज्ञान अंतर्दृष्टि अब यह समझने के लिए लागू की जा रही है कि रेडियोलॉजिस्ट का एआई में विश्वास उनके निर्णय लेने को कैसे प्रभावित करता है। एक प्रणाली जो सटीक है लेकिन मानव निर्भरता के लिए खराब रूप से कैलिब्रेटेड है, अति आत्मविश्वास या कम उपयोग का कारण बन सकती है, जो दोनों रोगियों को नुकसान पहुंचा सकते हैं।
आगे की सड़क: साक्ष्य, नैतिकता और समानता
जैसे-जैसे एआई चिकित्सा में अधिक व्यापक हो जाता है, मजबूत साक्ष्य की आवश्यकता तत्काल हो जाती है। लैंग की टिप्पणी एक अनुस्मारक है कि आरसीटी केवल एक औपचारिकता नहीं हैं; वे यह समझने के लिए आवश्यक हैं कि कौन से एआई अनुप्रयोग वास्तविक मूल्य प्रदान करते हैं और कौन से पूर्वाग्रह या नुकसान के नए रूपों को पेश कर सकते हैं। यह विशेष रूप से कम सेवा वाली आबादी के लिए प्रासंगिक है जो एआई मॉडल को प्रशिक्षित करने के लिए उपयोग किए जाने वाले डेटासेट में कम प्रतिनिधित्व कर सकती है।
लेखक यह भी नोट करता है कि चिकित्सा एआई का विकास वाणिज्यिक प्रोत्साहनों के साथ जुड़ा हुआ है। N23 Health के सह-संस्थापक और प्रमुख कंपनियों के सलाहकार के रूप में, वह उद्योग-विरोधी नहीं हैं, बल्कि साक्ष्य-आधारित नवाचार की वकालत करते हैं। लक्ष्य बाजार प्रोत्साहनों को कठोर मूल्यांकन के साथ संरेखित करना चाहिए ताकि रोगियों तक पहुंचने वाले उपकरणों को उनकी मदद करने के लिए सिद्ध किया गया है।
निष्कर्ष: नैदानिक एआई के लिए एक नया बेंचमार्क
नेचर मेडिसिन में टिप्पणी एक समय पर संदेश देती है। केवल एल्गोरिदम की तुलना चिकित्सकों से करने का युग समाप्त हो गया है। अब जो मायने रखता है वह यह है कि क्या एआई, जब सोच-समझकर डिज़ाइन की गई नैदानिक प्रणालियों में एकीकृत होता है, रोगियों के जीवन में स्पष्ट रूप से सुधार करता है। यादृच्छिक परीक्षण, जैसे कि लैंग ने नेतृत्व करने में मदद की, तकनीकी वादे और वास्तविक दुनिया के लाभ के बीच का पुल हैं। वे यह सुनिश्चित करने के लिए आवश्यक साक्ष्य प्रदान करते हैं कि चिकित्सा एआई की अगली पीढ़ी को उच्चतम मानक पर रखा जाए: रोगी के परिणामों में सुधार।
जैसे-जैसे क्षेत्र परिपक्व होता है, शोधकर्ताओं, नियामकों, चिकित्सकों और डेवलपर्स को यादृच्छिक मूल्यांकन को आदर्श बनाने के लिए एक साथ काम करना चाहिए, न कि अपवाद। केवल तभी चिकित्सा एआई स्वस्थ जीवन के लिए एक ताकत के रूप में अपनी क्षमता को पूरा कर सकता है। सबक स्पष्ट हैं, और वे एक सरल बदलाव के साथ शुरू होते हैं: सफलता का न्याय न करें कि एल्गोरिथ्म क्या करता है, बल्कि रोगी क्या अनुभव करता है।
यह लेख नेचर मेडिसिन द्वारा रिपोर्टिंग पर आधारित है। मूल लेख पढ़ें।
Originally published on nature.com





