क्लिनिकल AI विश्वास कैसे अर्जित करता है, इस पर एक स्पष्ट चेतावनी

चिकित्सा में आर्टिफिशियल इंटेलिजेंस की तैनाती में एक परिचित पैटर्न है: कोई मॉडल किसी चुनिंदा टेस्ट सेट पर प्रभावशाली आंकड़े दर्ज करता है, सुर्खियाँ बनती हैं, और अपनाने का दबाव उससे बहुत पहले बढ़ जाता है जब कोई यह भरोसे के साथ कह सके कि यह सिस्टम असली क्लिनिक में, असली मरीज़ों पर, असली जोखिमों के साथ कैसे व्यवहार करता है। Nature Medicine में 14 सितंबर 2026 को ऑनलाइन प्रकाशित एक नई टिप्पणी सीधे उसी पैटर्न पर निशाना साधती है। इसका केंद्रीय दावा बिना किसी लाग-लपेट के कहा गया है: क्लिनिकल आर्टिफिशियल इंटेलिजेंस में विश्वास को बेंचमार्क के ज़रिए अस्तित्व में नहीं लाया जा सकता। इसे कठोरता के माध्यम से अर्जित करना होगा।

यह ढाँचा जानबूझकर उस उद्योग के लिए असहज है जो तैयारी के प्रॉक्सी के रूप में लीडरबोर्ड परिणामों का आदी हो चुका है। लेख का शीर्षक इस तनाव को स्पष्ट करता है—संवादात्मक चिकित्सा AI के लिए संभाव्य साक्ष्य कठिन है, लेकिन अपरिहार्य है। उस वाक्य के दोनों हिस्से मायने रखते हैं। कठिनाई वास्तविक है और इसे खारिज नहीं किया जाना चाहिए। लेकिन कठिनाई किसी आसान और कम अर्थपूर्ण विकल्प को अपनाने का कारण नहीं है।

बेंचमार्क और साक्ष्य एक समान क्यों नहीं हैं

टिप्पणी जो भेद रेखांकित करती है, वह स्थिर मूल्यांकन पर प्रदर्शन और संभाव्य रूप से एकत्र किए गए साक्ष्य के बीच है—यानी ऐसा साक्ष्य जो यह देखकर उत्पन्न होता है कि जब किसी सिस्टम का वास्तव में उपयोग किया जाता है, उस सेटिंग में जहाँ उसे काम करना है, तब क्या होता है, न कि किसी पूर्वव्यापी या अनुकरणात्मक हार्नेस में।

संवादात्मक चिकित्सा AI के लिए इन दोनों चीज़ों के बीच का अंतर असामान्य रूप से बड़ा है। एक संवादात्मक सिस्टम केवल किसी छवि को वर्गीकृत नहीं करता या किसी लैब मान को चिह्नित नहीं करता। यह एक आदान-प्रदान में भाग लेता है। यह पूछता है, उत्तर देता है, स्पष्ट करता है, आश्वस्त करता है, और कभी-कभी मना भी कर देता है। इसका आउटपुट इस पर निर्भर करता है कि उपयोगकर्ता क्या कहता है, कैसे कहता है, कौन-सा संदर्भ देता है, और क्या छोड़ देता है। इनमें से कुछ भी किसी निश्चित टेस्ट सेट द्वारा पूरी तरह कैद नहीं किया जाता, चाहे वह सेट कितनी ही सावधानी से बनाया गया हो।

टिप्पणी का तर्क यह नहीं है कि बेंचमार्क बेकार हैं। यह यह है कि बेंचमार्क स्कोर नियंत्रित परिस्थितियों में किसी मॉडल का मापन है, और नियंत्रित परिस्थितियाँ ठीक वही हैं जो क्लिनिकल देखभाल नहीं हैं। जब लेख कहता है कि विश्वास को बेंचमार्क के ज़रिए अस्तित्व में नहीं लाया जा सकता, तो यह एक श्रेणीगत त्रुटि की ओर संकेत कर रहा है: किसी संख्या को इस तरह मानना जैसे वह कोई गारंटी हो।

संभाव्य साक्ष्य उत्पन्न करना इतना कठिन क्यों है

टिप्पणी इस बात में स्पष्ट है कि कठोर रास्ता महँगा रास्ता है। संवादात्मक चिकित्सा AI के संभाव्य मूल्यांकन को वास्तव में कठिन बनाने वाले कई कारक हैं:

  • संवाद खुले-अंत वाले होते हैं। किसी निश्चित इनपुट और निश्चित अपेक्षित आउटपुट के विपरीत, एक संवाद कई दिशाओं में जा सकता है। अच्छे परिणाम को क्या माना जाए, यह परिभाषित करने के लिए ऐसे निर्णय चाहिए जो क्लिनिकल और नैतिक हों, केवल तकनीकी नहीं।
  • संदर्भ ही सब कुछ है। एक उत्तर जो किसी एक रोगी समूह, देखभाल सेटिंग या कार्यप्रवाह के लिए उपयुक्त है, किसी अन्य में अनुपयुक्त हो सकता है। एक संदर्भ में एकत्र किया गया साक्ष्य स्वतः दूसरे में स्थानांतरित नहीं होता।
  • वास्तविक दुनिया में तैनाती चरों को शामिल करती है। मानव उपयोगकर्ता सिस्टम के अनुकूल हो जाते हैं, उसके इर्द-गिर्द काम कर लेते हैं, या उस पर अत्यधिक भरोसा कर लेते हैं। ये व्यवहार परिणामों को आकार देते हैं और तैनाती-पूर्व परीक्षण में अधिकतर अदृश्य रहते हैं।
  • समय और लागत। संभाव्य कार्य में अधिक समय लगता है और अधिक खर्च होता है, बनिस्बत किसी मूल्यांकन स्क्रिप्ट को चलाने के। यह असमानता इसे छोड़ देने का निरंतर दबाव बनाती है।
  • बदलते लक्ष्य। सिस्टम अपडेट होते हैं, प्रॉम्प्ट संशोधित होते हैं, और मॉडल बदल दिए जाते हैं। किसी एक संस्करण से जुड़ा साक्ष्य अगले के बारे में बहुत कम बता सकता है।

इनमें से प्रत्येक एक वैध बाधा है। टिप्पणी का मुद्दा यह है कि ये हल की जाने वाली बाधाएँ हैं, स्वीकार किए जाने वाले बहाने नहीं।

तर्क का अपरिहार्य वाला आधा हिस्सा

यदि लेख के ढाँचे का पहला आधा हिस्सा कठिनाई को स्वीकार करता है, तो दूसरा आधा हिस्सा बच निकलने का रास्ता बंद कर देता है। संभाव्य साक्ष्य को अपरिहार्य बताया गया है—न आकांक्षात्मक, न सर्वोत्तम अभ्यास, न बाद के लिए कोई अच्छी-तो-हो चीज़। इसका तर्क इस बात से निकलता है कि दाँव पर क्या है।

संवादात्मक चिकित्सा AI क्लिनिकल निर्णय-निर्माण के बिंदु के करीब बैठता है, और तेज़ी से मरीज़ के और भी करीब। इसे ट्राइएज सहायक, दस्तावेज़ीकरण सहायक, मरीज़-केंद्रित सूचना स्रोत, या इनके बीच कुछ और के रूप में रखा जा सकता है। इनमें से प्रत्येक भूमिका में, गलत होने के परिणाम लोग उठाते हैं, कोई सत्यापन स्क्रिप्ट नहीं। जब विफलता का स्वरूप छूटा हुआ निदान, विलंबित रेफ़रल, या आत्मविश्वास से कहा गया लेकिन गलत उत्तर हो, तो प्रमाण का मानक डेवलपर की सुविधा से नहीं, बल्कि परिणाम से तय होना चाहिए।

टिप्पणी इसे सीधे विश्वास से जोड़ती है। इसके ढाँचे में विश्वास कोई संचार समस्या नहीं है जिसे बेहतर मार्केटिंग या मज़बूत लीडरबोर्ड स्थिति हल कर सके। यह उन परिस्थितियों में प्रदर्शित प्रदर्शन का परिणाम है जो उन परिस्थितियों से मिलती-जुलती हैं जो मायने रखती हैं। कठोरता ही एकमात्र रास्ता है, और शॉर्टकट परिणाम में दिख जाते हैं।

कठोरता वास्तव में क्या माँगती है

टिप्पणी कोई सरल चेकलिस्ट नहीं देती, लेकिन उसका तर्क किसी भी ऐसे व्यक्ति के लिए अपेक्षाओं का एक समूह इंगित करता है जो किसी संवादात्मक सिस्टम को क्लिनिकल उपयोग की ओर ले जा रहा हो:

  • वहीं मूल्यांकन करें जहाँ सिस्टम रहेगा। साक्ष्य उन सेटिंग्स, समूहों और कार्यप्रवाहों से आना चाहिए जिनमें उपकरण को संचालित होना है।
  • मापने से पहले परिणाम परिभाषित करें। क्लिनिकल रूप से अर्थपूर्ण अंत-बिंदु—न कि प्रॉक्सी मेट्रिक्स—मूल्यांकन का आधार होने चाहिए।
  • जो पाएँ, उसे रिपोर्ट करें, विफलताओं सहित। चुनिंदा रिपोर्टिंग उसी विश्वास को कमज़ोर करती है जिसे साक्ष्य बनाना चाहता है।
  • साक्ष्य को संस्करणबद्ध मानें। यदि सिस्टम बदलता है, तो साक्ष्य की पुनः जाँच होनी चाहिए, न कि उसे पुराने आधार पर आगे बढ़ा दिया जाए।
  • स्वीकार करें कि कुछ प्रश्नों में वर्षों लगते हैं। तेज़ उत्तर का अभाव, दायित्व का अभाव नहीं है।

एक साथ पढ़ने पर, ये अपेक्षाएँ एक धीमी, अधिक अनुशासित विकास संस्कृति की ओर संकेत करती हैं—ऐसी संस्कृति जिसमें किसी मॉडल को जारी करने की क्षमता, उस पर भरोसा करने के अधिकार से अलग कर दी जाती है।

चिकित्सकों के लिए इसका क्या अर्थ है

अभ्यासरत चिकित्सकों के लिए, टिप्पणी का संदेश इस बात की चेतावनी है कि इंटरफ़ेस की चमक-दमक को सत्यापन का विकल्प न बनने दिया जाए। एक संवादात्मक सिस्टम जो धाराप्रवाह, आत्मविश्वासी और विचारशील लगता है, वह योग्यता का ऐसा आभास पैदा कर सकता है जिसे अंतर्निहित साक्ष्य समर्थन न दे। लेख का तर्क यह इंगित करता है कि चिकित्सकों को पूछना चाहिए कि कौन-सा संभाव्य साक्ष्य मौजूद है, किस समूह में, और उपकरण के किस संस्करण के लिए—और उत्तरों के अभाव को प्रतीक्षा करने के कारण के रूप में मानने में सहज होना चाहिए।

डेवलपर्स और नियामकों के लिए इसका क्या अर्थ है

निर्माताओं के लिए, संदेश यह है कि संभाव्य मूल्यांकन क्लिनिकल सेटिंग्स में कारोबार करने की एक लागत है, कोई वैकल्पिक अंतिम चरण नहीं। नियामकों और स्वास्थ्य प्रणालियों के लिए, इसका निहितार्थ यह है कि मूल्यांकन ढाँचों को ऐसे सिस्टमों को समाहित करना होगा जिनका व्यवहार अंतःक्रिया से आकार लेता है, और अनुमोदन या अपनाने के निर्णय इच्छित उपयोग वातावरण के साक्ष्य पर आधारित होने चाहिए।

असहज लेकिन सही निष्कर्ष

Nature Medicine की टिप्पणी एक ऐसी स्थिति पर पहुँचती है जिससे सिद्धांत रूप में सहमत होना आसान है और व्यवहार में उसका पालन करना कठिन। यह स्वीकार करती है कि संवादात्मक चिकित्सा AI के लिए संभाव्य साक्ष्य कठिन, धीमा और महँगा है। फिर यह तर्क देती है कि इनमें से कोई भी तथ्य आवश्यकता को नहीं बदलता। क्लिनिकल AI में विश्वास को बेंचमार्क के ज़रिए अस्तित्व में नहीं लाया जा सकता; इसे कठोरता के माध्यम से अर्जित करना होगा।

यह एक कठिन मानक है। यह एकमात्र ऐसा मानक भी है जो उस तकनीक से—और उन मरीज़ों से—जो अपेक्षित है, उससे मेल खाता है जो इसका सामना करेंगे।

यह लेख Nature Medicine की रिपोर्टिंग पर आधारित है। मूल लेख पढ़ें

Originally published on nature.com