सबसे समृद्ध नैदानिक विवरण अनुसंधान तक क्यों नहीं पहुंचता
इलेक्ट्रॉनिक स्वास्थ्य रिकॉर्ड में उनके कोडित क्षेत्रों की तुलना में बहुत अधिक जानकारी होती है। जैसा कि नव प्रकाशित Nature Medicine पेपर के लेखक बताते हैं, EHR डेटा का अधिकांश हिस्सा असंरचित पाठ में निहित है — स्वास्थ्य सेवा प्रदाताओं और उनके रोगियों के बीच मुलाकातों के दौरान दर्ज किया गया विवरण। ये मुलाकातें लक्षणों के विवरण, प्रतिकूल प्रभावों, उपचार के तर्क, अनुपालन की चुनौतियों, पारिवारिक इतिहास और अन्य बारीकियों को कैप्चर करती हैं जो या तो बिल्कुल कोडित नहीं हैं या निदान और प्रक्रिया कोड जैसे संरचित क्षेत्रों में केवल आंशिक रूप से परिलक्षित होती हैं।
परिणाम वास्तविक दुनिया के साक्ष्य में एक स्थायी अंधा धब्बा है। अधिकांश अध्ययन जो नियमित देखभाल से सीखने का प्रयास करते हैं, वे अभी भी संरचित डेटा क्षेत्रों पर निर्भर हैं, केवल इसलिए कि रिकॉर्ड के वे हिस्से हैं जिन्हें बड़े पैमाने पर कम्प्यूटेशनल रूप से क्वेरी किया जा सकता है। नया काम इस अंतर को पाटने के उद्देश्य से एक दृष्टिकोण प्रस्तावित करता है।
एक पाइपलाइन जो नैदानिक पाठ को गणनीय बनाती है
शोधकर्ता एक नई विधि प्रस्तुत करते हैं जो बड़े, पूर्व-प्रशिक्षित भाषा मॉडल का उपयोग करके असंरचित EHR पाठ से सटीक रूप से गणनीय नैदानिक डेटा निकालती है। महत्वपूर्ण रूप से, निष्कर्षण को एक लंबी पाइपलाइन के शुरुआती चरण के रूप में माना जाता है, न कि स्वयं में एक अंत, जिसका लक्ष्य संपूर्ण रोगी इतिहास को शुरू से अंत तक मशीन-पठनीय बनाना है।
कच्चे नोट्स से एकीकृत ज्ञान ग्राफ तक
मुक्त पाठ से नैदानिक इकाइयों को निकालने के बाद, उन्हें संरचित EHR डेटा के साथ एकीकृत किया जाता है, चिकित्सा ऑन्टोलॉजी के साथ एम्बेड किया जाता है, और एक ज्ञान ग्राफ में व्यवस्थित किया जाता है। यह वास्तुकला मायने रखती है, क्योंकि यह चरों के बीच संबंधों को संरक्षित करती है, बजाय उन्हें असंबद्ध क्षेत्रों में सपाट करने के।
- असंरचित नोट पाठ से बड़े पूर्व-प्रशिक्षित भाषा मॉडल का उपयोग करके नैदानिक इकाइयों का खनन किया जाता है।
- निकाली गई इकाइयों को उसी रोगी पर पहले से मौजूद संरचित रिकॉर्ड के साथ मिलाया जाता है।
- चिकित्सा ऑन्टोलॉजी वह अर्थपूर्ण ढांचा प्रदान करती हैं जो निकाले गए शब्दों को तुलनीय और सुसंगत बनाए रखती है।
- ज्ञान ग्राफ चरों को जोड़ता है ताकि उनके बीच किसी भी संबंध की जांच की जा सके।
चूंकि ग्राफ व्यक्तिगत रोगियों के स्तर पर और जनसंख्या के पैमाने पर भी व्यवस्थित है, एक अन्वेषक एक ही अंतर्निहित प्रतिनिधित्व का उपयोग करके किसी एक व्यक्ति की यात्रा का पता लगा सकता है या पूरे समूह में पैटर्न की जांच कर सकता है।
चिकित्सक समीक्षा सटीकता के दावों का समर्थन करती है
सटीकता को विश्वास पर नहीं छोड़ा गया। टीम ने अपने आउटपुट को चिकित्सक निर्णय के लिए प्रस्तुत किया, जिसने एक ब्लाइंडेड विशेषज्ञ संदर्भ मानक के विरुद्ध उच्च सटीकता की पुष्टि की। विशेषज्ञ चिकित्सक समीक्षकों ने उच्च अंतर-समीक्षक सहमति भी प्रदर्शित की, जो इस बात का महत्वपूर्ण संकेत है कि निकाले गए डेटा को उस मानक के विरुद्ध कितनी सुसंगतता से आंका जा सकता है।
लेखक व्यापकता के बारे में भी समान रूप से स्पष्ट हैं। ढांचे को रोग-अज्ञेय बताया गया है, और इसे किसी एक विशेषता या संकेत के लिए अनुकूलित करने के बजाय सभी नैदानिक स्थितियों में बड़े रोगी डेटासेट तक स्केल करने के लिए डिज़ाइन किया गया है।
बड़े पैमाने पर क्वेरी करना जबकि अन्वेषक नियंत्रण में रहते हैं
ज्ञान ग्राफ को उपयोगी बनाने के लिए, शोधकर्ताओं ने एक एजेंटिक-अनुकूल प्रोग्रामेटिक इंटरफ़ेस बनाया जो बड़े पैमाने के ग्राफ डेटा को नेविगेट करता है। इंटरफ़ेस का उद्देश्य विश्लेषण को तेज़, आसान और लागत-प्रभावी बनाना है, चाहे कार्य खुली-अंत की खोज हो या औपचारिक परिकल्पना परीक्षण।
उस मानव-निर्देशित क्वेरी वातावरण को श्रम-गहन काम को तेज़ करने के तरीके के रूप में प्रस्तुत किया गया है, न कि वैज्ञानिक निर्णय को बदलने के लिए। अध्ययन डिज़ाइन, विश्लेषणात्मक निर्णय और व्याख्या अन्वेषक के नियंत्रण में रहते हैं। व्यवहार में, श्रम का विभाजन स्पष्ट है: स्वचालन डेटा की पुनर्प्राप्ति और संयोजन को संभालता है, जबकि शोधकर्ता इस बात पर अधिकार बनाए रखते हैं कि कौन से प्रश्न पूछे जाते हैं और उत्तरों का क्या अर्थ है।
GLP-1 रिसेप्टर एगोनिस्ट के साथ उपयोगिता का प्रदर्शन
यह दिखाने के लिए कि ढांचे का नैदानिक मूल्य है, लेखकों ने ग्लूकागन-जैसे पेप्टाइड-1 रिसेप्टर एगोनिस्ट (GLP-1 RA) थेरेपी शुरू करने वाले व्यक्तियों के बीच उपचार प्रतिक्रियाओं का बड़े पैमाने पर अनुदैर्ध्य विश्लेषण किया। अपने दृष्टिकोण का उपयोग करते हुए, उन्होंने उच्च विश्वास के साथ इन दवाओं को शुरू करने वाले बड़ी संख्या में रोगियों की पहचान की, रोगी-स्तरीय प्रक्षेपवक्रों का पुनर्निर्माण किया, और उपचार शुरू होने के बाद वजन और हीमोग्लोबिन A1c (HbA1c) में अनुदैर्ध्य परिवर्तनों को मॉडल किया।
यह अभ्यास उस प्रकार के प्रश्न को दर्शाता है जिसका उत्तर देने के लिए पाइपलाइन बनाई गई है। GLP-1 RA का उपयोग नैदानिक दस्तावेज़ीकरण की एक लंबी श्रृंखला उत्पन्न करता है — पात्रता चर्चा, टाइट्रेशन निर्णय, सहनशीलता के मुद्दे, अनुपालन समस्याएं और अनुवर्ती माप — जिनमें से अधिकांश व्यवस्थित कोडित क्षेत्रों के बजाय कथात्मक नोट्स में रहता है। प्रत्येक रोगी के साथ वास्तव में क्या हुआ, इसका पुनर्निर्माण करना, और फिर उन व्यक्तिगत कहानियों को जनसंख्या-स्तरीय संकेत में एकत्रित करना, ठीक वही कार्य है जिसे असंरचित पाठ ने पारंपरिक रूप से कठिन बना दिया है।
इस काम के पीछे कौन है
यह पेपर एक बहुविषयक लेखक समूह का उत्पाद है: Edward Kim, Richard Foty, Avnesh S. Thakor, Jay S. Skyler, Lucy F. Robinson, James D. Park, Monica Kraft, Charles B. Cairns और Vicki Seyfert-Margolis। इसे 10 सितंबर 2026 को Nature Medicine में एक ओपन एक्सेस लेख के रूप में ऑनलाइन प्रकाशित किया गया था।
प्रारंभिक पहुंच और जो अस्थायी है
Nature Medicine ने सहकर्मी-समीक्षित, स्वीकृत शोध तक तेज़ पहुंच प्रदान करने के लिए अंतिम संस्करण से पहले पेपर साझा किया है। लेख उद्धरणीय है और इसमें एक स्थायी DOI है। फिर भी पाठकों को ध्यान देना चाहिए कि यह संस्करण आगे के संपादनों के अधीन है और इसे स्वचालित रूप से अंतिम Version of Record द्वारा प्रतिस्थापित किया जाएगा, सभी कानूनी अस्वीकरण लागू होंगे।
अपने स्वीकृत रूप में भी, योगदान को एकल अध्ययन के रूप में उतना ही समझा जाना चाहिए जितना कि बुनियादी ढांचे के रूप में। लेखक तर्क देते हैं कि भाषा-मॉडल निष्कर्षण, ऑन्टोलॉजी एम्बेडिंग और ज्ञान-ग्राफ संगठन का उनका संयोजन नैदानिक अनुसंधान में एक संरचनात्मक समस्या का समाधान करता है — नैदानिक विवरण वास्तव में कहां रहता है और विश्लेषण कहां पहुंच सकता है, के बीच का असंतुलन। मुलाकात के विवरणों को संरचित क्षेत्रों के साथ-साथ बैठने वाली गणनीय इकाइयों में परिवर्तित करके, और परिणाम को एक प्रोग्रामेटिक इंटरफ़ेस के माध्यम से उजागर करके, ढांचे का लक्ष्य एक क्लिनिक में लिखे गए कच्चे नोट और एक परीक्षण योग्य शोध प्रश्न के बीच की दूरी को कम करना है।
क्या यह वादा नैदानिक स्थितियों, नोट शैलियों और स्वास्थ्य प्रणालियों की पूरी श्रृंखला में टिकता है, यह एक ऐसा प्रश्न है जिसे वर्णित रोग-अज्ञेय डिज़ाइन निपटाने के बजाय आमंत्रित करने के लिए है। लेखक जो प्रदान करते हैं वह एक प्रतिलिपि प्रस्तुत करने योग्य मार्ग है: ब्लाइंडेड विशेषज्ञ समीक्षा के विरुद्ध निष्कर्षण को मान्य करें, निकाले गए अवधारणाओं को चिकित्सा ऑन्टोलॉजी में स्थापित करें, सब कुछ एक ग्राफ में जोड़ें, और अन्वेषकों को विज्ञान का नियंत्रण छोड़े बिना इसे क्वेरी करने दें।
यह लेख Nature Medicine की रिपोर्टिंग पर आधारित है। मूल लेख पढ़ें।
Originally published on nature.com




