क्लिनिकल भाषा में तर्क करने के लिए प्रशिक्षित एक पैथोलॉजी मॉडल
Nature Medicine में प्रकाशित एक नया पेपर एक ऐसे पैथोलॉजी फाउंडेशन मॉडल का वर्णन करता है जिसे पूरी स्लाइड्स के स्तर पर काम करने के लिए डिज़ाइन किया गया है और साथ ही अपने आउटपुट को क्लिनिकल प्रैक्टिस में इस्तेमाल होने वाले question-and-answer reasoning के अनुरूप बनाया गया है। PRISM2 नामक इस सिस्टम को 2.3 million whole-slide images और 700,000 pathology reports से प्राप्त 14 million clinical question-answer pairs पर प्रशिक्षित किया गया था, अध्ययन के अनुसार यह पेपर 31 July को प्रकाशित हुआ।
शोधकर्ता PRISM2 को पहले के computational pathology models से आगे का कदम बताते हैं, जो मुख्यतः image patches को encode करने पर केंद्रित थे। उनके अनुसार, उन शुरुआती प्रणालियों ने इस क्षेत्र में तेज़ प्रगति को आगे बढ़ाने में मदद की, लेकिन उनकी प्रत्यक्ष clinical utility सीमित रही। PRISM2 का उद्देश्य histomorphology, यानी ऊतक छवियों में दिखाई देने वाली संरचना, को language supervision के माध्यम से व्यक्त diagnostic reasoning से जोड़कर इस अंतर को भरना है।
यह संयोजन महत्वपूर्ण है क्योंकि pathology केवल visual recognition task नहीं है। व्यवहार में, चिकित्सक whole-slide findings की व्याख्या करते हैं, उन्हें disease patterns से जोड़ते हैं, और विशिष्ट diagnostic questions के उत्तर देते हैं। लेखकों का तर्क है कि इस तरह की dialogue-style supervision generalizable representations के लिए एक scalable और clinically grounded training signal प्रदान करती है।
मॉडल को किस पर प्रशिक्षित किया गया
Abstract के अनुसार, मॉडल के multimodal training में slide-level pathology data को बड़े पैमाने की textual supervision के साथ जोड़ा गया। image side में 2.3 million whole-slide images शामिल थीं। language side में 700,000 pathology reports से उत्पन्न 14 million question-answer pairs शामिल थे। अध्ययन कहता है कि यह clinical dialogue supervision PRISM2 को visual tissue patterns को diagnostic reasoning से जोड़ने देती है, केवल labels से नहीं।
लेखकों के अनुसार, इसका परिणाम एक ऐसा मॉडल है जो उपयोग के दो अलग-अलग तरीकों का समर्थन करता है। एक है prompt-based inference, जहाँ मॉडल task-specific prompts का सीधे उत्तर दे सकता है। दूसरा है transferable embeddings का स्रोत, जिन्हें classification, biomarker work, और survival analysis जैसे downstream tasks में इस्तेमाल किया जा सकता है।
यह dual-use design pathology workflows के लिए महत्वपूर्ण है क्योंकि यह क्षेत्र narrowly defined clinical products और research settings दोनों को समेटता है, जहाँ टीमों को single-purpose classifier के बजाय एक reusable representation layer चाहिए हो सकती है।
पेपर में PRISM2 का प्रदर्शन
पेपर रिपोर्ट करता है कि prompt-based inference के साथ PRISM2 ने prostate, breast, और breast lymph node में cancer detection के लिए calibrated clinical-grade products की balanced accuracy के बराबर या उससे अधिक प्रदर्शन किया, और यह सांख्यिकीय रूप से महत्वपूर्ण था, P < 0.05 पर। यह अध्ययन के सबसे स्पष्ट व्यावहारिक दावों में से एक है क्योंकि यह मॉडल की तुलना उन प्रणालियों से करता है जो केवल research baselines के बजाय clinical-grade detection के लिए बनाई गई हैं।
लेखक यह भी रिपोर्ट करते हैं कि linear probing के साथ मूल्यांकन करने पर diagnostic, biomarker, और survival benchmarks की पूरी श्रृंखला में PRISM2 embeddings ने कभी भी पहले के foundation models से सांख्यिकीय रूप से कम प्रदर्शन नहीं किया, वह भी P < 0.05 पर। दूसरे शब्दों में, abstract में वर्णित benchmark set में मॉडल ने लगातार prior foundation-model representation quality के बराबर या उससे बेहतर प्रदर्शन किया, किसी एक domain में लाभ पाने के लिए दूसरे में प्रदर्शन का त्याग किए बिना।
एक तीसरा परिणाम fine-tuning efficiency की ओर इशारा करता है। अध्ययन कहता है कि survival prediction पर task-specific fine-tuning ने उसी बड़े survival dataset पर training from scratch से बेहतर प्रदर्शन किया। यह संकेत देता है कि pretraining procedure केवल broad-purpose features नहीं बना रहा, बल्कि specialized follow-on tasks के लिए एक मजबूत आधार भी तैयार कर रहा है।
यह पेपर क्यों अलग दिखता है
training corpus का पैमाना इस अध्ययन के ध्यान खींचने के कारणों में से एक है। दूसरा कारण यह है कि यह language को visual pathology data और clinical practice के बीच एक bridge के रूप में प्रस्तुत करता है। चिकित्सा में कई foundation-model प्रयास scale पर केंद्रित रहे हैं, लेकिन यह पेपर तर्क देता है कि यदि supervision signal उस तरीके को प्रतिबिंबित नहीं करता जिसमें pathology निर्णय वास्तव में लिए और संप्रेषित किए जाते हैं, तो केवल scale पर्याप्त नहीं है।
clinical dialogue पर जोर देकर, शोधकर्ता मॉडल को prompt-based tasks के लिए अधिक उपयोगी और workflow terms में अधिक interpretable बनाने की कोशिश कर रहे हैं, भले ही abstract पूर्ण explainability या स्वतंत्र clinical deployment का दावा नहीं करता। इसके बजाय, अध्ययन एक ऐसे मॉडल को प्रस्तुत करता है जो diagnostic reasoning में grounded है और pathology tasks की कई श्रेणियों में transfer कर सकता है।
यह अंतर एक ऐसे क्षेत्र में महत्वपूर्ण है जहाँ whole-slide imaging अत्यंत बड़े और information-dense inputs उत्पन्न करता है। एक मॉडल जो केवल local patches के माध्यम से नहीं बल्कि slide level पर reasoning कर सकता है, बेहतर स्थिति में हो सकता है broader structural context, tissue relationships, और disease patterns को पकड़ने के लिए, जो diagnosis और prognosis में महत्वपूर्ण होते हैं।
आगे यह कहाँ मायने रख सकता है
पेपर के abstract की सीमाओं के भीतर, PRISM2 research tooling और clinically relevant model development के बीच एक व्यापक मध्यभूमि के लिए लक्षित प्रतीत होता है। reported evaluations cancer detection, diagnostic benchmarks, biomarker benchmarks, और survival benchmarks को कवर करते हैं, जो दर्शाता है कि लेखक इस प्रणाली को narrowly tuned product के बजाय एक general pathology representation model के रूप में स्थापित कर रहे हैं।
इसका अर्थ यह नहीं कि पेपर अस्पतालों में तत्काल routine use का दावा करता है। abstract comparative performance, representation quality, और fine-tuning benefits पर केंद्रित है। लेकिन यह कार्य उल्लेखनीय है क्योंकि यह pathology AI की अगली पीढ़ी के लिए एक विशिष्ट recipe का समर्थन करता है: बहुत बड़े slide datasets पर प्रशिक्षण, clinically meaningful language के साथ supervision, और direct prompting तथा downstream adaptation दोनों पर मूल्यांकन।
यदि यह recipe पेपर में वर्णित benchmarks से आगे भी robust साबित होती है, तो यह भविष्य के pathology models के निर्माण के तरीके को प्रभावित कर सकती है, खासकर उन applications के लिए जिन्हें visual evidence को question-driven medical reasoning से जोड़ना होता है।
अध्ययन के मुख्य बिंदु
- PRISM2 को 2.3 million whole-slide images पर प्रशिक्षित किया गया।
- language supervision में 700,000 pathology reports से प्राप्त 14 million question-answer pairs का उपयोग किया गया।
- मॉडल prompt-based inference और downstream tasks के लिए transferable embeddings दोनों का समर्थन करता है।
- पेपर prostate, breast, और breast lymph node tasks के लिए clinical-grade cancer detection products के बराबर या उनसे बेहतर प्रदर्शन की रिपोर्ट करता है।
- अध्ययन कहता है कि परीक्षण किए गए benchmark categories में PRISM2 embeddings ने कभी भी previous foundation models से सांख्यिकीय रूप से कम प्रदर्शन नहीं किया।
इसका व्यापक महत्व किसी एक benchmark जीत से कम और प्रशिक्षण रणनीति से अधिक जुड़ा है। PRISM2 को इस बात के प्रमाण के रूप में प्रस्तुत किया गया है कि language-supervised pretraining pathology में human diagnostic reasoning को foundation-model performance से जोड़ सकता है। ऐसे क्षेत्र में जो उन systems की तलाश में है जो clinical relevance खोए बिना tasks के बीच generalize कर सकें, यह एक महत्वपूर्ण बदलाव है।
यह लेख Nature Medicine की रिपोर्टिंग पर आधारित है। मूल लेख पढ़ें.
Originally published on nature.com




