ক্লিনিক্যাল ভাষায় যুক্তি করতে প্রশিক্ষিত একটি প্যাথোলজি মডেল

Nature Medicine-এ প্রকাশিত একটি নতুন পেপার এমন একটি pathology foundation model-এর বর্ণনা দেয়, যা পুরো স্লাইডের স্তরে কাজ করার জন্য তৈরি এবং একই সঙ্গে এর আউটপুটকে ক্লিনিক্যাল প্র্যাকটিসে ব্যবহৃত question-and-answer reasoning-এর ধরনগুলোর সঙ্গে সামঞ্জস্যপূর্ণ করে। PRISM2 নামে এই সিস্টেমটি 2.3 million whole-slide images এবং 700,000 pathology reports থেকে উদ্ভূত 14 million clinical question-answer pairs-এর ওপর প্রশিক্ষিত হয়েছে, জুলাই 31-এ প্রকাশিত গবেষণা অনুযায়ী।

গবেষকেরা PRISM2-কে আগের computational pathology models-এর চেয়ে এক ধাপ এগিয়ে বলে দেখিয়েছেন, যেগুলো মূলত image patches encode করার ওপর জোর দিত। তাদের ভাষ্যে, আগের সেই সিস্টেমগুলো ক্ষেত্রটিতে দ্রুত অগ্রগতিকে ত্বরান্বিত করেছিল, কিন্তু তাদের সরাসরি ক্লিনিক্যাল ব্যবহার সীমিত ছিল। PRISM2-এর উদ্দেশ্য histomorphology, অর্থাৎ tissue images-এ যা দেখা যায়, এবং language supervision-এর মাধ্যমে প্রকাশিত diagnostic reasoning-কে যুক্ত করে সেই ফাঁক পূরণ করা।

এই জোড়া গুরুত্বপূর্ণ, কারণ প্যাথোলজি শুধু একটি ভিজ্যুয়াল শনাক্তকরণের কাজ নয়। বাস্তবে, clinicians whole-slide findings ব্যাখ্যা করেন, সেগুলোকে disease patterns-এর সঙ্গে যুক্ত করেন, এবং নির্দিষ্ট diagnostic questions-এর উত্তর দেন। লেখকদের মতে, এই dialogue-style supervision সাধারণীকরণযোগ্য representations-এর জন্য একটি scalable এবং clinically grounded training signal দেয়।

মডেলটি কীসের ওপর প্রশিক্ষিত হয়েছে

Abstract অনুযায়ী, মডেলের multimodal training slide-level pathology data-কে বৃহৎ পরিসরের textual supervision-এর সঙ্গে মিলিয়েছে। image side-এ ছিল 2.3 million whole-slide images। language side-এ ছিল 700,000 pathology reports থেকে তৈরি 14 million question-answer pairs। গবেষণাটি বলে, এই clinical dialogue supervision PRISM2-কে visual tissue patterns-কে শুধু labels-এর সঙ্গে নয়, diagnostic reasoning-এর সঙ্গেও align করতে দেয়।

এর ফল, লেখকদের ভাষায়, এমন একটি মডেল যা ব্যবহারের দুটি ভিন্ন মোড সমর্থন করে। একটি হলো prompt-based inference, যেখানে মডেল task-specific prompts-এর সরাসরি উত্তর দিতে পারে। অন্যটি transferable embeddings-এর উৎস হিসেবে কাজ করা, যেগুলো classification, biomarker work, এবং survival analysis-এর মতো downstream tasks-এ ব্যবহার করা যেতে পারে।

এই dual-use design pathology workflows-এর জন্য গুরুত্বপূর্ণ, কারণ এই ক্ষেত্রটি একদিকে narrowly defined clinical products, অন্যদিকে research settings—যেখানে দলগুলো একটি single-purpose classifier-এর বদলে reusable representation layer চাইতে পারে—উভয়কেই অন্তর্ভুক্ত করে।

পেপারে PRISM2 কীভাবে পারফর্ম করেছে

পেপারটি জানায়, prompt-based inference-এর ক্ষেত্রে PRISM2 prostate, breast, এবং breast lymph node-এ cancer detection-এর জন্য clinical-grade products-এর balanced accuracy-এর সমান বা তার চেয়ে বেশি অর্জন করেছে, এবং এটি P < 0.05-এ statistically significant। এটি গবেষণাটির সবচেয়ে স্পষ্ট ব্যবহারিক দাবি, কারণ এটি মডেলটিকে কেবল research baselines-এর সঙ্গে নয়, clinical-grade detection-এর জন্য তৈরি systems-এর সঙ্গেও তুলনা করে।

লেখকেরা আরও জানান যে comprehensive diagnostic, biomarker, এবং survival benchmarks-এ linear probing দিয়ে মূল্যায়নের সময় PRISM2 embeddings আগের foundation models-এর চেয়ে statisticalভাবে কখনও পিছিয়ে পড়েনি। অর্থাৎ, abstract-এ বর্ণিত benchmark set জুড়ে মডেলটি ধারাবাহিকভাবে previous foundation-model representation quality-এর সমান বা তার চেয়ে ভালো ছিল, কোনো একটি domain-এ পারফরম্যান্স ত্যাগ করে অন্যটিতে লাভ নেওয়ার বদলে।

একটি তৃতীয় ফলাফল fine-tuning efficiency-এর দিকে ইঙ্গিত করে। গবেষণাটি বলে, survival prediction-এর জন্য task-specific fine-tuning একই বড় survival dataset-এ from scratch training-এর চেয়ে ভালো করেছে। এটি দেখায় যে pretraining শুধু broad-purpose features তৈরি করছে না, বরং বিশেষায়িত follow-on tasks-এর জন্যও একটি শক্ত ভিত্তি তৈরি করছে।

কেন এই পেপারটি আলাদা

training corpus-এর স্কেল এই গবেষণাকে নজর কাড়ার একটি কারণ। আরেকটি কারণ হলো, এটি visual pathology data এবং ক্লিনিক্যাল প্র্যাকটিসের মধ্যে ভাষাকে কীভাবে bridge হিসেবে দেখাচ্ছে। চিকিৎসাবিজ্ঞানে অনেক foundation-model প্রচেষ্টা scale-এর ওপর জোর দিয়েছে, কিন্তু এই পেপার বলছে, supervision signal যদি প্যাথোলজি সিদ্ধান্ত কীভাবে সত্যিই নেওয়া ও যোগাযোগ করা হয় তা প্রতিফলিত না করে, তাহলে scale alone যথেষ্ট নয়।

clinical dialogue-কে গুরুত্ব দিয়ে গবেষকেরা কার্যত মডেলটিকে prompt-based tasks-এর জন্য আরও কার্যকর এবং workflow-এর দিক থেকে আরও interpretable করতে চাইছেন, যদিও abstract পূর্ণ explainability বা স্বাধীন clinical deployment দাবি করে না। বরং গবেষণাটি এমন একটি মডেল উপস্থাপন করে যা diagnostic reasoning-এ ভিত্তিশীল এবং বিভিন্ন pathology tasks-এ transfer করতে পারে।

whole-slide imaging অত্যন্ত বড় এবং তথ্যসমৃদ্ধ inputs তৈরি করে এমন একটি ক্ষেত্রে এই পার্থক্য গুরুত্বপূর্ণ। একটি মডেল যা শুধুমাত্র local patches নয়, slide level-এ reasoning করতে পারে, তা diagnosis এবং prognosis-এ গুরুত্বপূর্ণ broader structural context, tissue relationships, এবং disease patterns ধরতে বেশি সক্ষম হতে পারে।

পরবর্তী পর্যায়ে এটি কোথায় গুরুত্বপূর্ণ হতে পারে

paper-এর abstract-এর সীমার মধ্যে, PRISM2 research tooling এবং clinically relevant model development-এর মধ্যে একটি বিস্তৃত মধ্যভাগ লক্ষ্য করছে বলে মনে হয়। reported evaluations cancer detection, diagnostic benchmarks, biomarker benchmarks, এবং survival benchmarks-কে অন্তর্ভুক্ত করে, যা ইঙ্গিত করে লেখকেরা সিস্টেমটিকে একটি general pathology representation model হিসেবে স্থাপন করছেন, কোনো narrowly tuned product হিসেবে নয়।

এর মানে এই নয় যে পেপারটি হাসপাতালগুলোতে তাৎক্ষণিক নিয়মিত ব্যবহারের দাবি করছে। abstract comparative performance, representation quality, এবং fine-tuning benefits-এর ওপর জোর দেয়। কিন্তু কাজটি উল্লেখযোগ্য, কারণ এটি pathology AI-এর পরবর্তী প্রজন্মের জন্য একটি নির্দিষ্ট recipe-এর পক্ষে যুক্তি দেয়: খুব বড় slide datasets-এ প্রশিক্ষণ, clinically meaningful language দিয়ে supervision, এবং direct prompting ও downstream adaptation—দুটিতেই evaluation।

যদি সেই recipe পেপারে বর্ণিত benchmarks-এর বাইরেও স্থায়ী প্রমাণিত হয়, তবে ভবিষ্যতের pathology models কীভাবে তৈরি হবে তা প্রভাবিত করতে পারে, বিশেষ করে এমন applications-এ যেখানে visual evidence-কে question-driven medical reasoning-এর সঙ্গে সংযোগ করতে হয়।

গবেষণার মূল পয়েন্ট

  • PRISM2-কে 2.3 million whole-slide images-এর ওপর প্রশিক্ষিত করা হয়েছে।
  • language supervision-এ 700,000 pathology reports থেকে উদ্ভূত 14 million question-answer pairs ব্যবহার করা হয়েছে।
  • মডেলটি prompt-based inference এবং downstream tasks-এর জন্য transferable embeddings উভয়ই সমর্থন করে।
  • পেপারটি prostate, breast, এবং breast lymph node tasks-এর জন্য clinical-grade cancer detection products-এর সমান বা তার চেয়ে ভালো পারফরম্যান্স রিপোর্ট করে।
  • গবেষণাটি জানায়, পরীক্ষিত benchmark categories জুড়ে PRISM2 embeddings আগের foundation models-এর চেয়ে statisticalভাবে কখনও কম পারফর্ম করেনি।

বিস্তৃত গুরুত্ব কোনো একক benchmark জয়ের চেয়েও বেশি, training strategy-তেই বেশি নিহিত। PRISM2-কে প্রমাণ হিসেবে উপস্থাপন করা হয়েছে যে language-supervised pretraining মানব diagnostic reasoning-কে pathology-তে foundation-model performance-এর সঙ্গে যুক্ত করতে পারে। এমন একটি ক্ষেত্রে, যা clinical relevance না হারিয়ে tasks জুড়ে generalize করতে পারে এমন systems খুঁজছে, এটি একটি অর্থপূর্ণ পরিবর্তন।

এই নিবন্ধটি Nature Medicine-এর প্রতিবেদনভিত্তিক। মূল নিবন্ধটি পড়ুন.

Originally published on nature.com