দুটি ভিন্ন প্রশ্নকে ঘিরে গড়া একটি গবেষণা
Nature Medicine ২০২৬ সালের ১৩ সেপ্টেম্বর "Clinical usability of an explainable AI decision support tool and evaluation of multimodal models in NSCLC" শিরোনামে 논문টি অনলাইনে প্রকাশ করেছে। এর ভেতরের যেকোনো ফলাফলের মতোই শিরোনামের ভাষাও গুরুত্বপূর্ণ। লেখকরা একসঙ্গে দুটি কাজ করতে চেয়েছেন: মাল্টিমোডাল মডেলগুলো নন-স্মল সেল লাং ক্যান্সার কতটা ভালোভাবে সামলাতে পারে তার বেঞ্চমার্ক করা, এবং সেই ধরনের মডেলকে ঘিরে গড়া একটি সিদ্ধান্ত সহায়তা টুল নির্ভরশীল ক্লিনিশিয়ানদের জন্য সত্যিই ব্যবহারযোগ্য কি না তা পরীক্ষা করা।
এই দ্বৈত কাঠামো কাজটিকে সেইসব 논বিপত্রের ধারাবাহিক প্রবাহ থেকে আলাদা করে, যেগুলো একটি মাত্র পারফরম্যান্স সংখ্যা রিপোর্ট করেই থেমে যায়। একটি মডেল হেল্ড-আউট টেস্ট সেটে চমকপ্রদ স্কোর করতে পারে, তবুও ক্লিনিকে হতাশ করতে পারে — যদি এর আউটপুট ওয়ার্কফ্লোর খুব দেরিতে আসে, যদি ইন্টারফেস লুকিয়ে রাখে কেন একটি সুপারিশ এসেছে, বা যদি ব্যাখ্যাটি অনকোলজিস্টদের বদলে ইঞ্জিনিয়ারদের জন্য লেখা হয়। প্রকাশনার সঙ্গে থাকা সারসংক্ষেপ অনুযায়ী, লেখকদের মূল্যায়নে মাল্টিমোডাল ব্যাখ্যাযোগ্য মডেলটি এগিয়ে ছিল। ক্লিনিক্যাল ব্যবহারযোগ্যতার প্রতি স্পষ্ট আগ্রহ ইঙ্গিত দেয় যে দলটি সেই ফলাফলকে শেষ রেখা নয়, বরং সূচনা বিন্দু হিসেবে বিবেচনা করেছে।
এই প্রেক্ষাপটে "মাল্টিমোডাল" বলতে কী বোঝায়
মাল্টিমোডাল মডেল একইসঙ্গে একাধিক ধরনের ইনপুট গ্রহণ করে, একটি একক স্ক্যান বা একটি একক ল্যাব প্যানেলকে পুরো গল্প হিসেবে বিবেচনা না করে। নন-স্মল সেল লাং ক্যান্সারে প্রাসঙ্গিক ইনপুটগুলো অস্বাভাবিকভাবে বৈচিত্র্যময়। ইমেজিং স্টাডি টিউমারের আকার, অবস্থান ও বিস্তার ধারণ করে। প্যাথলজি স্লাইড ক্যান্সার কোষগুলো দেখতে কেমন এবং কতটা আক্রমণাত্মক মনে হচ্ছে তা নিয়ে টিস্যু-স্তরের বিস্তারিত তথ্য বহন করে। ক্লিনিক্যাল রেকর্ডে পারফরম্যান্স স্ট্যাটাস, ধূমপানের ইতিহাস, পূর্ববর্তী চিকিৎসা ও সহ-রোগ থাকে। মলিকুলার টেস্টিং ড্রাইভার অল্টারেশন যোগ করে, যা ক্রমবর্ধমানভাবে নির্ধারণ করে রোগীকে কোন থেরাপি দেওয়া হবে।
বছরের পর বছর ধরে এই ধারাগুলো আলাদা সিস্টেমে বাস করত এবং একজন ক্লিনিশিয়ানের মাথার ভেতরে সমন্বয় করা হত। একটি মাল্টিমোডাল মডেল সেগুলোকে একত্রিত করার চেষ্টা করে, এই ভিত্তিতে যে সমন্বয়টি এমন তথ্য বহন করে যা কোনো একক উৎস বহন করে না। অসুবিধা হলো প্রতিটি ধারার নিজস্ব মিসিংনেস প্যাটার্ন, নিজস্ব একক ও নিজস্ব নির্ভরযোগ্যতা রয়েছে। যখন একটি মডেল একসঙ্গে সবগুলো থেকে তথ্য নেয়, তখন কোন ইনপুট একটি নির্দিষ্ট আউটপুট চালিত করেছে সেই প্রশ্নের উত্তর দেওয়া কঠিন হয়ে পড়ে — এবং ঠিক এখানেই ব্যাখ্যাযোগ্যতা প্রবেশ করে।
বোনাস নয়, ক্লিনিক্যাল প্রয়োজন হিসেবে ব্যাখ্যাযোগ্যতা
একটি ব্যাখ্যাযোগ্য মডেল হলো এমন একটি মডেল যার যুক্তি কোনো ব্যাখ্যাযোগ্য রূপে মানুষের সামনে তুলে ধরা যায়। অনকোলজিতে এটি কোনো নান্দনিক পছন্দ নয়। NSCLC-তে চিকিৎসার সিদ্ধান্ত সত্যিকারের বিষক্রিয়া, সত্যিকারের খরচ ও সত্যিকারের অপরিবর্তনীয়তা বহন করে, এবং যে সুপারিশকে প্রশ্ন করা যায় না তা দায়িত্বশীলভাবে বাস্তবায়ন করা কঠিন। যখন একটি টুল একটি রোগীকে এক পথের বদলে অন্যটির প্রার্থী হিসেবে চিহ্নিত করে, তখন চিকিৎসা দলকে জানতে হয় কোন বৈশিষ্ট্যগুলো মূল্যায়নটিকে ঠেলে দিয়েছে এবং কতটা জোরে।
논বিপত্রের কাঠামো ব্যাখ্যাযোগ্যতা ও ব্যবহারযোগ্যতাকে ক্রমিক নয়, বরং সংযুক্ত সমস্যা হিসেবে বিবেচনা করে। এই জোড়া যে বিবেচনাগুলো উত্থাপন করে:
- ব্যাখ্যাগুলো ক্লিনিশিয়ানরা ইতিমধ্যে যে ভাষায় ব্যবহার করেন সেভাবে প্রকাশ করা হয় কি না, বিমূর্ত ফিচার ওয়েটের বদলে।
- টুলটি ক্লিনিশিয়ান ইতিমধ্যে যে সিদ্ধান্ত বিবেচনা করছিলেন তা স্পষ্ট করে, নাকি একটি প্রতিদ্বন্দ্বী বিচার উপস্থাপন করে যা মীমাংসা করতে হয়।
- কাগজে একই রকম দেখতে রোগীদের মধ্যে ব্যাখ্যাগুলো স্থিতিশীল থাকে কি না, যাতে আস্থা কাকতালীয় ঘটনার ওপর গড়ে না ওঠে।
- ইন্টারফেসটি সত্যিকারের টিউমার বোর্ডের গতি অনুযায়ী ফিট করে কি না, যেখানে প্রতি কেসে সময় মিনিটে মাপা হয়।
এগুলোর প্রত্যেকটি মেশিন লার্নিং প্রশ্নের মতোই একটি ব্যবহারযোগ্যতার প্রশ্ন, এবং প্রত্যেকটি এমন ধরনের বিষয় যা একটি সম্পূর্ণ রেট্রোস্পেক্টিভ অ্যাকুরেসি বেঞ্চমার্ক উত্তর দিতে পারে না।
"বৃহৎ, আন্তর্জাতিক, বাস্তব-বিশ্ব" কেন গুরুত্বপূর্ণ
গবেষণাটিকে একটি বৃহৎ আন্তর্জাতিক বাস্তব-বিশ্ব তদন্ত হিসেবে বর্ণনা করা হয়েছে। এই তিনটি বিশেষণ একসঙ্গে অনেক কাজ করে। বহু-কেন্দ্রিক ও বহু-দেশীয় ডেটা সেই ঝুঁকি কমায় যে একটি মডেল কেবল একটি হাসপাতালের সরঞ্জাম, কোডিং প্রথা বা রেফারেল প্যাটার্নের অভ্যাস শিখেছে। বাস্তব-বিশ্ব ডেটা, কঠোরভাবে কিউরেট করা ট্রায়াল কোহর্টের বিপরীতে, ক্লিনিশিয়ানরা সত্যিই যেসব রোগী দেখেন তাদের আরও বিশৃঙ্খল মিশ্রণ প্রতিফলিত করে — যাদের মধ্যে এমন রোগীও রয়েছে যারা একটি প্রস্পেক্টিভ গবেষণায় কঠোর যোগ্যতার মানদণ্ড কখনো পূরণ করতেন না।
বিনিময়টি হলো বাস্তব-বিশ্ব ডেটাসেটগুলো বেশি নয়েজি, এবং কাঁচা রেকর্ড থেকে মডেল-প্রস্তুত ইনপুট পর্যন্ত পথ খুব কমই পরিষ্কার। একটি দল সেই অনুবাদ কীভাবে সামলায় তা নির্ধারণ করে রিপোর্ট করা পারফরম্যান্স শেষ পর্যন্ত কী বোঝায়। একটি বৃহৎ আন্তর্জাতিক নমুনা নীতিগতভাবে ফলাফলগুলোকে আরও বহনযোগ্য করে তোলে, কিন্তু বহনযোগ্যতা এখনও অনুমান না করে প্রদর্শন করতে হয়।
এআই টুলগুলো সাধারণত কোথায় আটকে যায়
ক্লিনিক্যাল ব্যবহারযোগ্যতা পরীক্ষা সেই ফাঁকটি সম্বোধন করে যা একটি কাজ করা মডেল ও একটি ব্যবহৃত মডেলের মধ্যে রয়েছে। ক্লিনিক্যাল এআই জুড়ে বারবার ব্যর্থতার ধরনগুলো ভালোভাবে নথিভুক্ত: এমন অ্যালার্ট যা এত ঘন ঘন আসে যে সেগুলো খারিজ করা হয়, এমন ড্যাশবোর্ড যা স্ক্রিনে ইতিমধ্যে থাকা তথ্য নকল করে, এবং এমন আউটপুট যা সিদ্ধান্ত কার্যকরভাবে নেওয়ার পরে আসে। একটি সিদ্ধান্ত সহায়তা টুলকে ইতিমধ্যে ভিড়পূর্ণ একটি ওয়ার্কফ্লোতে নিজের জায়গা অর্জন করতে হয়।
শিরোনামে সরাসরি ক্লিনিক্যাল ব্যবহারযোগ্যতার নাম উল্লেখ করে গবেষণাটি ইঙ্গিত দেয় যে লেখকরা ডিসক্রিমিনেশন ও ক্যালিব্রেশনের বাইরে কিছু পরিমাপ করেছেন। ব্যবহারযোগ্যতার কাজ সাধারণত জিজ্ঞাসা করে ক্লিনিশিয়ানরা টুলের আউটপুট ব্যাখ্যা করতে পারেন কি না, তারা এর সঙ্গে একমত কি না, এটি তাদের ঘোষিত পরিকল্পনা পরিবর্তন করে কি না, এবং এটি তাদের ধীর করে কি না। এই পরিমাপগুলো একটি শিরোনাম সংখ্যায় সারসংক্ষেপ করা কঠিন, যা সেগুলো প্রায়ই বাদ দেওয়ার একটি কারণ।
논বিপত্রটি যে প্রশ্নগুলো খোলা রাখে
এই ধরনের একটি একক গবেষণা যা নিষ্পত্তি করতে পারে তার বাইরে বেশ কিছু বিষয় রয়েছে। রেট্রোস্পেক্টিভ ফলাফলের বিপরীতে মাপা পারফরম্যান্স উন্নত রোগীর ফলাফলের সমান নয়, এবং পরবর্তীটি প্রদর্শনের জন্য প্রস্পেক্টিভ মূল্যায়ন প্রয়োজন। ব্যাখ্যার গুণমান পরিমাপ করাও কঠিন — একটি মডেল একটি ব্যাখ্যা তৈরি করতে পারে, কিন্তু সেই ব্যাখ্যাটি যে গণনার মাধ্যমে পূর্বাভাস এসেছে তার প্রতি বিশ্বস্ত না-ও হতে পারে। এবং গ্রহণযোগ্যতা প্রাতিষ্ঠানিক কারণের ওপর নির্ভর করে, ইলেকট্রনিক রেকর্ড ইন্টিগ্রেশন থেকে শুরু করে সুপারিশ অনুসরণ করার পর ফল খারাপ হলে দায় কার ওপর বর্তাবে তা পর্যন্ত।
অনুশীলন পরিবর্তনের সঙ্গে এমন একটি টুল কেমন আচরণ করে সেই প্রশ্নও রয়েছে। নতুন এজেন্ট ও বায়োমার্কার-নির্ধারিত উপগোষ্ঠী আবির্ভূত হওয়ার সঙ্গে NSCLC-তে চিকিৎসার প্যারাডাইম দ্রুত পরিবর্তিত হয়। এক যুগের সিদ্ধান্তের ওপর প্রশিক্ষিত একটি মডেল এমন প্যাটার্ন এনকোড করতে পারে যা ক্লিনিশিয়ানরা এর মধ্যে পরিত্যাগ করেছেন।
এটি এখনই কেন প্রাসঙ্গিক
ফুসফুস ক্যান্সার সিদ্ধান্ত সহায়তার জন্য সবচেয়ে তাৎপর্যপূর্ণ ক্ষেত্রগুলোর একটি হয়ে রয়েছে, কারণ সম্ভাব্য চিকিৎসা পথের সংখ্যা প্রতিটি কেস নিয়ে ভাবার জন্য উপলব্ধ সময়ের চেয়ে দ্রুত বেড়েছে। মাল্টিমোডাল মডেল সেই যুক্তিকে সংকুচিত করার প্রতিশ্রুতি দেয়; ব্যাখ্যাযোগ্যতা ও ব্যবহারযোগ্যতা নির্ধারণ করে সংকোচনটি বিশ্বাসযোগ্য কি না। একটি উচ্চ-প্রোফাইল মাধ্যমে মডেল মূল্যায়ন ও ক্লিনিক্যাল ব্যবহারযোগ্যতা মূল্যায়নের এই সমন্বয় প্রকাশ করা একটি চিহ্ন স্থাপন করে: ক্ষেত্রটির কাছে ক্রমবর্ধমানভাবে শুধু এটাই চাওয়া হচ্ছে না যে একটি মডেল ভালোভাবে পূর্বাভাস দেয়, বরং একজন ক্লিনিশিয়ান এর সঙ্গে কাজ করতে পারেন। পরবর্তী পরীক্ষা হলো এই ধরনের টুল প্রস্পেক্টিভভাবে, যে ক্লিনিকগুলো সেগুলো ব্যবহার করবে সেখানে মোতায়েন করা হলে টিকে থাকে কি না।
এই নিবন্ধটি Nature Medicine-এর রিপোর্টিংয়ের ওপর ভিত্তি করে। মূল নিবন্ধটি পড়ুন।
Originally published on nature.com




