কৃত্রিম বুদ্ধিমত্তা দ্রুত ওষুধের ক্ষেত্রকে নতুন আকার দিচ্ছে, যেখানে বিস্তৃত সাধারণ-উদ্দেশ্য মডেল এবং অত্যন্ত বিশেষায়িত ক্লিনিকাল সিস্টেমের মধ্যে ক্রমবর্ধমান বিভাজন দেখা যাচ্ছে। ন্যাচার মেডিসিনে ৩ সেপ্টেম্বর, ২০২৬ তারিখে অনলাইনে প্রকাশিত একটি নতুন বিশ্লেষণ একটি গুরুত্বপূর্ণ সমস্যা তুলে ধরেছে: সীমিত বেঞ্চমার্ক এই দুটি পদ্ধতির মধ্যে যেকোনো সরাসরি তুলনা থেকে আঁকা সিদ্ধান্তকে সীমাবদ্ধ করে। লেখকরা সতর্কতা অবলম্বনের আহ্বান জানিয়েছেন, যুক্তি দিয়ে যে বর্তমান মূল্যায়ন কাঠামো খুব সংকীর্ণ যে কোনও ধরনের এআই বেশি কার্যকর, নিরাপদ বা ক্লিনিকের জন্য বেশি উপযুক্ত এমন বিস্তৃত দাবিকে সমর্থন করার জন্য।

স্বাস্থ্যসেবায় এআই-এর দুটি শিবির

একদিকে রয়েছে সাধারণ-উদ্দেশ্য এআই সিস্টেম — ডোমেইন জুড়ে বিস্তৃত কাজের পরিসর পরিচালনা করার জন্য ডিজাইন করা বড় মডেল। এই মডেলগুলি ক্রমবর্ধমানভাবে ফাইন-টিউনিং বা প্রম্পট ইঞ্জিনিয়ারিংয়ের মাধ্যমে চিকিৎসা ব্যবহারের জন্য অভিযোজিত হচ্ছে, যা নমনীয়তা এবং ব্যয় দক্ষতার প্রতিশ্রুতি দেয়। অন্যদিকে রয়েছে ক্লিনিকাল এআই সিস্টেম যা বিশেষভাবে স্বাস্থ্যসেবার জন্য নির্মিত: ডায়াগনস্টিক অ্যালগরিদম, ভবিষ্যদ্বাণীমূলক ঝুঁকি সরঞ্জাম, ইমেজিং ক্লাসিফায়ার এবং সিদ্ধান্ত-সমর্থন সিস্টেম যা সংকীর্ণ কিন্তু উচ্চ-স্টেকের কাজগুলিতে বৈধ।

সাধারণ-উদ্দেশ্য মডেলগুলির আবেদন তাদের সাধারণীকরণের ক্ষমতার মধ্যে নিহিত। একটি একক মডেল সম্ভাব্যভাবে রেডিওলজি চিত্র ব্যাখ্যা করতে পারে, রোগীর ইতিহাস সংক্ষিপ্ত করতে পারে, ডিফারেনশিয়াল রোগ নির্ণয়ের পরামর্শ দিতে পারে এবং রোগীর প্রশ্নের উত্তর দিতে পারে। তবুও ওষুধের নির্ভুলতা এবং সুরক্ষা দাবি করে, এই কারণেই অনেক আনুষ্ঠানিক নিয়ন্ত্রক পথে বিশেষায়িত মডেলগুলি এখনও পছন্দ করা হয়। এই দুটি মৌলিকভাবে ভিন্ন দৃষ্টান্তের তুলনা করার জন্য বেঞ্চমার্ক প্রয়োজন যা প্রকৃত ক্লিনিকাল জটিলতা প্রতিফলিত করে — এবং এখানেই নতুন বিশ্লেষণ বর্তমান প্রচেষ্টাকে ঘাটতি খুঁজে পায়।

বেঞ্চমার্ক সমস্যা

বেঞ্চমার্ক হল প্রমিত পরীক্ষা যা গবেষকদের এআই কর্মক্ষমতা পরিমাপ এবং তুলনা করতে দেয়। মেডিকেল এআই-তে, তারা প্রায়শই লেবেলযুক্ত চিত্র, ইলেকট্রনিক স্বাস্থ্য রেকর্ড বা পরীক্ষার প্রশ্ন সহ পাবলিক ডেটাসেটের রূপ নেয়। কিন্তু ন্যাচার মেডিসিন বিশ্লেষণ যুক্তি দেয় যে এই বেঞ্চমার্কগুলি সাধারণ-উদ্দেশ্য বনাম ক্লিনিকাল এআই সম্পর্কে শক্তিশালী সিদ্ধান্ত সমর্থন করার জন্য খুব সীমিত। বেশ কয়েকটি কারণ এই সীমাবদ্ধতায় অবদান রাখে:

  • সংকীর্ণ পরিধি: বেশিরভাগ বেঞ্চমার্ক একক কাজের উপর ফোকাস করে, যেমন বুকের এক্স-রেতে নিউমোনিয়া সনাক্ত করা বা চর্মরোগ সংক্রান্ত চিত্র ট্রাইজ করা, যা ক্লিনিকাল কাজের বহুমুখী প্রকৃতিকে ধরে রাখতে ব্যর্থ হয়।
  • ডেটাসেটের একজাতীয়তা: পাবলিক ডেটাসেটগুলি প্রায়শই কয়েকটি প্রতিষ্ঠান, জনসংখ্যার গোষ্ঠী বা ইমেজিং ডিভাইস থেকে নেওয়া হয়, যা যেকোনো কর্মক্ষমতা তুলনার সাধারণীকরণযোগ্যতাকে সীমাবদ্ধ করে।
  • কৃত্রিম অবস্থা: বেঞ্চমার্ক সাধারণত স্পষ্টভাবে সংজ্ঞায়িত শেষ পয়েন্ট সহ কিউরেটেড, পরিষ্কার ডেটা উপস্থাপন করে — যা দৈনন্দিন অনুশীলনে সম্মুখীন হওয়া জগাখিচুড়ি, খণ্ডিত এবং অনুদৈর্ঘ্য ডেটার সম্পূর্ণ বিপরীত।
  • অনুপস্থিত ডাউনস্ট্রিম ফলাফল: একটি মডেল একটি ডায়াগনস্টিক বেঞ্চমার্কে সফল হতে পারে তবুও রোগীর স্বাস্থ্যের ফলাফল, কর্মপ্রবাহের দক্ষতা বা ক্লিনিশিয়ানের সিদ্ধান্ত গ্রহণে কোনও পরিমাপযোগ্য উন্নতি প্রদান করতে পারে না।
  • দ্রুত অপ্রচলিততা: সাধারণ-উদ্দেশ্য মডেলগুলি ঘন ঘন আপডেট করা হয়, এবং একটি স্থির বেঞ্চমার্ক দ্রুত পুরানো হয়ে যেতে পারে, তুলনাকে সময়-সংবেদনশীল এবং পুনরুত্পাদন করা কঠিন করে তোলে।

এই সমস্যাগুলি কেবল একাডেমিক নয়। যখন সীমিত বেঞ্চমার্ক দুটি মৌলিকভাবে ভিন্ন এআই দৃষ্টান্তের তুলনা করতে ব্যবহৃত হয়, তখন শ্রেষ্ঠত্ব বা সমতা সম্পর্কে যেকোনো সিদ্ধান্ত সর্বোত্তমভাবে অস্থায়ী। সাম্প্রতিক বিশ্লেষণের লেখকরা যুক্তি দেন যে এই ধরনের সীমাবদ্ধতা সরাসরি বিস্তৃত তুলনার বৈধতার সাথে আপস করে।

কেন এটি সিদ্ধান্তকে সীমাবদ্ধ করে

ন্যাচার মেডিসিন পেপারের শিরোনাম — “সীমিত বেঞ্চমার্ক একটি সাধারণ-উদ্দেশ্য বনাম ক্লিনিকাল এআই তুলনার সিদ্ধান্তকে সীমাবদ্ধ করে” — একটি সূক্ষ্ম কিন্তু শক্তিশালী যুক্তিকে অন্তর্ভুক্ত করে: বেঞ্চমার্কের পছন্দ পর্যবেক্ষণ করা ফলাফলকে ব্যাপকভাবে নির্ধারণ করে। একটি সাধারণ-উদ্দেশ্য মডেল একটি নির্দিষ্ট প্রশ্ন-উত্তর ডেটাসেটে উৎকর্ষ করতে পারে, যখন একটি ক্লিনিকাল মডেল একটি বিশেষায়িত ডায়াগনস্টিক কাজে আরও ভাল পারফর্ম করতে পারে। একাধিক কাজ, জনসংখ্যা এবং বাস্তব-বিশ্ব সেটিংস জুড়ে বিস্তৃত একটি বিস্তৃত মূল্যায়ন কাঠামো ছাড়া, একটি পদ্ধতি স্পষ্টভাবে ভাল এই দাবিটি অসমর্থিত।

লেখকরা সম্ভবত বিস্তৃত মেশিন লার্নিং সাহিত্যে ক্রমবর্ধমান প্রমাণের দিকে ইঙ্গিত করেছেন, যেখানে বেঞ্চমার্ক ডিজাইনের পরিবর্তনগুলি মডেল র্যাঙ্কিংয়ে নাটকীয় পরিবর্তন এনেছে। মেডিকেল এআই-তেও একই অস্থিরতা স্পষ্ট। উদাহরণস্বরূপ, একটি একাডেমিক ডেটাসেটে সমতুল্য বলে মনে হয় এমন মডেলগুলি একটি ভিন্ন হাসপাতালের ডেটা বা ভিন্ন রোগের প্রাদুর্ভাব সহ জনসংখ্যার উপর পরীক্ষা করা হলে তীব্রভাবে ভিন্ন হতে পারে। বিশ্লেষণটি জোর দেয় যে সীমিত বেঞ্চমার্ক কেবল সূক্ষ্মতা বাদ দেয় না; অতিরিক্ত ব্যাখ্যা করা হলে তারা ইতিবাচকভাবে বিভ্রান্ত করতে পারে।

গবেষণা, নিয়ন্ত্রণ এবং ক্লিনিকাল গ্রহণের জন্য প্রভাব

এই সমালোচনা একটি গুরুত্বপূর্ণ মুহূর্তে এসেছে। স্বাস্থ্য ব্যবস্থাগুলি সতর্কতার সাথে রোগীর শয্যার পাশে সাধারণ-উদ্দেশ্য এআই ব্যবহারের সম্ভাবনা অন্বেষণ করছে, যখন এফডিএ-র মতো নিয়ন্ত্রক সংস্থাগুলি সম্প্রতি এআই-ভিত্তিক মেডিকেল ডিভাইসগুলির জন্য কাঠামো তৈরি করা শুরু করেছে। যদি সাধারণ-উদ্দেশ্য এবং ক্লিনিকাল এআই-এর মধ্যে তুলনা অপর্যাপ্ত প্রমাণের উপর ভিত্তি করে হয়, তবে ক্লিনিশিয়ানদের বিজ্ঞানের পরিবর্তে বিপণনের উপর ভিত্তি করে পছন্দ করতে বাধ্য করা হতে পারে।

গবেষকদের জন্য, প্রভাবটি স্পষ্ট: ক্ষেত্রটির ক্লিনিকাল ভিত্তি এবং বহুমাত্রিক নতুন বেঞ্চমার্ক প্রয়োজন। এর অর্থ স্থির চিত্র এবং পাঠ্য ডেটাসেটের বাইরে গতিশীল, সম্ভাব্য মূল্যায়নের দিকে অগ্রসর হওয়া যাতে অন্তর্ভুক্ত রয়েছে:

  • রোগ নির্ণয়, চিকিত্সা পরিকল্পনা, ডকুমেন্টেশন এবং যোগাযোগের মতো ক্লিনিকাল কর্মপ্রবাহ জুড়ে বহু-কাজের মূল্যায়ন।
  • বিভিন্ন বয়স, জাতি, কমরবিডিটি এবং স্বাস্থ্যসেবা সেটিংস প্রতিফলিত করে বিভিন্ন রোগীর জনসংখ্যা।
  • ডাউনস্ট্রিম প্রভাবের পরিমাপ, যার মধ্যে ক্লিনিশিয়ানের গ্রহণযোগ্যতা, সময় সাশ্রয়, ডায়াগনস্টিক নির্ভুলতা এবং রোগীর ফলাফল অন্তর্ভুক্ত।
  • বিরল কিন্তু গুরুত্বপূর্ণ অবস্থার অধীনে সুরক্ষা পরীক্ষা করে এমন প্রতিকূল পরীক্ষা, যেমন অস্বাভাবিক রোগের উপস্থাপনা বা বিভ্রান্তিকর ডেটা।
  • মডেল এবং ক্লিনিকাল পরিবেশ বিকশিত হওয়ার সাথে সাথে সময়ের সাথে সাথে কর্মক্ষমতা ট্র্যাক করার জন্য ক্রমাগত পর্যবেক্ষণ প্রোটোকল।

ন্যাচার মেডিসিন বিশ্লেষণ জোর দেয় যে এই ধরনের বাস্তব-বিশ্ব প্রমাণ অপরিহার্য — ঐচ্ছিক নয় — চিকিৎসা ব্যবহারের উদ্দেশ্যে যেকোনো এআই যাচাই করার জন্য। ড্রাগ ডেভেলপমেন্টে ব্যবহৃত তুলনামূলক কার্যকারিতা গবেষণা, ক্লিনিকে সাধারণ-উদ্দেশ্য এআই সত্যিই বিশেষায়িত সিস্টেমের পাশাপাশি দাঁড়াতে পারে কিনা তা প্রতিষ্ঠা করার জন্য প্রয়োজনীয় হতে পারে।

আরও শক্তিশালী মূল্যায়ন সংস্কৃতির দিকে

বেঞ্চমার্ক উন্নত করা কেবল একটি প্রযুক্তিগত প্রচেষ্টা নয়। বিভিন্ন ক্লিনিকাল প্রসঙ্গে “ভাল” দেখতে কেমন তা সংজ্ঞায়িত করতে ক্লিনিশিয়ান, ডেটা বিজ্ঞানী, নিয়ন্ত্রক সংস্থা এবং রোগীদের মধ্যে সহযোগিতা প্রয়োজন। একটি প্রতিশ্রুতিশীল দিক হল জীবন্ত বেঞ্চমার্ক তৈরি করা যা একাধিক প্রতিষ্ঠান থেকে নতুন কেস সহ ক্রমাগত আপডেট করা হয়, যা বাস্তব-বিশ্বের কর্মক্ষমতার আরও সৎ পরিমাপ প্রদান করে। আরেকটি হল সংবেদনশীল স্বাস্থ্য ডেটা কেন্দ্রীভূত না করে প্রতিষ্ঠান জুড়ে মডেল মূল্যায়ন করতে ফেডারেটেড লার্নিং ব্যবহার করা।

সমানভাবে গুরুত্বপূর্ণ হল মূল্যায়ন পদ্ধতির স্বচ্ছতা। গবেষকরা ডেটা প্রোভেন্যান্স, রোগীর জনসংখ্যা এবং ব্যর্থতা মোড বিশ্লেষণ সহ বেঞ্চমার্ক বৈশিষ্ট্যগুলির প্রমিত প্রতিবেদনের আহ্বান জানিয়েছেন। এই ধরনের প্রচেষ্টা এআই অধ্যয়নের ব্যাখ্যাকারীদের নিজেদের জন্য প্রমাণের শক্তি পরিমাপ করতে দেবে। বর্তমান কাগজটি এই লক্ষ্যে অবদান রাখে যে কীভাবে সীমিত বেঞ্চমার্ক এমনকি ভাল-উদ্দেশ্যপূর্ণ তুলনার সিদ্ধান্তকে সীমাবদ্ধ করে।

উপসংহার

সাধারণ-উদ্দেশ্য বনাম ক্লিনিকাল এআই নিয়ে আলোচনা সবেমাত্র শুরু হচ্ছে। ন্যাচার মেডিসিন বিশ্লেষণের পরামর্শ অনুসারে, বৈজ্ঞানিক সম্প্রদায়কে অবশ্যই সতর্ক থাকতে হবে যেন উত্সাহী গ্রহণ কঠোর বৈধতাকে ছাড়িয়ে না যায়। বেঞ্চমার্ক একটি প্রয়োজনীয় সরঞ্জাম, তবে তারা ক্লিনিকাল প্রমাণের বিকল্প নয়। গবেষক, বিকাশকারী এবং ক্লিনিশিয়ানদের যেকোনো তুলনামূলক দাবিকে সন্দেহের সাথে দেখা উচিত যতক্ষণ না এটি বৈচিত্র্যময়, বাস্তবসম্মত এবং ক্লিনিক্যালি অর্থপূর্ণ মূল্যায়ন দ্বারা সমর্থিত হয়।

এই বিতর্কে চূড়ান্ত বিজয়ী হবেন রোগীরা। এআই মূল্যায়নের জন্য উচ্চ মান দাবি করে, ক্ষেত্রটি নিশ্চিত করতে পারে যে যাই হোক না কেন সরঞ্জামগুলি মোতায়েন করা হোক — বিস্তৃত সাধারণ-উদ্দেশ্য মডেল বা সংকীর্ণ ক্লিনিকাল সিস্টেম — তারা প্রকৃত ওষুধের জটিল, অনিশ্চিত পরিবেশে তাদের মূল্য প্রদর্শন করেছে। নতুন কাগজের বার্তাটি সহজ: যখন বেঞ্চমার্ক সীমিত, তখন আমাদের সিদ্ধান্তও সীমিত। সামনের পথ সেই প্রমাণের ভিত্তি প্রসারিত করার উপর নির্ভর করে।

এই নিবন্ধটি ন্যাচার মেডিসিনের প্রতিবেদনের উপর ভিত্তি করে তৈরি। মূল নিবন্ধটি পড়ুন।

Originally published on nature.com