ক্লিনিক্যাল সেটিংসে এআই বেঞ্চমার্কিং নিয়ে বিতর্ক

নেচার মেডিসিনে প্রকাশিত একটি নতুন প্রতিক্রিয়া চিকিৎসায় কৃত্রিম বুদ্ধিমত্তা সিস্টেমের তুলনা করার পদ্ধতির কেন্দ্রবিন্দুতে আঘাত করেছে। প্রতিক্রিয়াটি একটি সমালোচনার জবাবে দেওয়া হয়েছে যা দাবি করে যে "সীমিত বেঞ্চমার্ক একটি সাধারণ-উদ্দেশ্য বনাম ক্লিনিক্যাল এআই তুলনার সিদ্ধান্তকে সীমাবদ্ধ করে।" যেহেতু বিস্তৃত কথোপকথনমূলক মডেল এবং সংকীর্ণভাবে প্রশিক্ষিত ক্লিনিক্যাল এআই উভয়ের ব্যবহার বৃদ্ধি পাচ্ছে, এই বিরোধ আরও শক্তিশালী মূল্যায়ন কাঠামোর জন্য একটি জরুরি বৈজ্ঞানিক প্রয়োজনীয়তার ইঙ্গিত দেয়।

বৈজ্ঞানিক চিঠিপত্র প্রমাণ পরিশোধনের একটি মানক প্রক্রিয়া, এবং এই বিশেষ বিনিময়টি গুরুত্বপূর্ণ কারণ এটি এমন একটি প্রশ্নকে সম্বোধন করে যা লক্ষ লক্ষ রোগীকে প্রভাবিত করবে: হাসপাতালগুলির কি সাধারণ-উদ্দেশ্য এআই সহায়ক বা বিশেষায়িত ক্লিনিক্যাল এআই মডেল স্থাপন করা উচিত, যখন উভয়ই চিকিত্সকদের সমর্থন করার দাবি করে? প্রতিক্রিয়ার লেখকরা তাদের মূল বিশ্লেষণকে রক্ষা করেছেন, স্বীকার করে যে বেঞ্চমার্ক নির্বাচন অনিবার্যভাবে ফলাফলকে আকার দেয়।

সাধারণ-উদ্দেশ্য এআই বনাম ক্লিনিক্যাল এআই: কী তুলনা করা হচ্ছিল?

সাধারণ-উদ্দেশ্য এআই সিস্টেম, ইন্টারনেট-স্কেল কর্পোরায় প্রশিক্ষিত বৃহৎ ভাষা মডেল সহ, বিভিন্ন মেডিকেল প্রশ্নের জন্য নমনীয় সহায়তার প্রতিশ্রুতি দেয়। তারা রোগীর ইতিহাস সংক্ষিপ্ত করতে, ডিসচার্জ চিঠি খসড়া করতে, বা মেডিকেল পরীক্ষার প্রশ্নের উত্তর দিতে পারে আশ্চর্যজনক সাবলীলতার সাথে। অন্যদিকে, ক্লিনিক্যাল এআই মডেলগুলি মেডিকেল ডেটা ব্যবহার করে বিকাশ এবং বৈধতা দেওয়া হয়, প্রায়শই ডায়াবেটিক রেটিনোপ্যাথি সনাক্তকরণ, বুকের এক্স-রে ব্যাখ্যা, বা সেপসিস চিকিত্সা নির্দেশনার মতো কাজের জন্য নির্দিষ্ট নিয়ন্ত্রক অনুমোদন থাকে।

তুলনামূলক অধ্যয়নগুলির লক্ষ্য নির্ধারণ করা যে একটি একক বহুমুখী মডেলের সুবিধা একটি নির্দিষ্ট কাজের সিস্টেমের সম্ভাব্য উচ্চ নির্ভুলতার চেয়ে বেশি কিনা। মূল গবেষণাটি ব্যবহারকারী-মুখী কাজের একটি সেট নির্বাচন করে এবং একই ইনপুটগুলিতে উভয় ধরণের মডেলকে বেঞ্চমার্ক করে এই প্রশ্নের উত্তর দেওয়ার চেষ্টা করেছিল।

কেন বেঞ্চমার্কগুলিকে "সীমিত" বলা হয়েছিল

নতুন প্রতিক্রিয়ার জন্ম দেওয়া ভাষ্য অনুসারে, মূল অধ্যয়নের বেঞ্চমার্কগুলি অল্প সংখ্যক মেডিকেল ডেটাসেট থেকে নেওয়া হয়েছিল এবং বাস্তব-বিশ্বের ক্লিনিক্যাল এনকাউন্টারের বিস্তৃত পরিসরের প্রতিনিধিত্ব নাও করতে পারে। ভাষ্যের লেখকরা উদ্বিগ্ন ছিলেন যে কয়েকটি বহুল ব্যবহৃত পরীক্ষা অন্যান্য মেডিকেল বিশেষত্বে একটি মডেলের সীমাবদ্ধতাগুলিকে অস্পষ্ট করতে পারে—বা একটি মডেলকে পুরস্কৃত করতে পারে যা একটি ডেটাসেটে ভাল পারফর্ম করে কিন্তু অন্যগুলিতে ব্যর্থ হয়।

বেঞ্চমার্ক সীমাবদ্ধতা বিভিন্ন কারণে গুরুত্বপূর্ণ। প্রথমত, একটি ডেটাসেটে একটি মডেলের কর্মক্ষমতা ক্লিনিকে তার কর্মক্ষমতার মতো নয়। মানবিক কারণ, ডেটা বিতরণ পরিবর্তন, শব্দ, এবং কেসের মিশ্রণ সব ছবি পরিবর্তন করে। দ্বিতীয়ত, অনেক পাবলিক বেঞ্চমার্ক স্যাচুরেটেড—আধুনিক মডেলগুলি তাদের ছাড়িয়ে যেতে পারে, সেরাটিকে কেবল পর্যাপ্ত থেকে আলাদা করার জন্য সামান্য জায়গা রেখে। তৃতীয়ত,稀疏 বেঞ্চমার্কিং সাধারণ-উদ্দেশ্য মডেলগুলির উপর অতিরিক্ত আত্মবিশ্বাসের দিকে নিয়ে যেতে পারে যা ক্লিনিক্যাল অর্থে সত্যিই "সাধারণভাবে বুদ্ধিমান" নয়।

প্রতিক্রিয়াটি কী যুক্তি দেয়

তাদের প্রকাশিত প্রতিক্রিয়ায়, গবেষকরা কেন্দ্রীয় সিদ্ধান্তের পক্ষে দাঁড়িয়েছেন যে মডেল শ্রেণীগুলির মধ্যে একটি যত্নশীল তুলনা এখনও তথ্যপূর্ণ হতে পারে। তারা উল্লেখ করেছেন যে যদিও কোনও বেঞ্চমার্ক সেট ব্যাপক নয়, একটি সঠিকভাবে নির্বাচিত কাজের সেট অর্থপূর্ণ পার্থক্য এবং ট্রেড-অফ প্রকাশ করতে পারে। একটি বেঞ্চমার্ক যা দেখায় যে একটি ক্লিনিক্যাল মডেল তিনটি সংকীর্ণ কাজে আধিপত্য বিস্তার করে, উদাহরণস্বরূপ, একটি উন্মুক্ত প্রশ্নের জন্য কী ঘটবে তা আমাদের বলে না, ঠিক যেমন একটি সাধারণ-উদ্দেশ্য মডেল একটি ট্রিভিয়া পরীক্ষায় জেতা প্রমাণ করে না যে এটি জরুরি বিভাগের জন্য প্রস্তুত।

প্রতিক্রিয়াটি নিশ্চিত করে যে লক্ষ্য ছিল সামগ্রিক বিজয়ী মুকুট পরানো নয় বরং প্রতিটি পদ্ধতির শক্তি এবং দুর্বলতাগুলি ম্যাপ করা। যখন একটি সাধারণ-উদ্দেশ্য মডেল ডোমেন-নির্দিষ্ট জ্ঞানের প্রয়োজন এমন কাজগুলিতে খারাপ পারফর্ম করে, এটি বিকাশকারীদের জন্য একটি দরকারী সংকেত। যখন একটি ক্লিনিক্যাল মডেল আরও সাধারণ প্রশ্নের উত্তর দিতে ব্যর্থ হয়, সেটিও ভবিষ্যতের প্রশিক্ষণের অগ্রাধিকারের জন্য মূল্যবান।

বেঞ্চমার্ক যুদ্ধের বাইরে

এই বিনিময়ের গভীর অনুরণন স্বাস্থ্যের জন্য এআই যাচাই করার বিস্তৃত বৈজ্ঞানিক প্রচেষ্টার মধ্যে নিহিত। ক্রমবর্ধমান স্বীকৃতি রয়েছে যে কোনও একক ফলাফল, পরিসংখ্যানগতভাবে তাৎপর্যপূর্ণ হলেও, প্রমাণ করতে পারে না যে একটি মডেল সমস্ত প্রসঙ্গে নিরাপদ এবং নির্ভরযোগ্য। প্রমাণ অবশ্যই ক্রমবর্ধমান হতে হবে। তুলনাগুলির জন্য একাধিক স্তরের মূল্যায়ন প্রয়োজন, যার মধ্যে নির্ভুলতা, ন্যায্যতা, ব্যাখ্যাযোগ্যতা, বিতরণ পরিবর্তনের প্রতি দৃঢ়তা এবং ক্লিনিক্যাল কর্মপ্রবাহ এবং ফলাফলের উপর প্রভাব অন্তর্ভুক্ত।

লেখকদের প্রতিক্রিয়া সম্প্রদায়কে এগিয়ে নিয়ে যায় যে "ক্লিনিক্যাল এআই বনাম সাধারণ এআই" ফ্রেমিংকে হয়/অথবা বাণিজ্য হিসাবে বিবেচনা করা উচিত নয়। সিস্টেম বিকাশকে পরিবর্তে একটি ধারাবাহিকতা হিসাবে দেখা যেতে পারে, যেখানে সাধারণবাদী এবং বিশেষজ্ঞ মডেল সহযোগিতা করে: একটি বৃহৎ ভাষা মডেল কথোপকথনের সূক্ষ্মতা পরিচালনা করে যখন একটি বিশেষায়িত গভীর দৃষ্টি মডেল পিক্সেল-বাই-পিক্সেল ইমেজিং পড়ে।

স্বাস্থ্যসেবা সিদ্ধান্ত গ্রহণকারীদের জন্য পরিণতি

মূল কাগজ এবং পরবর্তী চিঠিপত্র পড়া স্বাস্থ্যসেবা সংস্থাগুলি কী পদক্ষেপ নিতে হবে তা ভাবতে পারে। পাঠ হল প্রমাণ-প্রথম মানসিকতা গ্রহণ করা। কোনও মডেলকে ক্লিনিক্যাল পথে অন্তর্ভুক্ত করার আগে সঠিক বেঞ্চমার্ক কাজ, রোগীর জনসংখ্যা, লেবেলের গুণমান এবং বাহ্যিক বৈধতার পরিমাণ পরীক্ষা করা অপরিহার্য।

নিয়ন্ত্রকরা এই ধরণের তুলনাগুলি সাবধানে দেখতে শুরু করেছেন। মার্কিন খাদ্য ও ওষুধ প্রশাসন ক্রমবর্ধমানভাবে সফ্টওয়্যার যা শেখে তার জন্য একটি "পূর্বনির্ধারিত পরিবর্তন নিয়ন্ত্রণ পরিকল্পনা" ধারণাটি গ্রহণ করেছে, তবে মেডিকেল এআই-এর জন্য ক্রস-বিক্রেতা বেঞ্চমার্কের একটি মানক সেট এখনও তার অভাব রয়েছে। ইউরোপে, মেডিকেল ডিভাইস রেগুলেশনের জন্য সফ্টওয়্যার যা স্বাস্থ্যের ঝুঁকি তৈরি করতে পারে তার জন্য শক্তিশালী ক্লিনিক্যাল মূল্যায়ন প্রয়োজন। এআই বেঞ্চমার্কিংয়ের জন্য একটি স্পষ্ট, ভাগ করা কাঠামো সমস্ত স্টেকহোল্ডারকে সহায়তা করবে।

কীভাবে আরও ভাল বেঞ্চমার্ক তৈরি করবেন

তাহলে একটি ভাল বেঞ্চমার্ক কেমন দেখাবে? প্রথম এবং সর্বাগ্রে, রোগীর যত্নের বৈচিত্র্য প্রতিফলিত করতে একাধিক হাসপাতাল, ভৌগলিক অঞ্চল এবং আর্থ-সামাজিক পটভূমির কেস অন্তর্ভুক্ত করা উচিত। দ্বিতীয়ত, এটি মূল জ্ঞান, মেডিকেল যুক্তি, সুরক্ষা এবং স্পষ্টীকরণ চাওয়ার ক্ষমতা আলাদাভাবে পরীক্ষা করা উচিত। তৃতীয়ত, এআই ক্ষমতা এবং ক্লিনিক্যাল অনুশীলন বিকশিত হওয়ার সাথে সাথে এটি ক্রমাগত আপডেট করা উচিত।

একটি আদর্শ সেটআপে, বেঞ্চমার্ক কাজগুলি গতিশীল এবং প্রতিকূল হবে, যার অর্থ গবেষকরা বিশেষভাবে মডেলগুলির দুর্বলতাগুলি খুঁজে বের করার চেষ্টা করবেন। এটি মডেলগুলিকে স্থির পরীক্ষার সেটগুলিতে অতিরিক্ত ফিট হওয়া থেকে রোধ করবে, একটি অনিবার্য সমস্যা যখন একটি প্রমিত বেঞ্চমার্ক বছরের পর বছর ধরে সর্বজনীন থাকে। তবে এই জাতীয় বেঞ্চমার্ক নির্মাণ এবং রক্ষণাবেক্ষণের জন্য এআই বিকাশকারী, ক্লিনিক্যাল সোসাইটি এবং স্বাস্থ্য কর্তৃপক্ষের মধ্যে তহবিল এবং সহযোগিতা প্রয়োজন—একটি লক্ষ্য যা এখনও দূরবর্তী বলে মনে হচ্ছে।

প্রকাশিত চিঠিপত্রের বৈজ্ঞানিক মূল্য

নেচার মেডিসিনে সাম্প্রতিক আদান-প্রদান একটি অনুস্মারক হিসাবেও কাজ করে যে বিজ্ঞান সমালোচনা, প্রতিক্রিয়া এবং সংশোধনের মাধ্যমে অগ্রসর হয়। মূল ফলাফল প্রকাশ করা যাত্রার শেষ নয়; এটি বৈজ্ঞানিক সম্প্রদায়ের যাচাইয়ের জন্য একটি খোলা। পাঠকরা বেঞ্চমার্ক সীমাবদ্ধতার সাথে জড়িত থাকার বিষয়টি সর্বোচ্চ স্তরের প্রমাণের চাহিদা প্রদর্শন করে।

এই নির্দিষ্ট ক্ষেত্রে, প্রতিক্রিয়াটি কথোপকথন বন্ধ করার লক্ষ্য রাখে না। বরং, এটি প্রাথমিক তুলনার সময় করা পছন্দগুলিকে স্পষ্ট করে এবং আরও সাধারণযোগ্য সিদ্ধান্ত তৈরি করতে পারে এমন আরও কাজের আমন্ত্রণ জানায়। এই উন্মুক্ত বিনিময় উভয় অধ্যয়নের বৈধতা শক্তিশালী করে এবং জ্ঞাত ক্লিনিক্যাল সিদ্ধান্ত গ্রহণকে সমর্থন করে।

এরপর কী আসে

সাধারণ-উদ্দেশ্য এবং ক্লিনিক্যাল এআই-এর বিকাশকারীদের জন্য একইভাবে, পাঠ হল যে স্বচ্ছ প্রতিবেদন এবং শক্তিশালী মূল্যায়ন বিশ্বস্ত সরঞ্জামগুলিকে পরীক্ষামূলক প্রোটোটাইপ থেকে আলাদা করবে। গবেষকদের জন্য, চিঠিপত্রটি প্রশ্নের একটি সমৃদ্ধ এজেন্ডার দিকে নির্দেশ করে: একটি নির্দিষ্ট শৃঙ্খলায় কোন বেঞ্চমার্কগুলি কর্তৃত্বপূর্ণ হওয়া উচিত? ভাষা এবং স্বাস্থ্য ব্যবস্থা জুড়ে বেঞ্চমার্কগুলি কীভাবে সামঞ্জস্য করা যায়? বেঞ্চমার্ক ডিজাইনে সম্ভাব্য পক্ষপাত কীভাবে অন্তর্ভুক্ত করা উচিত?

প্রতিক্রিয়ার লেখকরা সঠিকভাবে যুক্তি দেন যে একটি সীমিত বেঞ্চমার্ক কোনও সিদ্ধান্তের জন্য স্বয়ংক্রিয় অযোগ্যতা নয়। তবে তাদের বিনিময় এও প্রমাণ করে কেন বেঞ্চমার্ক সীমাবদ্ধতাগুলি প্রতিটি প্রকাশনায় স্পষ্ট স্বীকৃতি পাওয়া উচিত। ওষুধে এআই-এর ব্যবহার প্রসারিত হওয়ার সাথে সাথে আমাদের আরও বেশি বিনিময়ের প্রয়োজন হবে—পুঙ্খানুপুঙ্খ, সৎ এবং রোগীর সুরক্ষার ভাগ করা লক্ষ্য দ্বারা পরিচালিত।

এই নিবন্ধটি নেচার মেডিসিনের প্রতিবেদনের উপর ভিত্তি করে তৈরি। মূল নিবন্ধটি পড়ুন।

Originally published on nature.com