Explainable AI সবার ওপর একইভাবে প্রভাব ফেলেনি
Nature Medicine-এ প্রকাশিত একটি নতুন গবেষণা জানায়, explainable AI চর্মরোগ নির্ণয়ে সহায়তা উন্নত করতে পারে, তবে এর সুবিধা অনেকটাই নির্ভর করে কে এটি ব্যবহার করছে এবং AI-এর উত্তর কখন দেখানো হচ্ছে তার ওপর। 623 জন সাধারণ মানুষ এবং 153 জন প্রাথমিক সেবাদানকারী চিকিৎসককে নিয়ে দুটি বড় পরীক্ষায় গবেষকেরা দেখেন, ন্যায্যতা-সীমাবদ্ধ AI মডেলের সহায়তা সামগ্রিক নির্ণয়-সঠিকতা বাড়ায় এবং ত্বকের রঙভেদে পারফরম্যান্সের বৈষম্য কমায়। কিন্তু সেই ব্যবস্থার ওপর তৈরি ব্যাখ্যামূলক স্তরটি অ-দক্ষ ব্যবহারকারী ও চিকিৎসকদের ওপর সম্পূর্ণ ভিন্ন প্রভাব ফেলে।
এই গবেষণার মূল ফলাফল explainable AI-র সরল সমর্থন নয়, বরং এর অসম প্রভাব নিয়ে একটি সতর্কবার্তা। সাধারণ ব্যবহারকারীরা automation bias-এর প্রতি বেশি ঝুঁকিপূর্ণ হয়ে পড়েন: AI নির্ণয় সঠিক হলে তাদের পারফরম্যান্স উন্নত হয়, কিন্তু সিস্টেম ভুল হলে তাদের পারফরম্যান্স কমে যায়। বিপরীতে, প্রাথমিক সেবাদানকারী চিকিৎসকেরা তুলনামূলকভাবে বেশি স্থিতিশীল ছিলেন। গবেষণাটি বলছে, AI-এর নির্ণয় ঠিক হোক বা ভুল, তারা উভয় ক্ষেত্রেই লাভবান হয়েছেন, যা ইঙ্গিত করে যে অভিজ্ঞতা ব্যাখ্যাগুলো কীভাবে ব্যাখ্যা ও মূল্যায়ন করা হয়েছে তা বদলে দিয়েছে।
এই ফলাফল গুরুত্বপূর্ণ, কারণ চিকিৎসা-সংক্রান্ত AI এখন একসঙ্গে দুই ধরনের ভিন্ন শ্রোতাকে লক্ষ্য করছে। একদিকে আছেন পেশাগত পরিবেশে সফটওয়্যার ব্যবহার করা চিকিৎসকেরা। অন্যদিকে আছেন সাধারণ মানুষ, যারা এখন AI-চালিত উপসর্গ যাচাইকারী, ছবি বিশ্লেষক, এবং বড় ভাষা মডেল ইন্টারফেসের মুখোমুখি হচ্ছেন। এই দুটি প্রেক্ষাপটকে একে অপরের বিকল্প হিসেবে দেখা উচিত নয় বলে এই গবেষণা ইঙ্গিত দেয়।
ন্যায্যতা-সীমাবদ্ধ মডেল ভিত্তিগত পারফরম্যান্স উন্নত করেছে
গবেষকেরা পরীক্ষাগুলো এমন একটি চর্মরোগ AI সিস্টেমকে ঘিরে তৈরি করেন, যা ত্বকের রঙভেদে পারফরম্যান্সের ভারসাম্য রাখতে ন্যায্যতা-সীমাবদ্ধতা দিয়ে প্রশিক্ষিত ছিল। এই নকশাগত সিদ্ধান্ত চিকিৎসা-চিত্রভিত্তিক AI-এর অন্যতম স্থায়ী উদ্বেগকে মোকাবিলা করে: প্রশিক্ষণ ডেটা বা অপ্টিমাইজেশন প্রক্রিয়ায় কিছু জনগোষ্ঠীর প্রতিনিধিত্ব কম থাকলে সিস্টেম জনসংখ্যাগত গোষ্ঠীগুলোর মধ্যে অসমভাবে কাজ করতে পারে।
গবেষণার সারসংক্ষেপ অনুযায়ী, ন্যায্যতা-সীমাবদ্ধ মডেলটি সাধারণ ব্যবহারকারী ও প্রাথমিক সেবাদানকারী চিকিৎসক উভয়ের জন্যই চূড়ান্ত নির্ণয়-সঠিকতা বাড়িয়েছে। এটি ত্বকের রঙ-সংক্রান্ত পারফরম্যান্স বৈষম্যও কমিয়েছে। এটি একটি গুরুত্বপূর্ণ ভিত্তিগত ফল, কারণ এটি দেখায় যে মডেল নকশার সিদ্ধান্ত কেবল গড় পারফরম্যান্সই নয়, ব্যবহারকারী ও কেসভেদে সহায়তা কীভাবে বণ্টিত হয় তার ন্যায্যতাকেও প্রভাবিত করতে পারে।
ব্যবহারিকভাবে, মডেলটি কেবল কাঁচা পূর্বাভাস দিচ্ছিল না। এটি মানব-AI সিদ্ধান্ত-প্রবাহের অংশ ছিল, যেখানে ব্যবহারকারীরা AI আউটপুট এবং কিছু ক্ষেত্রে, বহুমাত্রিক বড় ভাষা মডেল-ভিত্তিক ব্যাখ্যা দেখতেন। ফলে গবেষকেরা কেবল AI কতটা সঠিক ছিল তা নয়, বরং তার উপস্থাপনা মানবিক বিচারকে কীভাবে বদলেছে তাও অধ্যয়ন করতে পেরেছেন।
ব্যাখ্যা সাধারণ ব্যবহারকারীদের ঝুঁকি বাড়িয়েছে
Explainable AI-কে প্রায়ই black-box সিদ্ধান্ত গ্রহণের সমাধান হিসেবে উপস্থাপন করা হয়। যুক্তি হলো, ব্যবহারকারীরা যদি দেখতে পারেন সিস্টেম কেন একটি উত্তর দিয়েছে, তবে তারা সেটিকে আরও যথাযথভাবে বিশ্বাস করবেন এবং ব্যর্থ হলে তা সংশোধন করতে পারবেন। এই গবেষণা ক্রমবর্ধমান প্রমাণের সাথে যোগ করে যে সম্পর্কটি তার চেয়ে অনেক বেশি জটিল।
সাধারণ মানুষের ক্ষেত্রে, ব্যাখ্যাগুলো যেন মেশিনকে অনুসরণ করার প্রবণতা বাড়িয়েছে। সিস্টেমের নির্ণয় সঠিক হলে, সেই বাড়তি নির্ভরতা সহায়ক ছিল। সিস্টেম ভুল করলে, তা ক্ষতিকর হয়েছে। গবেষণাটি এই ধরণকে stronger automation bias হিসেবে বর্ণনা করে, অর্থাৎ ব্যাখ্যামূলক ইন্টারফেস মডেলের উপসংহারকে এমনভাবে বেশি কর্তৃত্বপূর্ণ মনে করিয়ে দিতে পারে, যদিও সেগুলো প্রশ্নবিদ্ধ হওয়া উচিত ছিল।
ভোক্তামুখী স্বাস্থ্য সরঞ্জামের জন্য এই পার্থক্য অত্যন্ত গুরুত্বপূর্ণ। একটি সুন্দরভাবে তৈরি ব্যাখ্যা স্বচ্ছতার ধারণা দিতে পারে, কিন্তু ব্যবহারকারী যে নির্দিষ্ট কেসটি দেখছেন সেখানে অন্তর্নিহিত সুপারিশটি নির্ভরযোগ্য কি না, তার নিশ্চয়তা দেয় না। একজন অ-দক্ষ ব্যবহারকারীর কাছে অতিরিক্ত বিশদ প্রকৃত বোঝাপড়া তৈরি নাও করতে পারে; বরং আস্থা তৈরি করতে পারে।
গবেষকেরা multimodal large language model ব্যাখ্যাকে সম্ভাব্য দ্বিমুখী তলোয়ার হিসেবে চিহ্নিত করেছেন। এই প্রেক্ষাপটে, কথাটি অলংকার নয়। এটি মূল নকশাগত সমস্যাটিকে ধরেছে: যে ইন্টারফেস বৈশিষ্ট্য এক ব্যবহারকারীকে একটি সুপারিশ বুঝতে সাহায্য করে, সেটিই অন্য ব্যবহারকারীকে অতিরিক্ত আস্থার দিকে ঠেলে দিতে পারে।
চিকিৎসকদের প্রতিক্রিয়া ভিন্ন ছিল
গবেষণায় থাকা প্রাথমিক সেবাদানকারী চিকিৎসকেরা একই দুর্বলতা দেখাননি। সারসংক্ষেপে বলা হয়েছে, AI মডেলের নির্ণয় ঠিক হোক বা ভুল, তারা স্থিতিশীল ছিলেন এবং লাভবান হয়েছেন। এর মানে এই নয় যে চিকিৎসকেরা প্রভাবমুক্ত ছিলেন, তবে এটি ইঙ্গিত করে যে তারা সিস্টেমের সাথে ভিন্ন জ্ঞানগত ভিত্তি থেকে যোগাযোগ করেছেন।
পেশাগত প্রশিক্ষণ সম্ভবত চিকিৎসকদের নিজেদের যুক্তির সঙ্গে মডেলের আউটপুট তুলনা করার জন্য আরও শক্তিশালী অভ্যন্তরীণ কাঠামো দিয়েছে। ব্যাখ্যাকে বিচারের বিকল্প হিসেবে গ্রহণ না করে, তারা সম্ভবত সেটিকে বৃহত্তর নির্ণয় প্রক্রিয়ার আরেকটি ইনপুট হিসেবে ব্যবহার করেছেন। গবেষণার সারসংক্ষেপ এই পার্থক্যের পেছনের সব প্রক্রিয়া স্পষ্ট করে না, তবে এই বৈপরীত্য এর নীতিগতভাবে সবচেয়ে গুরুত্বপূর্ণ ফলগুলোর একটি।
স্বাস্থ্যসেবা ব্যবস্থাগুলো প্রায়ই AI স্থাপনাকে এমনভাবে আলোচনা করে যেন একটি ইন্টারফেসই বহু ভূমিকা পালন করতে পারে। এই গবেষণা উল্টো দিক নির্দেশ করছে। চিকিৎসকদের জন্য তৈরি সরঞ্জামগুলোর জন্য সাধারণ মানুষের সরঞ্জামের তুলনায় ভিন্ন ব্যাখ্যার ধরন, আস্থার সংকেত, এবং ক্রমবিন্যাসের নিয়ম প্রয়োজন হতে পারে। একটি প্রেক্ষাপটে কার্যকর ব্যাখ্যা অন্য প্রেক্ষাপটে বিভ্রান্তিকর হতে পারে।
সময়ও গুরুত্বপূর্ণ ছিল
গবেষণায় আরও দেখা গেছে, মানব সিদ্ধান্তের আগে AI নির্ণয় দেখালে anchoring bias আরও শক্তিশালী হতে পারে। Anchoring ঘটে যখন একটি প্রাথমিক তথ্য পরবর্তী বিচারকে অসামঞ্জস্যপূর্ণভাবে প্রভাবিত করে। একটি নির্ণয়-প্রবাহে এর মানে হতে পারে, ব্যবহারকারীরা AI-এর প্রথম পরামর্শেই আটকে যান এবং বিকল্পগুলো যথেষ্ট বিবেচনা করেন না।
এই ফলাফল সফটওয়্যার নকশার ক্ষেত্রে বিশেষভাবে প্রাসঙ্গিক। এর অর্থ হলো, নিরাপত্তার প্রশ্ন শুধু ব্যাখ্যা থাকবে কি থাকবে না তা নয়, বরং পূর্বাভাস কখন দেখানো হবে এবং পারস্পরিক ক্রিয়ার ধারাবাহিকতা কীভাবে গঠন করা হবে সেটিও। এমন একটি সিস্টেম, যা AI-এর উত্তর দেখানোর আগে চিকিৎসক বা রোগীর কাছ থেকে প্রাথমিক মূল্যায়ন চায়, সেটি মেশিনের সুপারিশ দিয়ে শুরু করা সিস্টেমের তুলনায় ভিন্ন ফল দিতে পারে।
পণ্যের দৃষ্টিকোণ থেকে এমন ইন্টারফেস নির্বাচন ছোট মনে হতে পারে, কিন্তু সিদ্ধান্তের মানের ওপর এর প্রভাব বড় হতে পারে। তাই এই গবেষণা চিকিৎসা AI মূল্যায়নে একটি বড় পরিবর্তনে অবদান রাখে: কেবল পারফরম্যান্স মেট্রিক যথেষ্ট নয়। মানবিক উপাদান, কার্যপ্রবাহের ক্রম, এবং ব্যাখ্যার কাঠামো বাস্তব ফলাফলকে উল্লেখযোগ্যভাবে বদলাতে পারে।
চিকিৎসা AI প্রয়োগের তাৎপর্য
এই গবেষণা বলে না যে explainable AI পরিত্যাগ করা উচিত। বরং এর প্রমাণ আরও নির্দিষ্ট একটি দাবিকে সমর্থন করে: ব্যাখ্যা-সংক্রান্ত বৈশিষ্ট্যগুলোকে বাস্তব ব্যবহারকারী, বাস্তব কাজ, এবং বাস্তব সিদ্ধান্ত-ক্রমের প্রেক্ষাপটে পরীক্ষা করতে হবে। চর্মরোগ সহায়তায়, ন্যায্যতা-সচেতন প্রশিক্ষণ ফলাফল উন্নত করেছে, কিন্তু explainability বিশেষ করে অ-দক্ষ ব্যবহারকারীদের জন্য নতুন আচরণগত ঝুঁকি তৈরি করেছে।
এটি নিয়ন্ত্রক, হাসপাতাল, এবং ভোক্তা স্বাস্থ্য ডেভেলপারদের জন্য গুরুত্বপূর্ণ। যে সরঞ্জামগুলো নিজেদের ব্যাখ্যা করার কারণে নিরাপদ বলে মনে হয়, সেগুলোও এড়ানো সম্ভব এমন ক্ষতি করতে পারে যদি সেই ব্যাখ্যাগুলো automation bias বা anchoring বাড়ায়। বিপরীতে, যত্নসহকারে নকশা করা AI সহায়তা, যদি মডেল ও ইন্টারফেস ব্যবহারকারীর দক্ষতার সঙ্গে সামঞ্জস্যপূর্ণ হয়, তবে সঠিকতা বাড়াতে এবং বৈষম্য কমাতে পারে।
বড় ভাষা মডেল যখন চিকিৎসা-কার্যপ্রবাহে আরও গভীরে প্রবেশ করছে, এই নিবন্ধটি একটি সময়োপযোগী মনে করিয়ে দেয় যে স্বচ্ছতা স্বয়ংক্রিয়ভাবে সুরক্ষামূলক নয়। কিছু ক্ষেত্রে এটি সাহায্য করে; অন্য ক্ষেত্রে এটি বিচারকে বিকৃত করতে পারে। চিকিৎসা AI নকশার পরবর্তী পর্যায় সম্ভবত সর্বত্র ব্যাখ্যা যোগ করার চেয়ে বেশি নির্ভর করবে এই বিষয়টি চিহ্নিত করার ওপর যে কোন ব্যাখ্যাগুলো, কোন ব্যবহারকারীদের জন্য, এবং সিদ্ধান্ত প্রক্রিয়ার কোন মুহূর্তে, সত্যিই সেবার উন্নতি ঘটায়।
এই নিবন্ধটি Nature Medicine-এর প্রতিবেদনভিত্তিক। মূল নিবন্ধটি পড়ুন.
Originally published on nature.com


