AI মডেল পরীক্ষাকে আনুষ্ঠানিক রূপ দিতে NIST-এর পদক্ষেপ

যুক্তরাষ্ট্রের ন্যাশনাল ইনস্টিটিউট অফ স্ট্যান্ডার্ডস অ্যান্ড টেকনোলজি একটি নতুন কৃত্রিম বুদ্ধিমত্তা মূল্যায়ন প্ল্যাটফর্ম চালু করেছে, যার লক্ষ্য গবেষক ও ডেভেলপারদের মডেলের কর্মক্ষমতা ও নিরাপত্তা পরীক্ষা করার জন্য আরও কাঠামোবদ্ধ উপায় দেওয়া। AI Technology Evaluation, বা AITE, নামে এই কর্মসূচি 27 জুলাই ঘোষণা করা হয় এবং এটি একটি স্বেচ্ছাসেবী টেস্টিং ব্যবস্থা হিসেবে তৈরি, যেখানে মডেলগুলো ব্লাইন্ড ডেটা ব্যবহার করে বিচ্ছিন্ন পরিবেশে মূল্যায়িত হবে।

এই উদ্যোগ গুরুত্বপূর্ণ, কারণ এটি AI শাসন ও মোতায়েনের একটি বাড়তে থাকা সমস্যাকে মোকাবিলা করে: মডেলের ক্ষমতা সম্পর্কে অনেক দাবি বিভিন্ন ল্যাব, বিক্রেতা, এবং ব্যবহারের ক্ষেত্রে তুলনা করা কঠিন। বেঞ্চমার্ক ইনফ্লেশন, অসম টেস্টিং পরিস্থিতি, এবং এমন পাবলিক ডেটাসেটের ব্যবহার, যা আগে থেকেই ট্রেনিং পাইপলাইনে শোষিত হয়ে থাকতে পারে, শিরোনামের পারফরম্যান্স সংখ্যাগুলোকে যতটা মনে হয় ততটা অর্থবহ না-ও করে তুলতে পারে।

AITE আরও নিয়ন্ত্রিত বিকল্প দিতে চায়। উৎস পাঠ অনুযায়ী, প্ল্যাটফর্মটি সাধারণ ডেটা, মেট্রিকস, এবং স্কোরিং সরবরাহ করবে, যাতে ডেভেলপাররা তাদের সিস্টেম কীভাবে কাজ করছে তা আরও ভালোভাবে বুঝতে পারেন। প্ল্যাটফর্মের মাধ্যমে সরবরাহ করা টেস্ট ডেটা ট্রেনিং ডেটা হওয়ার জন্য নয়, যা মূল্যায়নকে স্বাধীন রাখার জন্য একটি গুরুত্বপূর্ণ নকশাগত সিদ্ধান্ত।

AITE কী করার জন্য তৈরি

NIST এই সিস্টেমকে একটি বিচ্ছিন্ন টেস্টবেড হিসেবে বর্ণনা করে, যেখানে AI মডেলগুলো ব্লাইন্ড ডেটা প্রক্রিয়াকরণ করতে করতে বিভিন্ন কমান্ডের বিরুদ্ধে মূল্যায়িত হতে পারে। এই কাঠামোর উদ্দেশ্য হলো সক্ষমতা এবং নিরাপত্তা-সংক্রান্ত আচরণ উভয় ক্ষেত্রেই বস্তুনিষ্ঠ অন্তর্দৃষ্টি তৈরি করা। শুধু উন্মুক্ত, বহুল প্রচারিত বেঞ্চমার্কের ওপর নির্ভর না করে, প্ল্যাটফর্মটি এমন ডেটাসেট ব্যবহার করে যা সর্বসাধারণের জন্য উপলব্ধ নয়।

এর ব্যবহারিক প্রভাব সরল: মডেলগুলো এমন উপাদানের ভিত্তিতে বিচার পাওয়ার সম্ভাবনা কম, যা তারা আগে থেকেই দেখে থাকতে পারে, এবং গবেষকদের ফলাফল তুলনার জন্য আরও প্রতিরক্ষাযোগ্য ভিত্তি মেলে। AI মূল্যায়নে এটি একটি তাৎপর্যপূর্ণ পার্থক্য। কোনো বেঞ্চমার্ক সবচেয়ে উপকারী তখনই, যখন এটি দেখায় মডেল সত্যিই অপরিচিত কাজ কীভাবে সামলায়, না যে এটি তার ওয়েটসে ইতিমধ্যে থাকা প্যাটার্ন কতটা ভালোভাবে পুনরুত্পাদন করে।

AITE শুরু হবে বড় ভিশন-ল্যাঙ্গুয়েজ মডেলের জন্য ইমেজ-অ্যানালাইসিস কাজ দিয়ে, তিনটি ক্ষেত্রে: কোয়ান্টাম বিজ্ঞান, জিনোমিক্স, এবং জননিরাপত্তা। পরে আরও কাজ যোগ করা হবে বলে NIST জানিয়েছে। প্রাথমিক ফোকাস একটি বাস্তববাদী পছন্দকে প্রতিফলিত করে। ভিশন-ল্যাঙ্গুয়েজ সিস্টেম বাণিজ্যিক ও সরকারি দুই ক্ষেত্রেই ক্রমশ গুরুত্বপূর্ণ হয়ে উঠছে, তবু ক্ষেত্র-নির্দিষ্ট কর্মক্ষমতার জন্য মূল্যায়ন মানদণ্ড এখনও অসম।

ব্লাইন্ড ডেটা কেন আলোচনাকে বদলে দেয়

এই প্ল্যাটফর্মের সবচেয়ে গুরুত্বপূর্ণ দিক হতে পারে এর ব্লাইন্ড ডেটাসেটের ব্যবহার। AI-তে, পাবলিক বেঞ্চমার্ক মানকিীকরণের জন্য উপকারী, কিন্তু এগুলো সরাসরি টেস্টের জন্য অপ্টিমাইজ করার প্রণোদনাও তৈরি করে। এতে প্রকৃত সাধারণীকরণ এবং বেঞ্চমার্ক-নির্দিষ্ট টিউনিংয়ের পার্থক্য ঝাপসা হয়ে যেতে পারে। সর্বসাধারণের জন্য উপলব্ধ নয় এমন মূল ডেটাসেট ব্যবহার করে, AITE সেই বিকৃতি কমাতে চায়।

কর্মসূচিতে অংশ নেওয়া ডেটা প্রদানকারীদের কাছ থেকে প্রত্যাশা করা হচ্ছে যে তারা ওই ডেটাসেটগুলোর জন্য উপযুক্ত অর্থবহ কাজসহ মূল, অপ্রকাশ্য ডেটাসেট জমা দেবেন। অন্যদিকে, মডেল ডেভেলপাররা তাদের মডেল ওই উপাদানের বিরুদ্ধে পরীক্ষার জন্য জমা দেন। NIST-এর ভূমিকা হলো টেস্টিং অবকাঠামো এবং সাধারণ স্কোরিং ফ্রেমওয়ার্ক প্রদান করা।

এই ব্যবস্থার দুটি তাৎপর্য আছে। প্রথমত, এটি ডেটা মালিকদেরকে তাদের ক্ষেত্র-নির্দিষ্ট মূল্যায়ন উপাদানকে কোনো পাবলিক ট্রেনিং রিসোর্সে রূপ না দিয়ে অবদান রাখার পথ দেয়। দ্বিতীয়ত, এটি মডেল ডেভেলপারদের এমন তৃতীয়-পক্ষ কর্মক্ষমতার সংকেত পাওয়ার সুযোগ দেয়, যা স্ব-প্রতিবেদিত বেঞ্চমার্ক ফলাফলের চেয়ে বেশি বিশ্বাসযোগ্য হতে পারে।

তবে এর মানে এই নয় যে AITE AI মূল্যায়নের সর্বজনীন উত্তর। অনেক কিছু নির্ভর করে ডেটাসেটের মান, কাজের নকশা, এবং নির্বাচিত স্কোরিং পদ্ধতিগুলো বাস্তবে গুরুত্বপূর্ণ ব্যর্থতার ধরনগুলো প্রতিফলিত করে কি না তার ওপর। কিন্তু একটি কাঠামো হিসেবে, এটি মূল্যায়নকে আরও বাস্তবসম্মত ও আরও কঠিন পরীক্ষার অবস্থার দিকে ঠেলে দেয়।

স্বেচ্ছাসেবী AI নিরাপত্তা অবকাঠামোতে ফেডারেল ভূমিকা

এই উদ্বোধন বৃহত্তর একটি ফেডারেল কৌশলের সাথেও মানানসই, যার কেন্দ্রবিন্দু বড় AI ডেভেলপারদের সঙ্গে স্বেচ্ছাসেবী সহযোগিতা। উৎস পাঠে AITE-কে ট্রাম্প প্রশাসনের এমন নীতির সর্বশেষ ধাপ হিসেবে বর্ণনা করা হয়েছে, যেখানে স্বেচ্ছাসেবী মডেল জমাদানের মাধ্যমে মডেল নিরাপত্তা এগিয়ে নেওয়া হচ্ছে। এটি মে মাসে Commerce Department-এর ঘোষণার পর এসেছে, যেখানে Google DeepMind, Microsoft, এবং xAI-কে Center for AI Standards and Innovation-এর মাধ্যমে মডেল মূল্যায়নের জন্য পুনরায় আলোচিত একটি ব্যবস্থার অংশ করা হয়েছিল।

এই প্রেক্ষাপটটি গুরুত্বপূর্ণ। যুক্তরাষ্ট্র সরকার কেবল দূর থেকে নির্দেশনা দিচ্ছে না; এটি এমন যৌথ টেস্টিং অবকাঠামো তৈরি করছে, যার লক্ষ্য মডেলের গুণমান ও নিরাপত্তা কীভাবে মাপা হবে তা নির্ধারণে প্রভাব ফেলা। স্বেচ্ছাসেবী কর্মসূচি আনুষ্ঠানিক নিয়ন্ত্রণের চেয়ে দ্রুত এগোতে পারে, বিশেষ করে এমন ক্ষেত্রে যেখানে মডেলের স্থাপত্য ও মোতায়েনের ধরন দ্রুত বদলায়। একই সঙ্গে, তাদের প্রভাব নির্ভর করে শীর্ষ ডেভেলপাররা অংশ নিতে চান কি না এবং উদ্ভূত মূল্যায়নগুলো বৃহত্তর ইকোসিস্টেমে বিশ্বাসযোগ্য বলে বিবেচিত হয় কি না তার ওপর।

NIST-এর প্রাতিষ্ঠানিক ভূমিকা এই প্রচেষ্টাকে বাড়তি গুরুত্ব দেয়। প্রযুক্তিগত ক্ষেত্রে মাপজোক, মান, এবং মূল্যায়ন কাঠামোতে সংস্থাটি দীর্ঘদিন ধরে কেন্দ্রীয় ভূমিকা পালন করে আসছে। সেই ঐতিহ্যকে AI-তে প্রয়োগ করা যুক্তিসঙ্গত পদক্ষেপ, বিশেষ করে যখন নীতিনির্ধারক, সংস্থা, এবং এন্টারপ্রাইজ ক্রেতারা বিপণন দাবির বাইরে গিয়ে সিস্টেম তুলনা করার ভালো উপায় খুঁজছেন।

প্রথম ধাপ কী ইঙ্গিত দিচ্ছে

প্রাথমিক ডোমেইনগুলোর নির্বাচন থেকে বোঝা যায় NIST কাছাকাছি সময়ের মূল্যায়ন চ্যালেঞ্জকে কীভাবে দেখছে। কোয়ান্টাম বিজ্ঞান এবং জিনোমিক্স উভয়ই বিশেষজ্ঞ জ্ঞান এবং জটিল ডেটা ব্যাখ্যার সঙ্গে যুক্ত, ফলে সেগুলো ভিশন-ল্যাঙ্গুয়েজ মডেল বিশেষজ্ঞ প্রেক্ষিতে নির্ভরযোগ্যভাবে কাজ করতে পারে কি না তার উপযোগী পরীক্ষার ক্ষেত্র। জননিরাপত্তা আরও একটি কার্যকরী মাত্রা যোগ করে, যেখানে ভুলের পরিণতি আরও তাৎক্ষণিক হতে পারে।

সেখান থেকে শুরু করে, AITE নিজেকে কেবল একটি সাধারণ বেঞ্চমার্ক হাব নয়, বরং কাজ-নির্দিষ্ট, উচ্চ-ঝুঁকির মূল্যায়নের একটি মঞ্চ হিসেবে অবস্থান করছে বলে মনে হয়। এটি সরকারি ক্রয় এবং গবেষণা তহবিলের জন্য গুরুত্বপূর্ণ হতে পারে, যেখানে সংস্থাগুলো ক্রমেই এমন প্রমাণ চায় যে একটি মডেল সীমিত, ক্ষেত্র-সংশ্লিষ্ট পরিস্থিতিতে কাজ করতে পারে।

প্রথম মূল্যায়নগুলো আগস্ট 2026-এ শুরু হওয়ার কথা, তাই প্রাথমিক ফল দ্রুতই আসতে পারে। সেই ফলাফলই নির্ধারণ করতে পারে AITE একটি নিস প্রযুক্তিগত কর্মসূচি হয়ে থাকে নাকি যুক্তরাষ্ট্রের AI তদারকি ও মডেল তুলনায় আরও কেন্দ্রীয় রেফারেন্স পয়েন্টে পরিণত হয়।

পরবর্তী কী দেখবেন

তাৎক্ষণিক প্রশ্ন হলো অংশগ্রহণ। একটি স্বেচ্ছাসেবী মূল্যায়ন কাঠামো ততটাই প্রভাবশালী যতটা ভালো এর জমা দেওয়া ডেটাসেটের মান এবং এটি যে মডেলগুলো আকর্ষণ করে তাদের মান। শীর্ষ ডেভেলপাররা যদি ব্লাইন্ড কাজের ওপর স্বাধীন স্কোরিংকে মূল্যবান মনে করেন, AITE ক্রেতা, নিয়ন্ত্রক, এবং গবেষকদের জন্য একটি গুরুত্বপূর্ণ সংকেত হয়ে উঠতে পারে। অংশগ্রহণ সীমিত হলে, এর প্রভাব আরও সংকীর্ণ থেকে যেতে পারে।

আরেকটি প্রশ্ন হলো সম্প্রসারণ। NIST বলেছে, সময়ের সাথে আরও কাজ যোগ করা হবে। প্ল্যাটফর্মটি যদি অতিরিক্ত মোডালিটি ও খাতে বিস্তৃত হয়, তবে এটি মডেল কর্মক্ষমতা নিয়ে আলোচনার জন্য আরও স্থায়ী একটি সাধারণ ভাষা গড়ে তুলতে সাহায্য করতে পারে। এটি বিশেষ করে এমন শিল্পে কার্যকর, যেখানে “state of the art” বাক্যাংশটি মাপার চেয়ে বলা প্রায়ই সহজ।

এখনকার জন্য, AITE বিস্তৃত AI-নিরাপত্তা আলোচনার থেকে অপারেশনাল মূল্যায়ন অবকাঠামোর দিকে একটি স্পষ্ট সরে আসার প্রতিনিধিত্ব করে। বেঞ্চমার্ক ও প্রতিদ্বন্দ্বী দাবিতে পরিপূর্ণ বাজারে, NIST পরিচালিত একটি ব্লাইন্ড-ডেটা টেস্টবেড AI মূল্যায়নকে আরও কঠোর করার অন্যতম গুরুত্বপূর্ণ পরীক্ষায় পরিণত হতে পারে।

এই নিবন্ধটি Defense One-এর প্রতিবেদনের ভিত্তিতে লেখা। মূল নিবন্ধ পড়ুন.

Originally published on defenseone.com