Anthropic Claude Code-কে আরও স্বায়ত্তশাসিত ব্যবহারের দিকে সরাচ্ছে

Anthropic ১৪ আগস্ট থেকে বেশিরভাগ পেইড ব্যবহারকারীর জন্য Auto Mode-কে ডিফল্ট সেটিং করে Claude Code-এর সঙ্গে ডেভেলপারদের মিথস্ক্রিয়ার ধরন বদলাচ্ছে। উৎস উপাদান অনুযায়ী, এই পরিবর্তন Pro, Max, এবং Team প্ল্যানের ক্ষেত্রে প্রযোজ্য হবে, যদিও Enterprise গ্রাহকদের এখনও আলাদাভাবে opt in করতে হবে। ব্যবহারিকভাবে, এর মানে Claude Code এখন প্রতিটি পৃথক ধাপে মানুষের অনুমোদনের জন্য অপেক্ষা না করে বেশি সময় কাজ করবে, এবং কেবল তখনই থামবে যখন তার safety system কোনো কাজকে বিপজ্জনক বা ফেরত আনা কঠিন বলে মনে করবে।

এটি একটি সাধারণ product tweak-এর চেয়ে বেশি কিছু। এটি এমন একটি ঘোষণা যে একটি বড় AI কোম্পানি coding assistant-দের কীভাবে ব্যবহার করা উচিত বলে মনে করে: শুধু autocomplete tool বা chat interface হিসেবে নয়, বরং সীমিত তত্ত্বাবধানে দীর্ঘ development work করতে সক্ষম semi-autonomous agent হিসেবে। Anthropic এই পরিবর্তনকে oversight কমানো নয়, বরং safety improvement হিসেবে উপস্থাপন করছে; তাদের যুক্তি, manual approval একে একে দেওয়ার চেয়ে classifier ঝুঁকিপূর্ণ command আরও ধারাবাহিকভাবে চিহ্নিত করতে পারে।

Anthropic কেন বলছে Auto Mode নিরাপদ

কোম্পানির যুক্তি source text-এ থাকা কিছু reported test result-এর ওপর নির্ভর করছে। 1,053 paid tester-সহ একটি controlled study-তে মানব reviewer-রা বিপজ্জনক command-এর 13.6 percent ধরতে পেরেছিলেন, আর Auto Mode ধরেছিল 89 percent। Anthropic আরও বলেছে, internal red-teaming দেখিয়েছে Auto Mode অন্তত manual approval-এর মতো নিরাপদ, এবং অনেক সময় তার চেয়েও ভালো। কোম্পানিটি আরও যোগ করেছে যে Auto Mode ব্যবহারকারী team-গুলো প্রায় 25 percent বেশি pull request তৈরি করেছে, যা ইঙ্গিত করে বেশি autonomy মানে বেশি output-ও।

বর্ণিত mechanism ধারণাগতভাবে সরল। প্রতিটি ধাপে অনুমতি চাওয়ার বদলে, Claude Code ধারাবাহিকভাবে কাজ করে এবং কোন কাজ কখন থামিয়ে confirmation নিতে হবে তা নির্ধারণে classifier-এর ওপর নির্ভর করে। কোনো কাজ বিপজ্জনক বা অপরিবর্তনীয় মনে হলে এই system হস্তক্ষেপ করার জন্য তৈরি। Anthropic বলছে, classifier নিজে user-এর জন্য token charges যোগ করে না, যদিও broader workflow দীর্ঘ ও বেশি উৎপাদনশীল coding session সম্ভব করে মোট ব্যবহার বাড়াতে পারে।

এটি গুরুত্বপূর্ণ, কারণ approval fatigue agentic software tool-এ একটি বাস্তব সমস্যা। ব্যবহারকারীদের যদি প্রায় প্রতিটি command অনুমোদন করতে বলা হয়, তবে অনেকেই অভ্যাসবশত click through করবে বা safeguards পুরোপুরি বন্ধ করে দেবে। Anthropic-এর ধারণা হলো, blanket approval prompt-এর চেয়ে selective intervention বেশি বাস্তবসম্মত, এবং model-assisted filter পুনরাবৃত্ত review পরিস্থিতিতে মানুষের সতর্কতাকে ছাড়িয়ে যেতে পারে।

Prompt injection এখনো বড় উদ্বেগ

উৎস উপাদানের সবচেয়ে গুরুত্বপূর্ণ দাবিগুলোর একটি হলো, Auto Mode prompt injection attack থেকেও সুরক্ষা দিতে সাহায্য করবে। এই attack-গুলো code, files, বা কাজের সময় এজেন্টের দেখা অন্যান্য উপাদানে এমবেড করা নির্দেশনার মাধ্যমে AI agent-কে manipulate করার চেষ্টা করে। agentic coding environment-এ এই ঝুঁকি passive chatbot-এর তুলনায় বেশি গুরুতর, কারণ system-এর commands, repositories, processes, এবং কিছু ক্ষেত্রে sensitive data-তেও প্রবেশাধিকার থাকতে পারে।

Anthropic Trajectory Labs-এর একটি independent audit উল্লেখ করেছে, যেখানে 72টি attack scenario ছিল এবং প্রতিটিই 10 বার চালানো হয়েছিল। উৎস অনুযায়ী, 720টি প্রচেষ্টার একটিও Auto Mode-এ Claude-এর current models-এর বিরুদ্ধে সফল হয়নি। source OpenAI-এর GPT-5.6 Sol in Codex Auto-Review mode-এর একটি উদ্ধৃত benchmark-এর সঙ্গেও তুলনা করেছে, যেখানে 5.83 percent প্রচেষ্টা নাকি সফল হয়েছিল। প্রদত্ত পাঠ্যের বাইরে Developments Today methodology যাচাই করতে পারে না, তবে এই তুলনা দেখায় vendor-রা এখন coding quality-এর পাশাপাশি agent safety নিয়েও কতটা আক্রমণাত্মকভাবে প্রতিযোগিতা করছে।

1,053 পেইড টেস্টারের একটি controlled study-তে, মানব reviewer-রা বিপজ্জনক command-এর মাত্র 13.6 percent ধরতে পেরেছিলেন, আর Auto Mode ধরেছিল 89 percent। | Image: Anthropic
1,053 পেইড টেস্টারের একটি controlled study-তে, মানব reviewer-রা বিপজ্জনক command-এর মাত্র 13.6 percent ধরতে পেরেছিলেন, আর Auto Mode ধরেছিল 89 percent। | Image: Anthropic

Anthropic stakes বোঝাতে কিছু internal example-ও দিয়েছে। কোম্পানিটি বলেছে Auto Mode Claude-কে confidential data একটি public page-এ আপলোড করা থেকে বিরত করেছে, এবং একটি দীর্ঘ session-এ প্রায় 2,000টি process থামিয়েছে যা চলমান GPU training job ব্যাহত করতে পারত। এসব উদাহরণ দেখায়, কোম্পানিটি বাস্তব development ও infrastructure environment-এ এই systemগুলো পরীক্ষা করছে, যেখানে ভুল security, uptime, এবং ব্যয়বহুল compute workload-এ প্রভাব ফেলতে পারে।

বেশি output, কিন্তু ডেভেলপারদের ভূমিকা বদলাচ্ছে

Productivity-এর দাবি গুরুত্বপূর্ণ, কারণ এটি software work-এ একটি বড় পরিবর্তনের ইঙ্গিত দেয়। Auto Mode ব্যবহার করা team-গুলো যদি আরও pull request তৈরি করে, তবে developer-এর কাজও বদলে যায়। source text স্পষ্টভাবে বলছে, এই ভূমিকা active line-by-line coding থেকে সরে আরও বেশি AI-generated output supervise, review, এবং validate করার দিকে যাচ্ছে।

এতে human judgment-এর প্রয়োজন শেষ হয় না। Anthropic নিজেই সতর্ক করেছে যে classifier ঝুঁকি কমায়, কিন্তু পুরোপুরি দূর করে না। company এখনও recommend করে যে production infrastructure-এ high-stakes change-এর জন্য Claude-এর কাজ ব্যবহারকারীরা নিজেরাই review করুন। এই caveat গুরুত্বপূর্ণ। Auto Mode-এর জন্য সবচেয়ে শক্তিশালী যুক্তি routine development workflow-এ, যেখানে দেরির খরচ বেশি এবং কোনো একক কাজের ঝুঁকি তুলনামূলকভাবে সীমিত। দুর্বল যুক্তি সেই environment-গুলোর জন্য, যেখানে একটি ভুল command data ফাঁস করতে পারে, production system ভেঙে দিতে পারে, বা অপরিবর্তনীয় operational damage ঘটাতে পারে।

এই আলোকে, Anthropic-এর ঘোষণা একই সঙ্গে একটি product rollout এবং একটি behavioral nudge। Auto Mode-কে default করে কোম্পানিটি এই ধারণাকে স্বাভাবিক করছে যে ডেভেলপারদের coding agent-দের আরও দীর্ঘ সময় নিজের মতো চলতে দেওয়া উচিত। Default গুরুত্বপূর্ণ। অনেক ব্যবহারকারী যারা আগে বেশি স্বায়ত্তশাসিত সেটিং সক্রিয় করেননি, এখন সেটিকেই tool-এর স্বাভাবিক কাজের ধরন হিসেবে অনুভব করবেন।

AI coding market-এর জন্য এর মানে কী

এই পরিবর্তন coding assistant market-এর পরিণত পর্যায়ও দেখায়। প্রতিযোগিতা এখন আর শুধু কে সেরা snippet লেখে বা সবচেয়ে পরিষ্কার refactor বোঝায় তা নিয়ে নয়। এখন বিষয়টি increasingly হলো কে autonomy নিরাপদে পরিচালনা করতে পারে: কখন কাজ করতে হবে, কখন থামতে হবে, এবং execution-এর সময় পাওয়া malicious বা unintended নির্দেশনার বিরুদ্ধে কীভাবে টিকে থাকতে হবে।

Anthropic মনে হচ্ছে এমন operational judgment layer-কে একটি core differentiator বানাতে বাজি ধরছে। যদি সেই বাজি ঠিক হয়, তবে AI coding tool-এর পরবর্তী ধাপ prompt থেকে কত ঘন ঘন code তৈরি করতে পারে তার চেয়ে বেশি, messy real-world repository-এর মধ্যে ক্ষতি না করে কত নির্ভরযোগ্যভাবে কাজ করতে পারে তার ওপর নির্ভর করবে। Auto Mode-কে default করা এখন শিল্প যে সেই দিকেই এগোচ্ছে তার একটি স্পষ্ট সংকেত।

এই নিবন্ধটি The Decoder-এর রিপোর্টিংয়ের ভিত্তিতে লেখা। মূল নিবন্ধ পড়ুন.

Originally published on the-decoder.com