Cursor AI coding-কে planners এবং workers-এ ভাগ করার পক্ষে যুক্তি দিচ্ছে

Cursor বলছে, যদি শক্তিশালী models typing-এর বেশিরভাগ কাজ করা বন্ধ করে, তবে AI-assisted software development-এর অর্থনীতি বদলে যেতে পারে। তার upgraded agent swarm নিয়ে নতুন বিবরণে কোম্পানি জানিয়েছে, higher-end frontier models-কে মূলত planning এবং task decomposition-এর জন্য ব্যবহার করা হলে সস্তা models সফলভাবে coding work-এর বড় অংশ সামলাতে পেরেছে।

এই দাবি এসেছে একটি internal benchmark থেকে, যেখানে Cursor তার নতুন swarm এবং আগের version-কে বলেছিল documentation ব্যবহার করে, source code এবং internet access ছাড়া, Rust-এ SQLite rebuild করতে। কোম্পানির মতে, নতুন swarm-এর প্রতিটি configuration test suite-এ 100 percent পেয়েছে, আর আগের system merge conflicts এবং coordination overhead-এ আটকে গিয়েছিল।

যদি এই ফলাফল আরও বিস্তৃতভাবে সত্যি হয়, তবে তা শিল্পে একটি গুরুত্বপূর্ণ পরিবর্তনের ইঙ্গিত দেয়। AI coding-এ প্রধান প্রশ্ন প্রায়ই হয় কোন single model সবচেয়ে ভালো code লেখে। Cursor একটি ভিন্ন framing দিচ্ছে: আরও গুরুত্বপূর্ণ design choice হতে পারে বিভিন্ন role, cost এবং context window-সহ বহু agents-এর মধ্যে কাজ কীভাবে ভাগ করা হয়।

মূল ধারণা parallelism নয়, division of labor

Cursor বলছে তার সর্বশেষ swarm agents-কে planners এবং workers-এ ভাগ করে। Planner agents আরও শক্তিশালী frontier models ব্যবহার করে recursively একটি goal-কে ছোট ছোট tasks-এ ভেঙে ফেলে। Worker agents, দ্রুত এবং সস্তা models ব্যবহার করে, তারপর সেই কাজগুলো সম্পন্ন করে। কোম্পানির ভাষ্য অনুযায়ী, এই setup একটি task tree তৈরি করে যা কাজ এগোনোর সঙ্গে সঙ্গে বদলাতে থাকে।

যুক্তিটি শুধু এই নয় যে বেশি agents মানে বেশি throughput। Cursor-এর মূল বক্তব্য হলো swarms context-management problem সমাধানে সাহায্য করে। বড় coding assignment-এ কাজ করা একটি single agent-কে একই সঙ্গে end goal, local implementation details এবং intermediate decisions সক্রিয় রাখতে হয়। এতে drift, duplication এবং poor handoffs-এর সুযোগ তৈরি হয়। এর বিপরীতে, swarm planning-কে execution থেকে আলাদা করতে পারে, ফলে প্রতিটি agent-এর cognitive burden কমে যায়।

Cursor-এর ভাষ্য অনুযায়ী, এই role separation-ই performance উন্নত করেছে। Planners code লেখেনি, workers planning করেনি। এটি সাধারণ শোনালেও, software-building agents সম্পর্কে এটি কার্যত একটি architectural দাবি: specialization, প্রতিটি model-কে সবকিছু করানোর চেষ্টার চেয়ে বেশি মূল্যবান হতে পারে।

Schema "Decomposing work keeps every agent
Cursor বলছে swarms-এর scale parallel work-এর চেয়ে planners ও workers-এর মধ্যে context ভাগ করে বেশি বাড়ে। | Image by Cursor

আগের bottleneck ছিল শুধু intelligence নয়, coordinationও

Cursor-এর আগের swarm-এর সঙ্গে তুলনাটি তাৎপর্যপূর্ণ, কারণ কোম্পানি এমন failure mode বর্ণনা করছে যা raw model weakness-এর চেয়ে organizational problem-এর মতো দেখায়। একটি আগের browser-based swarm reportedly Git-এ প্রতি ঘণ্টায় প্রায় 1,000 commits করতে পারত এবং worker agents, একটি judge agent, এবং conflict-resolving integrator-এর ওপর নির্ভর করত। Cursor-এর মতে, integrator শেষ পর্যন্ত সমাধান না হয়ে bottleneck হয়ে ওঠে।

কোম্পানি বলছে নতুন swarm প্রায় 1,000 commits per second-এ পৌঁছেছিল, এমন একটি scale যেখানে conventional Git workflows সামলাতে পারত না। ফলে Cursor-কে agent activity-এর জন্য নিজস্ব version control system তৈরি করতে হয়। কোম্পানির বর্ণনা অনুযায়ী, এই গতিতে কাজ করা agents এমন failure mode তৈরি করেছিল যা সাধারণত human teams-এ দেখা যায় না।

এর একটি failure mode ছিল Cursor-এর ভাষায় “split-brain design,” যেখানে দুই planner স্বাধীনভাবে একই broad idea-তে পৌঁছায় কিন্তু তা ভিন্ন জায়গায় এবং পরস্পর-বিরোধী উপায়ে বাস্তবায়ন করে। আরেকটি সমস্যা দেখা দেয় যখন planners একে অপরকে চিনতে পারে এবং competing edits দিয়ে একে অন্যকে block করতে শুরু করে। এগুলো syntax errors-এর চেয়ে machine labor force-এর ভিতরের governance failure-এর মতো।

Shared design records সিস্টেমের অংশ হয়ে গেল

এই coordination problem সামলাতে Cursor বলছে agents-রা সিদ্ধান্তগুলো shared design documents-এ নথিভুক্ত করত। কোনো সিদ্ধান্তের সঙ্গে যুক্ত code পরে সেই document-এর সঙ্গে একটি reference-এর মাধ্যমে লিঙ্ক করা হত, যা compile time-এ যাচাই করা হতো। merge conflict হলে একটি neutral agent তা মিটিয়ে দিত। Workers bloated files-কে ছোট modules-এ ভাগ করার জন্য external agent-কে flag-ও করতে পারত।

এই বিষয়টি গুরুত্বপূর্ণ, কারণ এটি দেখায় কোম্পানির অগ্রগতি শুধু prompting বা model choice-এ নয়, workflow infrastructure-এও। Design documents memory এবং policy-এর কাজ করে। Neutral conflict resolver procedural backstop হিসেবে কাজ করে। Compile-time references implementation-কে rationale-এর সঙ্গে জুড়ে দেয়। মানব software engineering-এ এই কাজগুলো architecture docs, code review এবং build systems-এর মধ্যে ভাগ করা থাকে। Cursor কার্যত AI collectives-এর জন্য সমতুল্য mechanisms formalize করার চেষ্টা করছে।

কোম্পানি আরও বলছে, তারা behavioral assumptions-ও বদলেছে। Human codebase-এ ব্যবহারের জন্য trained agents core code-কে বেপরোয়াভাবে না ছোঁয়ার অভ্যাস শিখে ফেলেছিল, তাই Cursor তাদের এই controlled environment-এ ইচ্ছে করে কিছু ভাঙার অনুমতি দিয়েছে। এটি একটি গুরুত্বপূর্ণ caveat। Greenfield বা benchmark task-এর জন্য optimized swarm production codebase-এ একইভাবে আচরণ নাও করতে পারে, যেখানে stability, compatibility এবং team conventions raw task completion-এর চেয়ে বেশি গুরুত্বপূর্ণ।

Liniendiagramm der kumulierten Merge-Konflikte ab dem ersten Konflikt; v1 erreicht nach 120 Minuten fast 70.000 Konflikte mit steigender Kurve, v2 bleibt flach unter tausend.
পুরনো version-এর conflict rate কমেনি, বরং বাড়তেই থেকেছে। | Image by Cursor

Cursor-এর বাইরেও এই ফলাফলের গুরুত্ব

Cursor-এর report-এর সবচেয়ে শক্তিশালী implication হলো অর্থনৈতিক। যদি high-end models-কে মূলত planning-এর জন্য রাখা যায় এবং lower-cost models অধিকাংশ implementation করে, তবে advanced coding automation-এর cost structure বদলে যাবে। Frontier-model usage আরও selective হবে, যা দলগুলিকে frontier-model prices ছাড়াই agentic work scale করতে দেবে।

এটি এমন সময়ে গুরুত্বপূর্ণ যখন software companies single assistants-এর বদলে agent fleets নিয়ে পরীক্ষা করছে। বাণিজ্যিক প্রশ্ন এখন শুধু AI code লিখতে পারে কি না, তা নয়, বরং coordination এবং error recovery-সহ, এত কম দামে তা করতে পারে কি না যাতে দীর্ঘমেয়াদে ব্যবহার করা যায়। Cursor-এর planner-worker structure এই দ্বিতীয় প্রশ্নের উত্তর দিতে একটি স্পষ্ট প্রচেষ্টা।

সতর্ক থাকার কারণও আছে। রিপোর্ট করা benchmark ছিল internal, task-bounded এবং অত্যন্ত specific। Documentation থেকে Rust-এ SQLite rebuild করা একটি demanding test, তবে messy enterprise systems রক্ষণাবেক্ষণ করা, incomplete product requirements বোঝা বা বাস্তব organizational constraints-এর মধ্যে কাজ করার থেকে তা ভিন্ন। তাই কোম্পানির দাবিগুলো settled industry conclusion-এর চেয়ে emerging pattern সম্পর্কে বেশি বলে।

তবুও, বৃহত্তর সংকেতটি উপেক্ষা করা কঠিন। Cursor এমন একটি ভবিষ্যৎ বর্ণনা করছে যেখানে মূল innovation একটি single ever-larger coding model নয়, বরং differentiated roles-সহ models-এর managed ecosystem। Planning, execution, conflict resolution, refactoring এবং design-memory functions আলাদা agents-কে দেওয়া যেতে পারে এবং speed, cost বা reasoning depth অনুযায়ী tune করা যেতে পারে।

যদি সেই model ছড়িয়ে পড়ে, তবে developers AI tools কীভাবে বিচার করেন তা বদলে যেতে পারে। প্রধান metric আর শুধু এক model-এর completions-এর quality হবে না। তা হবে orchestration-এর quality: একটি system কত ভালোভাবে কাজ ভাগ করে, context রক্ষা করে, collisions মেটায় এবং expensive reasoning-কে কেবল সেখানে বরাদ্দ করে যেখানে তা সবচেয়ে বেশি value যোগ করে।

Cursor-এর ফলাফল প্রমাণ করে না যে প্রতিটি environment-এ অধিকাংশ coding-এর জন্য cheaper models যথেষ্ট। তবে তা একটি আরও সীমিত এবং সম্ভাব্যভাবে গুরুত্বপূর্ণ দাবিকে সমর্থন করে: frontier models-কে কাজের পরিকল্পনার জন্য ব্যবহার করলে, সব কাজ করানোর বদলে, lower-cost agents অনেক দলের ধারণার চেয়ে অনেক বেশি implementation load বহন করতে সক্ষম হতে পারে।

এই article The Decoder-এর reporting-এর ভিত্তিতে লেখা। মূল article পড়ুন.

Originally published on the-decoder.com