একটি রেকর্ড অর্থপ্রদান, যা AI প্রশিক্ষণকে এখনও অনেকটাই অনির্ধারিত রেখেছে
সান ফ্রান্সিসকোর একটি ফেডারেল আদালত 2021 এবং 2022 সালে piracy databases LibGen এবং PiLiMi থেকে বই ডাউনলোড করার ঘটনায় Anthropic এবং বইয়ের লেখকদের মধ্যে $1.5 বিলিয়ন সমঝোতা অনুমোদন করেছে। কেবল সংখ্যার বিচারে এটি একটি ঐতিহাসিক মাইলফলক: সরবরাহকৃত উৎস উপাদান একে class action ইতিহাসের সবচেয়ে বড় copyright settlement হিসেবে বর্ণনা করে। কিন্তু এই মামলার গুরুত্ব কেবল অর্থের পরিমাণে নয়। এই চুক্তি এমন দুইটি বিষয়কে আলাদা করে দেখাচ্ছে বলে মনে হয়, যেগুলি সাধারণত generative AI নিয়ে জনচর্চায় একসঙ্গে মিশে যায়: piracy এবং model training।
প্রদত্ত রিপোর্ট অনুযায়ী, এই সমঝোতাটি প্রায় 482,460 listed works কভার করে, যার 91.3 শতাংশ claimed, ফলে প্রতিটি claimed work-এর জন্য প্রায় $3,000 করে অর্থপ্রদান হবে। Anthropic-কে পাইরেটেড ফাইলগুলোও ধ্বংস করতে হবে। বইগুলো কীভাবে সংগ্রহ করা হয়েছিল, সেই বাস্তবতার দিক থেকে এটি একটি বড় ক্ষতি। একই সঙ্গে, এটি সেই বৃহত্তর আইনি প্রশ্নের নিষ্পত্তি করে না, যেটি নিয়ে অনেক প্রকাশক, লেখক এবং AI কোম্পানি লড়াই করছে: আইনসম্মতভাবে প্রাপ্ত বই ব্যবহার করে AI systems প্রশিক্ষণ দিলে তা কি fair use হতে পারে?
এই পার্থক্যটি গুরুত্বপূর্ণ, কারণ এটি AI-সংক্রান্ত copyright litigation-এর পরবর্তী ধাপের রূপ নির্দেশ করে। যদি আদালত অবৈধভাবে প্রাপ্ত উপকরণের জন্য শাস্তি দিতে থাকে, অথচ আইনসম্মতভাবে প্রাপ্ত কাজের উপর training-কে ভিন্নভাবে দেখে, তাহলে AI developers-এর compliance burden এই প্রশ্ন থেকে সরে আসতে পারে যে মডেল আদৌ কপিরাইটেড উপকরণ থেকে শিখেছে কি না, এবং বেশি গুরুত্ব পেতে পারে এই প্রশ্নটি যে underlying datasets কীভাবে সংগৃহীত, নথিভুক্ত এবং লাইসেন্স করা হয়েছিল। লেখক এবং rights holders-এর জন্য এটি মিশ্র ফল: piracy-এর বিরুদ্ধে জয়, কিন্তু training itself-এর ওপর অবশ্যই কোনো সার্বিক নিষেধাজ্ঞা নয়।
কেন এই মামলা এখনও AI labs-এর জন্য আইনি জয় হিসেবে গণ্য হতে পারে
প্রদত্ত সূত্র বলছে Judge Alsup আগেই রায় দিয়েছিলেন যে আইনসম্মতভাবে প্রাপ্ত বইয়ে AI training “transformative” এবং fair use-এর আওতাভুক্ত। সেই আগের সিদ্ধান্তই এই সমঝোতার গুরুত্বপূর্ণ পটভূমি। এটি ইঙ্গিত দেয় যে এই মামলায় Anthropic-এর সবচেয়ে ব্যয়বহুল ঝুঁকি এসেছিল alleged pirated copies-এর ব্যবহার থেকে, model training-এর abstract কাজ থেকে নয়। বাস্তবে, আদালত অবৈধ sourcing এবং সম্ভাব্য আইনসম্মত transformation-এর মধ্যে একটি সীমারেখা টেনেছে বলে মনে হয়।
AI কোম্পানিগুলোর জন্য এই সীমারেখা অত্যন্ত গুরুত্বপূর্ণ। অনেক model developer scraping, licensing, consent, memorization, এবং market substitution নিয়ে একাধিক overlapping দাবি মোকাবিলা করে। কোনো আদালতের সিদ্ধান্ত যদি piracy-কে আলাদা করে অপরাধ হিসেবে চিহ্নিত করে, কিন্তু training defenses অক্ষুণ্ণ রাখে, তবে শিল্পখাতের কাছে সবচেয়ে তাৎক্ষণিক liability কোথায় থাকতে পারে তার একটি আরও পরিষ্কার, যদিও এখনও অসম্পূর্ণ, মানচিত্র আসে। source text-এর যুক্তি অনুযায়ী, website owners-এর সম্মতি ছাড়া web content-এর ওপর training করা AI labs-এর জন্য এটি একটি মাইলফলক বলে মনে হতে পারে, কারণ web-scale collection এখনও training data-এর প্রধান উৎস। এটি চূড়ান্ত আইনি অনুমোদন নয়, তবে এটি ইঙ্গিত দেয় যে এই বিরোধগুলোর কেন্দ্র training-এর অস্তিত্ব থেকে সরে acquisition methods এবং reproductions-এর দিকে যাচ্ছে।
Anthropic সম্পূর্ণভাবে ক্ষতিগ্রস্ত হয়নি। $1.5 বিলিয়ন সমঝোতা কোনো ছোট operational penalty নয়; এটি corporate-scale সতর্কবার্তা। এটি প্রতিটি বড় AI developer-কে বলে যে দুর্বল dataset governance ঐতিহাসিক মাত্রার ক্ষতি ডেকে আনতে পারে। এমনকি কোনো কোম্পানি যদি বিশ্বাস করে যে তার fair-use যুক্তি শক্তিশালী, তবুও model-কে খাদ্য জোগানো pipeline-এ যদি piracy repositories থেকে নেওয়া উপকরণ থাকে, তাহলে সেই defenses খুব কম সুরক্ষা দিতে পারে। সেই অর্থে, এই সমঝোতা provenance controls, ingestion audits, এবং model development-এর সময় engineers ও researchers কী ব্যবহার করতে পারবেন তার উপর অভ্যন্তরীণ সীমাবদ্ধতার মূল্য বাড়িয়ে দেয়।
লেখকদের যে অধিকার এখনও রয়ে গেছে
এই মামলাটি ভবিষ্যতের সব দাবি মুছে দেয়নি। প্রদত্ত রিপোর্ট অনুযায়ী, লেখকরা এমন AI outputs-এর বিরুদ্ধে দাবি বজায় রেখেছেন যেগুলি original works পুনরুত্পাদন করে, এবং Anthropic-এর ভবিষ্যৎ আচরণের বিরুদ্ধেও। এতে AI copyright wars-এর আরেকটি আইনগত ও প্রযুক্তিগতভাবে কঠিন ফ্রন্ট খোলা থাকে। Training এক প্রশ্ন; output behavior আরেকটি। যদি কোনো model এমন text তৈরি করে যা কোনো protected work-এর খুব কাছাকাছি, বা ভবিষ্যতের collection practices আবারও অনুপযুক্ত উৎসের ওপর নির্ভর করে, তাহলে litigation-এর পথ খোলা থাকে।
এই carveout গুরুত্বপূর্ণ, কারণ এটি plaintiffs-দের abstract model behavior-এর বদলে concrete harms চ্যালেঞ্জ করার পথ রাখে। বড় corpora-তে training কীভাবে মূল্যায়ন করা হবে তা নিয়ে আদালত বিভক্ত থাকতে পারে, কিন্তু original expression পুনরুত্পাদনের সঙ্গে যুক্ত দাবি তুলনামূলকভাবে সহজে গঠন ও পরীক্ষা করা যায়। AI developers-এর জন্য এর মানে, আইনি কাজ শুধু উন্নত data sourcing-এ শেষ হয় না। এটি model evaluation, memorization-এর জন্য red-teaming, এবং এমন product controls পর্যন্ত বিস্তৃত হয় যা copyrighted material পুনরায় ঝরিয়ে দেওয়ার সম্ভাবনা কমায়।
এটির একটি বৃহত্তর নীতিগত প্রভাবও আছে। যদি আইনি ব্যবস্থা dataset provenance, output safeguards, এবং future conduct-কে আলাদা compliance layers হিসেবে দেখতে শুরু করে, তাহলে AI regulation আরও operational এবং কম দার্শনিক হয়ে উঠতে পারে। জনআলোচনা প্রায়ই ঘোরে এই প্রশ্নে যে training স্বভাবতই অনুমোদনযোগ্য নাকি স্বভাবতই শোষণমূলক। এর বিপরীতে, আদালত সমস্যা নিয়ে যেতে পারে আরও সংকীর্ণ প্রশ্নে: copy কি আইনসম্মতভাবে অর্জিত হয়েছিল? use কি transformative ছিল? output কি protected expression পুনরুত্পাদন করেছে? measurable market harm কি ছিল?
এর পর কী
source text স্পষ্টভাবে বলে যে একটি বড় প্রশ্ন এখনও অনির্ধারিত: লেখকদের সম্মতি ছাড়া ইন্টারনেট কনটেন্টের mass scraping কি legal acquisition হিসেবে গণ্য হবে? এই প্রশ্ন বইয়ের বাইরেও অনেক দূর বিস্তৃত। এটি সরাসরি web data-কে স্পর্শ করে, যা অধিকাংশ frontier models-কে চালিত করেছে। যদি আদালত ওই প্রেক্ষিতে consent এবং acquisition নিয়ে আরও কঠোর দৃষ্টিভঙ্গি গ্রহণ করে, তাহলে Anthropic-এর fair-use অবস্থান থেকে যে জয় প্রতীয়মান হচ্ছে, তা দ্রুত সংকুচিত হতে পারে। যদি তা না করে, তাহলে শিল্পখাত এই মামলাকে এমন প্রমাণ হিসেবে দেখাতে পারে যে নিরাপদ পথ কপিরাইটেড উপকরণে training বন্ধ করা নয়, বরং সেই উপকরণ কীভাবে সংগ্রহ ও পরিচালনা করা হচ্ছে তা পরিষ্কার করা।
এখনের জন্য, এই সমঝোতা এক ধরনের paradoxical milestone। এটি একটি record-setting copyright payout এবং reputational blow। একই সঙ্গে, এটি এমন একটি আইনি কাঠামোকেও শক্তিশালী করছে বলে মনে হয়, যেখানে piracy দণ্ডনীয়, কিন্তু আইনসম্মতভাবে প্রাপ্ত কাজের ওপর training এখনও প্রতিরক্ষাযোগ্য হতে পারে। এই সমন্বয় AI copyright fight শেষ করবে না। বরং সম্ভবত এটিকে আরও তীব্র করবে। লেখক, প্রকাশক, এবং model companies এখন আরও পরিষ্কারভাবে বুঝতে পারছেন যে একটি আদালত কোথায় সীমারেখা টানছে, এবং সেই স্পষ্টতা পরের দফার মামলাগুলোকে শান্ত করার বদলে আরও তীব্র করতে পারে।
ব্যবহারিক takeaway সরাসরি। AI কোম্পানিগুলি আর dataset assembly-কে কেবল ব্যাকগ্রাউন্ড technical detail হিসেবে ধরতে পারে না। Provenance একটি first-order legal risk হয়ে উঠছে। একই সঙ্গে, training itself-এর বিরুদ্ধে বড় precedent আশা করা rights holders এখানে তা পাননি। যুক্তি সংকুচিত হয়েছে, অদৃশ্য হয়নি। আর সেই সংকুচিত যুক্তির মধ্যেই AI copyright battle-এর ভবিষ্যৎ লুকিয়ে আছে।
এই নিবন্ধটি The Decoder-এর প্রতিবেদনের ভিত্তিতে লেখা। মূল নিবন্ধ পড়ুন.
Originally published on the-decoder.com


