আরও ভালো টেক্সট এক্সট্রাকশন পরিষ্কার প্রশিক্ষণ ডেটা খুলে দিতে পারে
Hugging Face এবং EleutherAI-এর একটি নতুন বেঞ্চমার্কিং প্রচেষ্টা বলছে, ওপেন ভাষা-মডেল উন্নত করার সবচেয়ে বাস্তবসম্মত উপায় বড় মডেল আর্কিটেকচার বা নতুন প্রশিক্ষণ রেসিপি নয়, বরং আরও ভালো উৎস-টেক্সট। তাদের FineBooks প্রকল্প দেখছে আধুনিক open-weight optical character recognition সিস্টেমগুলো কীভাবে পাবলিক-ডোমেইন বইয়ের ডেটাসেটে দীর্ঘদিনের দুর্বলতা মেরামত করতে পারে: এমন টেক্সট যা বছর আগে ত্রুটিপূর্ণ OCR টুল দিয়ে স্ক্যান থেকে বের করা হয়েছিল।
এই সমস্যা গুরুত্বপূর্ণ, কারণ মুক্ত-লাইসেন্সকৃত ঐতিহাসিক লেখার বড় অংশ AI ডেভেলপারদের কাছে নয়েজযুক্ত রূপে পৌঁছায়। আজকের generative AI বুমের অনেক আগে লাইব্রেরিগুলো বিশাল সংগ্রহ ডিজিটাইজ করেছিল, এবং সেই আর্কাইভগুলোর অনেকগুলোই পুরোনো OCR পাইপলাইন দিয়ে প্রক্রিয়াজাত হয়েছিল, যাতে অনুপস্থিত অক্ষর, খারাপ spacing, ভুল অনুলিপি করা শব্দ, এবং কাঠামোগত ত্রুটি ঢুকে পড়ে। এসব ভুল training corpora-তে প্রবেশ করলে, ভাষা-মডেল শেখাতে ব্যবহৃত উপাদানের মান কমে যায়।
FineBooks হলো পরিস্থিতি কতটা উন্নত হয়েছে তা মাপার একটি প্রয়াস। প্রকল্পটি ঐতিহাসিক বইয়ের 2,165 পৃষ্ঠায় 14টি open-weight OCR মডেল পরীক্ষা করে ফলাফল leaderboard আকারে প্রকাশ করেছে। প্রদত্ত উৎস-পাঠ অনুযায়ী, সেরা সিস্টেমগুলো 97% এর বেশি character accuracy অর্জন করেছে, আর খরচ ছিল প্রতি হাজার পৃষ্ঠায় দুই মার্কিন ডলারেরও কম। এই সংমিশ্রণটি গুরুত্বপূর্ণ, কারণ এটি ইঙ্গিত দেয় যে বড় আকারের cleanup এখন open-data প্রকল্পগুলোর জন্য কার্যত বাস্তবসম্মত হতে পারে, যেগুলো ব্যয়বহুল proprietary processing বহন করতে পারে না।
OCR মান ভাষা-মডেলের জন্য কেন জরুরি
উৎস-পাঠ Talkie প্রকল্পের একটি আগের ফলাফলের দিকে ইঙ্গিত করে, যা খারাপ OCR-এর ক্ষতি পরিমাপ করেছিল। সেই তুলনায়, OCR-derived টেক্সটে প্রশিক্ষিত একটি ভাষা-মডেল একই বইয়ের human transcriptions-এ প্রশিক্ষিত মডেলের মাত্র 30% দক্ষতায় শিখেছিল। এই ফলাফল OCR ত্রুটিকে ছোটখাটো আর্কাইভাল ঝামেলা নয়, বরং model training quality-র সরাসরি bottleneck হিসেবে চিহ্নিত করে।
Open-model নির্মাতাদের জন্য এর ইঙ্গিত সোজা। যদি পাবলিক-ডোমেইন বইগুলো লাইসেন্সড বা লাইসেন্স-সামঞ্জস্যপূর্ণ টেক্সটের একটি প্রধান উৎস হয়, তবে তাদের transcription quality উন্নত করলে নতুন content deal-এর দরকার না পড়েই ডেটাসেটের মূল্য বাড়তে পারে। এটি বিশেষভাবে গুরুত্বপূর্ণ তাদের জন্য, যারা সম্পূর্ণ ওপেন ইনপুট থেকে শক্তিশালী মডেল বানাতে চান।
FineBooks-এর লেখকরা ঐতিহাসিক বইকে কেন্দ্র করেছেন কারণ স্কেল বড় এবং লাভ তাৎক্ষণিক। উৎস-পাঠে বলা হয়েছে, গত বছর প্রকাশিত সবচেয়ে বড় openly licensed training corpus হিসেবে বর্ণিত Common Pile-এ প্রায় 3,00,000টি পাবলিক-ডোমেইন বই রয়েছে, য deren টেক্সট পুরোনো OCR runs থেকে এসেছে। ওই সংগ্রহের সামান্য অংশও ভালো টুল দিয়ে পুনঃপ্রক্রিয়াজাত করলে একটি গুরুত্বপূর্ণ open training resource-এর quality profile বদলে যেতে পারে।
ছোট মডেলগুলো অপ্রত্যাশিতভাবে ভালো করেছে
উৎস-পাঠের অন্যতম আকর্ষণীয় ফল হলো ছোট OCR মডেলগুলো অনেক সময় বড় মডেলকে হারিয়েছে। এটি সেই সাধারণ ধারণার বিরুদ্ধে যায় যে বেশি parameters স্বয়ংক্রিয়ভাবে ভালো পারফরম্যান্স দেয়। বাস্তবে OCR quality অনেকটাই layout handling, training data, language coverage, এবং একটি মডেল ক্ষতিগ্রস্ত স্ক্যান, table of contents, illustration, এবং অস্বাভাবিক typography কতটা ভালোভাবে সামলায় তার ওপর নির্ভর করে। শুধু size যথেষ্ট নয়।
candidate metadata-তে নাম থাকা শীর্ষ মডেল dots.mocr, যা reportedly 97.6% character accuracy অর্জন করেছে। FineBooks cost efficiency-ও জোর দিয়ে তুলে ধরে, যা mass reprocessing ভাবছেন এমন সংস্থাগুলোর জন্য আরেকটি গুরুত্বপূর্ণ ভেরিয়েবল। যদি শক্তিশালী OCR কম খরচে চালানো যায়, তাহলে ঐতিহাসিক টেক্সট cleanup-এর অর্থনীতি ভিন্ন দেখাতে শুরু করে। আর্কাইভাল scanning-কে একটি বিশেষায়িত, ব্যয়বহুল curation task হিসেবে দেখার বদলে ডেভেলপাররা এটিকে সাধারণ dataset preparation pipelines-এর অংশ করতে পারেন।

benchmark dataset নিজেই বই স্ক্যানিংয়ের বাস্তব জটিলতাগুলোকে প্রতিফলিত করার মতো করে তৈরি বলে মনে হয়। উৎস-পাঠে single-column English natural history page, multilingual table of contents, এবং একটি illustration plate-এর উদাহরণ বর্ণনা করা হয়েছে, যেখানে পুরো transcription কেবল artist credit-এর একটি লাইন। এসব উদাহরণ গুরুত্বপূর্ণ, কারণ ঐতিহাসিক বইগুলো পরিষ্কার prose-এর সমান ব্লক নয়। OCR সিস্টেমগুলোকে multilingual pages, decorative formatting, sparse text, এবং recognition-কে বিভ্রান্ত করতে পারে এমন visual artifacts সামলাতে হয়।
আরও শক্তিশালী open dataset-এর পথে একটি অগ্রগতি, তবে সীমাবদ্ধতা রয়েছে
FineBooks কাজের সবচেয়ে বড় নিকটবর্তী প্রভাব হতে পারে end-user products-এর বদলে open-data maintenance-এ। Biodiversity Heritage Library-এর মতো আর্কাইভ থেকে লক্ষ লক্ষ পৃষ্ঠা পুনঃপ্রক্রিয়াজাত করলে ভবিষ্যৎ open model-গুলোকে খাওয়ানো টেক্সটের মান উন্নত হতে পারে। উৎস-পাঠে বলা হয়েছে, শুধু ওই লাইব্রেরিতেই 3,00,000-এরও বেশি digitized natural history documents আছে, মোট 6.4 কোটিরও বেশি পৃষ্ঠা, যা দেখায় automation কেন অপরিহার্য। এই স্কেলে human transcription অবাস্তব।
তবে গবেষকেরা বর্তমান OCR-কে প্রতিটি use case-এর জন্য সম্পূর্ণ সমাধান হিসেবে দেখেন না। উৎস-পাঠে বলা হয়েছে, সেরা output এখন AI training purposes-এর জন্য যথেষ্ট ভালো, কিন্তু scholarly বা scientific applications-এর জন্য এখনও খুবই error-prone। এই পার্থক্য গুরুত্বপূর্ণ। একটি language model বিলিয়ন বিলিয়ন tokens জুড়ে ছড়িয়ে থাকা কিছু নয়েজ সহ্য করতে পারে, বিশেষ করে যদি লক্ষ্য হয় broad pattern learning। কিন্তু সুনির্দিষ্ট citations নিয়ে কাজ করা historian, librarian, বা scientist তা পারে না।
তাই বাস্তব উপসংহার “OCR solved” নয়, বরং আরও সংকীর্ণ। FineBooks বলছে OCR এতটাই উন্নত হয়েছে যে training corpora-কে বাস্তবভাবে আপগ্রেড করা যায়, তবে textual fidelity যেখানে জরুরি, সেখানে তা সতর্ক human review-এর বিকল্প নয়। ডেভেলপার ও গবেষকদের এই মানদণ্ডগুলোকে এক করে ফেলা উচিত নয়। Training usability এবং archival accuracy সম্পর্কিত লক্ষ্য, কিন্তু অভিন্ন নয়।
একটি বেঞ্চমার্কের বাইরেও এর গুরুত্ব কেন
FineBooks AI infrastructure-এ একটি বৃহত্তর পরিবর্তনের অংশ: শুধু মডেল অপ্টিমাইজ না করে inputs উন্নত করা। সাম্প্রতিক বছরগুলোতে AI অগ্রগতি নিয়ে জনআলোচনা chips, parameters, এবং benchmark scores-এর ওপর বেশি কেন্দ্রিত ছিল। কিন্তু open-model নির্মাতাদের আরেকটি নীরব সীমাবদ্ধতা আছে: তারা আইনগত ও ব্যবহারিকভাবে যে টেক্সট ব্যবহার করতে পারে তার মান। ভালো OCR, ডিজিটাল আর্কাইভে পড়ে থাকা পাবলিক-ডোমেইন উপাদানের মূল্য বাড়ায়।
যদি বেঞ্চমার্কটি টিকে যায় এবং tooling ব্যাপকভাবে গৃহীত হয়, তাহলে ইতিহাস-সাহিত্য, বৈজ্ঞানিক লেখা, এবং আর্কাইভাল সংগ্রহে প্রশিক্ষিত ভবিষ্যৎ open model-গুলোর জন্য এটি উল্লেখযোগ্য quality lift আনতে পারে। এতে উন্নত curation, deduplication, এবং filtering-এর প্রয়োজন শেষ হবে না, কিন্তু এটি একটি স্পষ্টভাবে প্রতিরোধযোগ্য অবনতি-উৎস দূর করবে।
বৃহত্তর শিক্ষা হলো data infrastructure এখনও বড় সুবিধা দেয়। তুলনামূলকভাবে সস্তা OCR উন্নয়ন dataset quality, training efficiency, এবং model behavior-এ ঢেউ তুলতে পারে। বাজেট ও লাইসেন্সিং সীমাবদ্ধতায় কাজ করা open AI ecosystem-এর জন্য, এটি এখনই উপলব্ধ সবচেয়ে তাৎপর্যপূর্ণ উন্নয়নগুলোর একটি হতে পারে।
এই নিবন্ধটি The Decoder-এর রিপোর্টিংয়ের ভিত্তিতে লেখা। মূল নিবন্ধটি পড়ুন.
Originally published on the-decoder.com




