बेहतर टेक्स्ट निष्कर्षण साफ प्रशिक्षण डेटा को अनलॉक कर सकता है

हगिंग फेस और एलिफ्थेरएआई का एक नया बेंचमार्क प्रयास तर्क देता है कि खुले भाषा मॉडल को बेहतर बनाने के सबसे व्यावहारिक तरीकों में से एक बड़ा मॉडल आर्किटेक्चर या नया प्रशिक्षण नुस्खा नहीं है, बल्कि बेहतर स्रोत पाठ है। उनकी FineBooks परियोजना मूल्यांकन करती है कि क्या आधुनिक ओपन-वेट ऑप्टिकल कैरेक्टर रिकग्निशन सिस्टम सार्वजनिक डोमेन पुस्तक डेटासेट में एक लंबे समय से चली आ रही कमजोरी को ठीक कर सकते हैं: पाठ जो वर्षों पहले स्कैन से त्रुटि-प्रवण OCR उपकरणों के साथ निकाला गया था।

यह समस्या मायने रखती है क्योंकि खुले तौर पर लाइसेंस प्राप्त ऐतिहासिक लेखन का एक बड़ा हिस्सा शोरगुल वाले रूप में AI डेवलपर्स तक पहुंचता है। पुस्तकालयों ने आज के जनरेटिव AI उछाल से बहुत पहले विशाल संग्रह डिजिटाइज़ किए थे, और उनमें से कई अभिलेखागार पुराने OCR पाइपलाइनों के साथ संसाधित किए गए थे जिन्होंने लापता वर्ण, खराब स्पेसिंग, गलत लिखे गए शब्द और संरचनात्मक त्रुटियां पेश कीं। एक बार जब ये गलतियाँ प्रशिक्षण कोरपोरा में प्रवेश कर जाती हैं, तो वे भाषा मॉडल सिखाने के लिए उपयोग की जाने वाली सामग्री की गुणवत्ता को कम कर देती हैं।

FineBooks यह मापने का एक प्रयास है कि स्थिति में कितना सुधार हुआ है। परियोजना ने ऐतिहासिक पुस्तकों के 2,165 पृष्ठों पर 14 ओपन-वेट OCR मॉडल का परीक्षण किया और परिणामों को एक लीडरबोर्ड के रूप में प्रकाशित किया। आपूर्ति किए गए स्रोत पाठ के अनुसार, सर्वोत्तम प्रणालियों ने 97% से अधिक वर्ण सटीकता उत्पन्न की, जबकि प्रति हजार पृष्ठों की लागत दो अमेरिकी डॉलर से कम थी। यह संयोजन उल्लेखनीय है क्योंकि यह बताता है कि बड़े पैमाने पर सफाई अब खुले डेटा परियोजनाओं के लिए परिचालन रूप से यथार्थवादी हो सकती है जो महंगी मालिकाना प्रसंस्करण नहीं खरीद सकती हैं।

भाषा मॉडल के लिए OCR गुणवत्ता क्यों मायने रखती है

स्रोत पाठ टॉकी परियोजना के एक पहले के परिणाम की ओर इशारा करता है जिसने खराब OCR के नुकसान को मापा। उस तुलना में, OCR-व्युत्पन्न पाठ पर प्रशिक्षित एक भाषा मॉडल ने उन्हीं पुस्तकों के मानव प्रतिलेखों पर प्रशिक्षित मॉडल की दक्षता के केवल 30% पर सीखा। यह निष्कर्ष OCR त्रुटियों को एक मामूली अभिलेखीय उपद्रव के रूप में नहीं, बल्कि मॉडल प्रशिक्षण गुणवत्ता पर सीधी बाधा के रूप में फ्रेम करता है।

ओपन-मॉडल डेवलपर्स के लिए, निहितार्थ सीधा है। यदि सार्वजनिक डोमेन पुस्तकें लाइसेंस प्राप्त या लाइसेंस-संगत पाठ का एक मुख्य स्रोत हैं, तो उनकी प्रतिलेखन गुणवत्ता में सुधार नए सामग्री सौदों पर बातचीत किए बिना डेटासेट के मूल्य को बढ़ा सकता है। यह उन समुदायों के लिए विशेष रूप से प्रासंगिक है जो पूरी तरह से खुले इनपुट से मजबूत मॉडल बनाने की कोशिश कर रहे हैं।

FineBooks लेखक ऐतिहासिक पुस्तकों पर ध्यान केंद्रित करते हैं क्योंकि पैमाना बड़ा है और लाभ तत्काल है। स्रोत पाठ नोट करता है कि कॉमन पाइल, जिसे पिछले साल जारी सबसे बड़ा खुला लाइसेंस प्राप्त प्रशिक्षण कोरपस बताया गया है, में लगभग 300,000 सार्वजनिक डोमेन पुस्तकें शामिल हैं जिनका पाठ पुराने OCR रन से आया था। उस संग्रह के कुछ हिस्से को भी बेहतर उपकरणों के साथ पुनः संसाधित करने से एक महत्वपूर्ण खुले प्रशिक्षण संसाधन की गुणवत्ता प्रोफ़ाइल बदल सकती है।

छोटे मॉडल ने अप्रत्याशित रूप से अच्छा प्रदर्शन किया

स्रोत पाठ में अधिक हड़ताली निष्कर्षों में से एक यह है कि छोटे OCR मॉडल अक्सर बड़े मॉडल को हरा देते हैं। यह आम धारणा के खिलाफ जाता है कि अधिक पैरामीटर स्वचालित रूप से बेहतर प्रदर्शन में तब्दील हो जाते हैं। व्यवहार में, OCR गुणवत्ता काफी हद तक लेआउट हैंडलिंग, प्रशिक्षण डेटा, भाषा कवरेज, और मॉडल कितनी अच्छी तरह से खराब स्कैन, सामग्री की तालिका, चित्र और असामान्य टाइपोग्राफी से निपटता है, पर निर्भर करती है। अकेले आकार पर्याप्त नहीं है।

उम्मीदवार मेटाडेटा में नामित शीर्ष मॉडल dots.mocr है, जो कथित तौर पर 97.6% वर्ण सटीकता तक पहुंच गया। FineBooks लागत दक्षता पर भी जोर देता है, जो सामूहिक पुनर्प्रसंस्करण पर विचार करने वाले संगठनों के लिए एक और महत्वपूर्ण चर है। यदि मजबूत OCR सस्ते में चलाया जा सकता है, तो ऐतिहासिक-पाठ सफाई का अर्थशास्त्र अलग दिखने लगता है। अभिलेखीय पुनर्स्कैनिंग को एक विशेष, महंगे क्यूरेशन कार्य के रूप में मानने के बजाय, डेवलपर्स इसे सामान्य डेटासेट तैयारी पाइपलाइनों में शामिल करने में सक्षम हो सकते हैं।

तीन 2,165 ग्राउंड-ट्रुथ पृष्ठ: एक एकल-स्तंभ अंग्रेजी प्राकृतिक इतिहास पाठ, एक बहुभाषी सामग्री तालिका, और एक चित्रण प्लेट जिसका पूरा प्रतिलेखन कलाकार क्रेडिट की एक पंक्ति है। | छवि: FineBooks / बायोडायवर्सिटी हेरिटेज लाइब्रेरी
तीन 2,165 ग्राउंड-ट्रुथ पृष्ठ: एक एकल-स्तंभ अंग्रेजी प्राकृतिक इतिहास पाठ, एक बहुभाषी सामग्री तालिका, और एक चित्रण प्लेट जिसका पूरा प्रतिलेखन कलाकार क्रेडिट की एक पंक्ति है। | छवि: FineBooks / बायोडायवर्सिटी हेरिटेज लाइब्रेरी

बेंचमार्क डेटासेट स्वयं पुस्तक स्कैनिंग में वास्तविक जटिलताओं को प्रतिबिंबित करने के लिए डिज़ाइन किया गया है। स्रोत पाठ उन उदाहरणों का वर्णन करता है जिनमें एक एकल-स्तंभ अंग्रेजी प्राकृतिक इतिहास पृष्ठ, एक बहुभाषी सामग्री तालिका, और एक चित्रण प्लेट शामिल है जहां पूरा प्रतिलेखन केवल कलाकार क्रेडिट की एक पंक्ति है। ये उदाहरण मायने रखते हैं क्योंकि ऐतिहासिक पुस्तकें साफ गद्य के समान ब्लॉक नहीं हैं। OCR प्रणालियों को बहुभाषी पृष्ठों, सजावटी स्वरूपण, विरल पाठ और दृश्य कलाकृतियों से निपटना पड़ता है जो पहचान को भ्रमित कर सकते हैं।

मजबूत खुले डेटासेट का मार्ग, सीमाओं के साथ

FineBooks कार्य का सबसे बड़ा अल्पकालिक परिणाम अंत-उपयोगकर्ता उत्पादों के बजाय खुले-डेटा रखरखाव के लिए हो सकता है। बायोडायवर्सिटी हेरिटेज लाइब्रेरी जैसे अभिलेखागार से लाखों पृष्ठों को पुनः संसाधित करने से भविष्य के खुले मॉडलों को खिलाने वाली पाठ गुणवत्ता में सुधार हो सकता है। स्रोत पाठ कहता है कि अकेले पुस्तकालय में 300,000 से अधिक डिजिटलीकृत प्राकृतिक इतिहास दस्तावेज़ हैं जिनमें कुल 64 मिलियन से अधिक पृष्ठ हैं, जो दिखाता है कि स्वचालन क्यों आवश्यक है। उस पैमाने पर मानव प्रतिलेखन अवास्तविक है।

फिर भी, शोधकर्ता वर्तमान OCR को हर उपयोग के मामले के लिए पूर्ण समाधान के रूप में प्रस्तुत नहीं करते हैं। स्रोत पाठ कहता है कि सर्वोत्तम आउटपुट पहले से ही AI प्रशिक्षण उद्देश्यों के लिए पर्याप्त अच्छे हैं, लेकिन विद्वानों या वैज्ञानिक अनुप्रयोगों के लिए अभी भी बहुत अधिक त्रुटि-प्रवण हैं। यह अंतर महत्वपूर्ण है। एक भाषा मॉडल अरबों टोकन में फैले कुछ शोर को सहन कर सकता है, खासकर यदि उद्देश्य व्यापक पैटर्न सीखना है। एक इतिहासकार, लाइब्रेरियन, या वैज्ञानिक सटीक उद्धरणों के साथ काम नहीं कर सकता।

इसलिए व्यावहारिक निष्कर्ष "OCR हल हो गया है" से संकीर्ण है। FineBooks सुझाव देता है कि OCR में पर्याप्त सुधार हुआ है ताकि प्रशिक्षण कोरपोरा को सामग्री रूप से उन्नत किया जा सके, यह नहीं कि यह सावधानीपूर्वक मानव समीक्षा को प्रतिस्थापित कर सकता है जहां पाठ्य निष्ठा महत्वपूर्ण है। डेवलपर्स और शोधकर्ताओं को इन मानकों को एक में नहीं मिलाना चाहिए। प्रशिक्षण उपयोगिता और अभिलेखीय सटीकता संबंधित लक्ष्य हैं, लेकिन वे समान नहीं हैं।

यह एक बेंचमार्क से परे क्यों मायने रखता है

FineBooks AI बुनियादी ढांचे में एक बड़े बदलाव में फिट बैठता है: केवल मॉडलों को अनुकूलित करने के बजाय इनपुट में सुधार करना। हाल के वर्षों में, AI प्रगति के आसपास सार्वजनिक चर्चा चिप्स, मापदंडों और बेंचमार्क स्कोर पर केंद्रित रही है। लेकिन ओपन-मॉडल बिल्डरों को एक शांत बाधा का भी सामना करना पड़ता है: उन पाठों की गुणवत्ता जिन्हें वे कानूनी और व्यावहारिक रूप से उपयोग करने में सक्षम हैं। बेहतर OCR पहले से ही डिजिटल अभिलेखागार में बैठी सार्वजनिक डोमेन सामग्री के मूल्य का विस्तार करता है।

यदि बेंचमार्क कायम रहता है और उपकरण व्यापक रूप से अपनाया जाता है, तो परिणाम ऐतिहासिक साहित्य, वैज्ञानिक ग्रंथों और अभिलेखीय संग्रहों पर प्रशिक्षित भविष्य के खुले मॉडलों के लिए एक सार्थक गुणवत्ता वृद्धि हो सकती है। यह बेहतर क्यूरेशन, डीडुप्लिकेशन और फ़िल्टरिंग की आवश्यकता को समाप्त नहीं करेगा, लेकिन यह रोकथाम योग्य गिरावट के एक स्पष्ट स्रोत को हटा देगा।

व्यापक सबक यह है कि डेटा बुनियादी ढांचा अभी भी बड़े लाभ प्रदान करता है। एक अपेक्षाकृत सस्ता OCR सुधार डेटासेट गुणवत्ता, प्रशिक्षण दक्षता और मॉडल व्यवहार में आगे बढ़ सकता है। बजट और लाइसेंसिंग बाधाओं के तहत काम करने वाले खुले AI पारिस्थितिकी तंत्र के लिए, यह अभी उपलब्ध सबसे परिणामी उन्नयन में से एक हो सकता है।

यह लेख द डिकोडर की रिपोर्टिंग पर आधारित है। मूल लेख पढ़ें

Originally published on the-decoder.com