उत्तम मजकूर निष्कर्षण स्वच्छ प्रशिक्षण डेटा उघडू शकते

Hugging Face आणि EleutherAI यांच्या नव्या benchmarking प्रयत्नानुसार, open language models सुधारण्याचा सर्वात व्यावहारिक मार्ग मोठे model architecture किंवा नवा training recipe नसून, चांगला source text आहे. त्यांचा FineBooks प्रकल्प तपासतो की आधुनिक open-weight optical character recognition systems सार्वजनिक-डोमेन book datasets मधील दीर्घकालीन कमकुवतपणा दुरुस्त करू शकतात का: स्कॅनमधून years ago त्रुटीपूर्ण OCR tools वापरून काढलेला मजकूर.

ही समस्या महत्त्वाची आहे, कारण खुले-परवानाधारक ऐतिहासिक लेखनाचा मोठा भाग AI developers पर्यंत noisy स्वरूपात पोहोचतो. libraries ने आजच्या generative AI boom च्या खूप आधी मोठे संग्रह digitize केले होते, आणि त्या archives पैकी बऱ्याच जुन्या OCR pipelines ने process झाल्या होत्या, ज्यामुळे missing characters, खराब spacing, चुकीचे शब्द, आणि structural errors आले. एकदा या चुका training corpora मध्ये गेल्या की, language models शिकवण्यासाठी वापरल्या जाणाऱ्या सामग्रीची गुणवत्ता कमी होते.

स्थिती किती सुधारली आहे हे मोजण्याचा प्रयत्न म्हणजे FineBooks. या प्रकल्पाने historical books च्या 2,165 pages वर 14 open-weight OCR models तपासले आणि निकाल leaderboard म्हणून प्रसिद्ध केले. दिलेल्या source text नुसार, सर्वोत्तम systems ने 97% पेक्षा जास्त character accuracy मिळवली, आणि खर्च प्रति हजार pages दोन अमेरिकी डॉलरपेक्षा कमी होता. ही जोडणी लक्षवेधी आहे, कारण त्यामुळे मोठ्या प्रमाणावर cleanup आता operationally realistic होऊ शकते, अशा open-data projects साठी जे महागडी proprietary processing परवडवू शकत नाहीत.

OCR quality language models साठी का महत्त्वाची आहे

source text Talkie project मधील आधीच्या निष्कर्षाकडे निर्देश करते, ज्याने खराब OCR चा तोटा मोजला होता. त्या तुलनेत, OCR-derived text वर प्रशिक्षित language model ने, त्याच पुस्तकांच्या human transcriptions वर प्रशिक्षित model च्या केवळ 30% कार्यक्षमतेने शिकले. हा निष्कर्ष OCR errors ना किरकोळ archival त्रास न मानता model training quality वरची थेट bottleneck म्हणून मांडतो.

Open-model developers साठी याचा अर्थ सोपा आहे. जर सार्वजनिक-डोमेन पुस्तके licensed किंवा license-compatible text चा मुख्य स्रोत असतील, तर त्यांची transcription quality सुधारल्याने नवीन content deals न करता dataset चे मूल्य वाढू शकते. हे विशेषतः त्या समुदायांसाठी relevant आहे जे पूर्णपणे open inputs मधून मजबूत models तयार करू इच्छितात.

FineBooks चे लेखक historical books वर लक्ष केंद्रित करतात कारण scale मोठा आहे आणि फायदा तात्काळ आहे. source text मध्ये म्हटले आहे की Common Pile, ज्याचे वर्णन तेथे गेल्या वर्षी प्रसिद्ध झालेल्या सर्वात मोठ्या openly licensed training corpus म्हणून केले आहे, त्यात जुन्या OCR runs मधून आलेल्या मजकुरासह सुमारे 3,00,000 public-domain books आहेत. त्या संग्रहाचा काही भागही चांगल्या tools ने पुन्हा process केल्यास महत्त्वाच्या open training resource चा quality profile बदलू शकतो.

लहान models अपेक्षेपेक्षा चांगले काम करत होते

source text मधील अधिक ठळक findings पैकी एक म्हणजे लहान OCR models अनेकदा मोठ्यांपेक्षा सरस ठरले. हे त्या सामान्य समजुतीच्या विरोधात जाते की जास्त parameters म्हणजे आपोआप चांगले performance. प्रत्यक्षात OCR quality ही layout handling, training data, language coverage, आणि model degraded scans, table of contents, illustrations, आणि unusual typography शी किती चांगले जुळवून घेतो यावर मोठ्या प्रमाणात अवलंबून असते. केवळ size पुरेसा नाही.

candidate metadata मध्ये नमूद केलेला top model dots.mocr आहे, ज्याने कथितरीत्या 97.6% character accuracy मिळवली. FineBooks cost efficiency वरही भर देते, जे mass reprocessing विचारात घेणाऱ्या संस्थांसाठी आणखी एक महत्त्वाचा घटक आहे. जर मजबूत OCR कमी खर्चात चालवता आले, तर historical-text cleanup ची economics वेगळी दिसू लागते. archival rescanning ला specialized, expensive curation task म्हणून पाहण्याऐवजी developers ते ordinary dataset preparation pipelines मध्ये समाविष्ट करू शकतात.

2,165 ground-truth pages पैकी तीन: एक single-column English natural history text, एक multilingual table of contents, आणि एक illustration plate ज्याचे संपूर्ण transcription हे artist credit ची एक ओळ आहे. | Image: FineBooks / Biodiversity Heritage Library
2,165 ground-truth pages पैकी तीन: एक single-column English natural history text, एक multilingual table of contents, आणि एक illustration plate ज्याचे संपूर्ण transcription हे artist credit ची एक ओळ आहे. | Image: FineBooks / Biodiversity Heritage Library

benchmark dataset स्वतः पुस्तक scanning मधील प्रत्यक्ष गुंतागुंती प्रतिबिंबित करण्यासाठीच तयार केलेले दिसते. source text मध्ये एक single-column English natural history page, multilingual table of contents, आणि एक illustration plate यांची उदाहरणे दिली आहेत, जिथे संपूर्ण transcription फक्त artist credit ची एक ओळ आहे. ही उदाहरणे महत्त्वाची आहेत, कारण historical books म्हणजे स्वच्छ prose चे एकसारखे ब्लॉक्स नसतात. OCR systems ला multilingual pages, decorative formatting, sparse text, आणि recognition गोंधळात टाकणाऱ्या visual artifacts शी सामना करावा लागतो.

मजबूत open datasets कडे एक मार्ग, पण मर्यादांसह

FineBooks कामाचा सर्वात मोठा जवळच्या काळातील परिणाम end-user products पेक्षा open-data maintenance वर होऊ शकतो. Biodiversity Heritage Library सारख्या archives मधील लाखो pages पुन्हा process केल्याने भविष्यातील open models साठी मजकुराची quality सुधारू शकते. source text म्हणते की केवळ त्या library मध्ये 3,00,000 पेक्षा अधिक digitized natural history documents आहेत, एकूण 6.4 कोटींपेक्षा जास्त pages, जे automation का आवश्यक आहे हे दाखवते. इतक्या प्रमाणावर human transcription अव्यवहार्य आहे.

तरीही, संशोधक current OCR ला प्रत्येक use case साठी पूर्ण उपाय मानत नाहीत. source text नुसार सर्वोत्तम outputs AI training purposes साठी आधीच पुरेसे चांगले आहेत, पण scholarly किंवा scientific applications साठी अजूनही खूप error-prone आहेत. हा फरक महत्त्वाचा आहे. एक language model, विशेषतः objective broad pattern learning असेल तर, अब्जावधी tokens मध्ये पसरलेल्या काही noise ला सहन करू शकतो. पण अचूक citations सह काम करणारा historian, librarian, किंवा scientist करू शकत नाही.

म्हणून व्यावहारिक निष्कर्ष “OCR solved” पेक्षा अधिक मर्यादित आहे. FineBooks सूचित करते की OCR इतके सुधारले आहे की training corpora लक्षणीयरीत्या अपग्रेड करता येतील, पण textual fidelity जिथे निर्णायक आहे तिथे सावध human review ची जागा ते घेऊ शकत नाही. developers आणि researchers यांनी हे standards एकत्र मिसळू नयेत. Training usability आणि archival accuracy ही संबंधित उद्दिष्टे आहेत, पण समान नाहीत.

हे एकाच benchmark पलीकडे का महत्त्वाचे आहे

FineBooks हे AI infrastructure मधील व्यापक बदलाचा भाग आहे: केवळ models optimize न करता inputs सुधारणे. अलीकडच्या वर्षांत AI progress वरची सार्वजनिक चर्चा chips, parameters, आणि benchmark scores वर केंद्रित राहिली आहे. पण open-model builders समोर एक शांत मर्यादा देखील आहे: ते कायदेशीर आणि practically वापरू शकतील अशा text ची quality. चांगला OCR digital archives मध्ये आधीच पडलेल्या public-domain material चे मूल्य वाढवतो.

जर benchmark टिकून राहिला आणि tooling व्यापकपणे स्वीकारले गेले, तर historical literature, scientific texts, आणि archival collections वर प्रशिक्षित भविष्यातील open models साठी तो meaningful quality lift देऊ शकतो. यामुळे better curation, deduplication, आणि filtering ची गरज संपणार नाही, पण preventable degradation चा एक स्पष्ट स्रोत दूर होईल.

मोठा धडा म्हणजे data infrastructure अजूनही मोठे gains देते. तुलनेने स्वस्त OCR improvement dataset quality, training efficiency, आणि model behavior मध्ये पुढे परिणाम करू शकते. budget आणि licensing constraints मध्ये काम करणाऱ्या open AI ecosystems साठी, हे आत्ताच उपलब्ध असलेल्या अधिक परिणामकारक upgrades पैकी एक असू शकते.

हा लेख The Decoder च्या रिपोर्टिंगवर आधारित आहे. मूळ लेख वाचा.

Originally published on the-decoder.com