மேம்பட்ட உரை எடுத்தெடுப்பு சுத்தமான பயிற்சி தரவைக் கொண்டு வரலாம்
Hugging Face மற்றும் EleutherAI நடத்திய புதிய பெஞ்ச்மார்க் முயற்சி, திறந்த மொழி மாதிரிகளை மேம்படுத்தும் மிகப் பயனுள்ள வழி பெரிய மாதிரி கட்டமைப்போ புதிய பயிற்சி முறையோ அல்ல, மூல உரையை மேம்படுத்துவதே என வாதிடுகிறது. அவர்களின் FineBooks திட்டம், நவீன open-weight optical character recognition அமைப்புகள் பொதுத்துறைப் புத்தக தரவுத்தொகுப்புகளில் நீண்டகாலமாக இருந்த பலவீனத்தை சரிசெய்ய முடியுமா என்பதை மதிப்பிடுகிறது: பிழை வாய்ப்புள்ள OCR கருவிகளால் ஆண்டுகள் முன்பு ஸ்கேன்களில் இருந்து எடுத்த உரை.
இந்த பிரச்சனை முக்கியமானது, ஏனெனில் திறந்த உரிமம் கொண்ட வரலாற்றுச் எழுத்துகளின் பெரிய பகுதி AI உருவாக்குநர்களிடம் சத்தமிக்க வடிவில் தான் சேர்கிறது. நூலகங்கள் இன்றைய generative AI வெடிப்புக்கு பல ஆண்டுகளுக்கு முன்பே பெரும் தொகுப்புகளை டிஜிட்டல் செய்திருந்தன, மேலும் அந்த காப்பகங்களில் பல பழைய OCR செயல்முறைகளால் செயல்படுத்தப்பட்டு, விடுபட்ட எழுத்துகள், தவறான இடைவெளிகள், தவறாக மாற்றப்பட்ட சொற்கள், மற்றும் கட்டமைப்பு பிழைகள் ஏற்பட்டன. இந்த தவறுகள் பயிற்சி corpus-இல் சேர்ந்தவுடன், மொழி மாதிரிகளை கற்பிப்பதற்குப் பயன்படுத்தப்படும் பொருளின் தரத்தை குறைக்கின்றன.
FineBooks, நிலைமை எவ்வளவு மேம்பட்டுள்ளது என்பதை அளவிடும் ஒரு முயற்சி. இந்த திட்டம் வரலாற்றுப் புத்தகங்களின் 2,165 பக்கங்களில் 14 open-weight OCR மாதிரிகளை சோதித்து, முடிவுகளை ஒரு leaderboard ஆக வெளியிட்டது. வழங்கப்பட்ட மூல உரையின் படி, சிறந்த அமைப்புகள் 97%க்கு மேல் character accuracy-ஐ அடைந்தன, அதே நேரத்தில் ஆயிரம் பக்கங்களுக்கு இரு அமெரிக்க டாலர்களுக்கும் குறைவாக செலவானது. பெரிய அளவில் சுத்திகரிப்பு இப்போது open-data திட்டங்களுக்கு செயல்பாட்டு ரீதியாக சாத்தியமானதாக இருக்கலாம் என்பதைக் காட்டுவதால் இந்த இணைப்பு குறிப்பிடத்தக்கது; ஏனெனில் அவை விலையுயர்ந்த proprietary processing-ஐ ஏற்றுக்கொள்ள முடியாது.
OCR தரம் மொழி மாதிரிகளுக்கு ஏன் முக்கியம்
மூல உரை, மோசமான OCR-ன் பாதிப்பை கணக்கிட்ட Talkie திட்டத்தின் ஒரு முந்தைய முடிவை சுட்டிக்காட்டுகிறது. அந்த ஒப்பீட்டில், OCR-derived உரையில் பயிற்சி பெற்ற ஒரு மொழி மாதிரி, அதே புத்தகங்களின் மனித transcription-களில் பயிற்சி பெற்ற மாதிரியின் செயல்திறனின் 30% மட்டுமே கற்றது. இது OCR பிழைகளை ஒரு சிறிய காப்பக தொந்தரவாக அல்ல, மாதிரி பயிற்சி தரத்தின் நேரடி bottleneck ஆக அமைக்கிறது.
Open-model உருவாக்குநர்களுக்கு இதன் பொருள் எளிது. பொதுத்துறைப் புத்தகங்கள் உரிமம் பெற்ற அல்லது உரிமம்-ஒத்த உரையின் முக்கிய மூலமாக இருந்தால், புதிய உள்ளடக்க ஒப்பந்தங்களை பேச்சுவார்த்தை நடத்தாமலேயே அவற்றின் transcription தரத்தை மேம்படுத்துவது ஒரு dataset-ன் மதிப்பை உயர்த்தலாம். முழுமையாக open inputs-இல் இருந்து வலுவான மாதிரிகளை உருவாக்க முயலும் சமூகங்களுக்கு இது குறிப்பாக முக்கியம்.
FineBooks ஆசிரியர்கள் வரலாற்றுப் புத்தகங்களில் கவனம் செலுத்துகிறார்கள், ஏனெனில் அளவு பெரியது, நன்மை உடனடியாக கிடைக்கக்கூடியது. மூல உரை கூறுவதாவது, கடந்த ஆண்டு வெளியிடப்பட்ட மிகப்பெரிய openly licensed training corpus என அங்கே விவரிக்கப்பட்ட Common Pile-ல், பழைய OCR runs-இல் இருந்து வந்த உரையுடன் சுமார் 3,00,000 பொதுத்துறைப் புத்தகங்கள் உள்ளன. அந்த தொகுப்பின் ஒரு பகுதியை கூட சிறந்த கருவிகளால் மறுசெயலாக்குவது ஒரு முக்கிய open training resource-இன் தரப் profile-ஐ மாற்றக்கூடும்.
சிறிய மாதிரிகள் எதிர்பாராத விதத்தில் நன்றாக செயல்பட்டன
மூல உரையின் மிகவும் கணிசமான கண்டுபிடிப்புகளில் ஒன்று, சிறிய OCR மாதிரிகள் அடிக்கடி பெரியவற்றை முந்தின என்பதாகும். இது அதிக parameters தானாகவே சிறந்த செயல்திறனாக மாறும் என்ற பொதுவான கருதுகோளுக்கு எதிரானது. நடைமுறையில், OCR தரம் layout handling, பயிற்சி தரவு, மொழி coverage, மற்றும் ஒரு மாதிரி சேதமடைந்த scans, உள்ளடக்க அட்டவணைகள், படங்கள், மற்றும் அசாதாரண typography-யை எவ்வாறு கையாளுகிறது என்பதில்தான் பெரிதும் சார்ந்துள்ளது. அளவு மட்டும் போதாது.
candidate metadata-வில் குறிப்பிடப்பட்ட சிறந்த மாதிரி dots.mocr; அது 97.6% character accuracy-ஐ எட்டியதாக கூறப்படுகிறது. FineBooks செலவுத் திறனையும் வலியுறுத்துகிறது, இது பெரிய அளவில் மறுசெயலாக்கத்தை பரிசீலிக்கும் நிறுவனங்களுக்கு மற்றொரு முக்கிய மாறி. வலுவான OCR குறைந்த செலவில் இயக்கப்படுமானால், வரலாற்று உரை சுத்திகரிப்பின் பொருளாதாரம் வேறு விதமாகத் தோன்றத் தொடங்குகிறது. காப்பக ஸ்கேனிங்கை ஒரு சிறப்பு, விலையுயர்ந்த curation பணியாகக் கருதுவதற்குப் பதிலாக, உருவாக்குநர்கள் அதை வழக்கமான dataset தயாரிப்பு pipeline-களில் சேர்க்க முடியும்.

Benchmark dataset தானே புத்தக ஸ்கேனிங்கின் உண்மையான சிக்கல்களை பிரதிபலிக்க வடிவமைக்கப்பட்டதாகத் தெரிகிறது. மூல உரை single-column English natural history page, multilingual table of contents, மற்றும் முழு transcription-வும் artist credit-இன் ஒரே வரியாக உள்ள illustration plate போன்ற எடுத்துக்காட்டுகளை விவரிக்கிறது. இவை முக்கியம், ஏனெனில் வரலாற்றுப் புத்தகங்கள் சுத்தமான prose-இன் ஒரே மாதிரியான தொகுதிகள் அல்ல. OCR அமைப்புகள் multilingual pages, decorative formatting, sparse text, மற்றும் recognition-ஐ குழப்பக்கூடிய visual artifacts-ஐ சமாளிக்க வேண்டும்.
வலுவான open datasets-க்கு ஒரு வழி, ஆனால் வரம்புகளுடன்
FineBooks பணியின் மிகப்பெரிய அருகாமைக் கால விளைவு இறுதி-பயனர் தயாரிப்புகளைவிட open-data maintenance-இல் இருக்கலாம். Biodiversity Heritage Library போன்ற காப்பகங்களிலிருந்து கோடிக்கணக்கான பக்கங்களை மறுசெயலாக்குவது, எதிர்கால open models-ஐ ஊட்டும் உரைத் தரத்தை மேம்படுத்தலாம். அந்த நூலகத்தில் மட்டும் 3,00,000-க்கும் மேற்பட்ட digitized natural history documents உள்ளன, மொத்தம் 6.4 கோடிக்கும் அதிகமான பக்கங்களுடன், அதனால் automation ஏன் அவசியம் என்பதும் தெளிவாகிறது. அந்த அளவில் மனித transcription நடைமுறையில் சாத்தியமில்லை.
அவ்வாறே, தற்போதைய OCR எல்லா பயன்பாட்டிற்கும் முழுமையான தீர்வு அல்ல என ஆராய்ச்சியாளர்கள் கூறுகிறார்கள். சிறந்த output-கள் AI training நோக்கத்திற்கு ஏற்கனவே போதுமானவை, ஆனால் கல்விசார் அல்லது அறிவியல் பயன்பாடுகளுக்கு இன்னும் அதிக பிழை வாய்ப்புடையவை என மூல உரை கூறுகிறது. இந்த வேறுபாடு முக்கியம். ஒரு language model, குறிப்பாக குறிக்கோள் பரந்த முறை கற்றல் என்றால், பில்லியன் கணக்கான tokens-களில் பரவும் சில சத்தத்தை தாங்க முடியும். ஆனால் துல்லியமான மேற்கோள்களுடன் வேலை செய்யும் வரலாற்றாளர், நூலகர், அல்லது விஞ்ஞானி அப்படிச் செய்ய முடியாது.
ஆகவே, நடைமுறை முடிவு “OCR தீர்ந்துவிட்டது” என்பதைக் காட்டிலும் குறுகியது. FineBooks OCR போதுமான அளவு மேம்பட்டுள்ளது; training corpora-வை கணிசமாக மேம்படுத்த முடியும், ஆனால் உரை நம்பகத்தன்மை முக்கியமான இடங்களில் கவனமான மனித மதிப்பாய்வை மாற்ற முடியாது. உருவாக்குநர்களும் ஆராய்ச்சியாளர்களும் இந்த தரங்களை ஒன்றாகக் கலக்கக் கூடாது. Training usability மற்றும் archival accuracy தொடர்புடைய இலக்குகள், ஆனால் ஒன்றல்ல.
ஒரு பெஞ்ச்மார்க்கைத் தாண்டி இது ஏன் முக்கியம்
FineBooks, AI உள்கட்டமைப்பில் ஒரு பரந்த மாற்றத்தின் பகுதியாக உள்ளது: மாதிரிகளை மட்டுமே மேம்படுத்தாமல், input-களை மேம்படுத்துவது. சமீப ஆண்டுகளில் AI முன்னேற்றம் குறித்த பொது விவாதம் chips, parameters, மற்றும் benchmark scores மீது பெரிதும் கவனம் செலுத்தியுள்ளது. ஆனால் open-model உருவாக்குநர்கள் ஒரு அமைதியான கட்டுப்பாட்டையும் எதிர்கொள்கிறார்கள்: அவர்கள் சட்டபூர்வமாகவும் நடைமுறையிலும் பயன்படுத்த முடியும் உரையின் தரம். மேம்பட்ட OCR, ஏற்கனவே டிஜிட்டல் காப்பகங்களில் கிடக்கும் பொதுத்துறைப் பொருளின் மதிப்பை விரிவாக்குகிறது.
Benchmark நிலைநிறுத்தப்பட்டு, கருவிகள் பரவலாக ஏற்றுக்கொள்ளப்பட்டால், வரலாற்று இலக்கியம், அறிவியல் உரைகள், மற்றும் காப்பகத் தொகுப்புகள் மீது பயிற்சி பெறும் எதிர்கால open models-க்கு இது குறிப்பிடத்தக்க தர உயர்வைத் தரலாம். அது better curation, deduplication, மற்றும் filtering தேவையை நீக்காது; ஆனால் தவிர்க்கக்கூடிய குன்றுதலின் ஒரு தெளிவான மூலத்தை அகற்றும்.
பரந்த பாடம் என்னவென்றால், data infrastructure இன்னும் பெரிய பலன்களை வழங்குகிறது. ஒப்பீட்டளவில் குறைந்த செலவுள்ள OCR மேம்பாடு dataset தரம், training efficiency, மற்றும் model behavior ஆகியவற்றில் அலைபாய்வை ஏற்படுத்த முடியும். பட்ஜெட் மற்றும் உரிமம் கட்டுப்பாடுகளின் கீழ் இயங்கும் open AI ecosystem-களுக்கு, இது இப்போது கிடைக்கும் மிகக் குறிப்பிடத்தக்க மேம்பாடுகளில் ஒன்றாக இருக்கலாம்.
இந்தக் கட்டுரை The Decoder வழங்கிய செய்தியினை அடிப்படையாகக் கொண்டது. மூலக் கட்டுரையைப் படிக்கவும்.
Originally published on the-decoder.com


