మెరుగైన టెక్స్ట్ ఎక్స్‌ట్రాక్షన్ శుభ్రమైన శిక్షణ డేటాను తెరవగలదు

Hugging Face మరియు EleutherAI చేసిన కొత్త బెంచ్‌మార్కింగ్ ప్రయత్నం ప్రకారం, ఓపెన్ భాషా మోడళ్లను మెరుగుపరచడానికి అత్యంత ప్రాయోగిక మార్గం పెద్ద మోడల్ ఆర్కిటెక్చర్ లేదా కొత్త శిక్షణ రెసిపీ కాదు, మెరుగైన మూల పాఠ్యం. వారి FineBooks ప్రాజెక్ట్, ఆధునిక open-weight optical character recognition వ్యవస్థలు ప్రజా-ప్రాంత పుస్తక డేటాసెట్‌లలో ఉన్న దీర్ఘకాలిక బలహీనతను సరిచేయగలవా అని పరిశీలిస్తోంది: లోపభూయిష్ట OCR టూల్స్‌తో సంవత్సరాల క్రితం స్కాన్‌ల నుండి తీసిన పాఠ్యం.

ఈ సమస్య ముఖ్యమైనది, ఎందుకంటే తెరిచి లైసెన్స్ ఉన్న చారిత్రక రచనల పెద్ద భాగం AI డెవలపర్లకు శబ్దభరిత రూపంలో చేరుతుంది. నేటి generative AI బూమ్‌కు చాలా ముందే లైబ్రరీలు భారీ సేకరణలను డిజిటైజ్ చేశాయి, మరియు వాటిలో చాలా పాత OCR పైప్‌లైన్‌లతో ప్రాసెస్ చేయబడి, తప్పిపోయిన అక్షరాలు, చెడు spacing, తప్పుగా ప్రతిలిపి చేసిన పదాలు, మరియు నిర్మాణాత్మక పొరపాట్లు వచ్చాయి. ఈ తప్పులు training corporaలోకి చేరిన తర్వాత, భాషా మోడళ్లను నేర్పడానికి ఉపయోగించే పదార్థ నాణ్యతను తగ్గిస్తాయి.

FineBooks పరిస్థితి ఎంత మెరుగుపడిందో కొలవడానికి చేసిన ప్రయత్నం. ఈ ప్రాజెక్ట్ చారిత్రక పుస్తకాల 2,165 పేజీలపై 14 open-weight OCR మోడళ్లను పరీక్షించి, ఫలితాలను leaderboard‌గా ప్రచురించింది. అందించిన మూల పాఠ్యం ప్రకారం, అత్యుత్తమ వ్యవస్థలు 97%కి పైగా character accuracy సాధించాయి, అదే సమయంలో వెయ్యి పేజీలకు రెండు అమెరికన్ డాలర్లకంటే తక్కువ ఖర్చుతో. ఈ కలయిక ప్రాముఖ్యమైనది, ఎందుకంటే పెద్ద స్థాయి శుభ్రపరిచే పని ఇప్పుడు ఖరీదైన proprietary processing‌ను భరించలేని open-data ప్రాజెక్టులకు ఆపరేషనల్‌గా వాస్తవికంగా మారవచ్చని సూచిస్తోంది.

OCR నాణ్యత భాషా మోడళ్లకు ఎందుకు ముఖ్యం

మూల పాఠ్యం, చెడు OCR లోపాన్ని కొలిచిన Talkie ప్రాజెక్ట్‌లోని ముందరి ఫలితాన్ని సూచిస్తోంది. ఆ పోలికలో, OCR-derived పాఠ్యంపై శిక్షణ పొందిన భాషా మోడల్, అదే పుస్తకాల human transcriptions‌పై శిక్షణ పొందిన మోడల్ సమర్థతలో కేవలం 30% వద్ద మాత్రమే నేర్చుకుంది. ఈ కనుగొనడం OCR తప్పులను చిన్న ఆర్కైవ్ అసౌకర్యంగా కాక, మోడల్ శిక్షణ నాణ్యతపై ప్రత్యక్ష bottleneck‌గా చూపిస్తుంది.

Open-model డెవలపర్లకు దీని అర్థం సూటిగా ఉంటుంది. ప్రజా-ప్రాంత పుస్తకాలు లైసెన్స్ ఉన్న లేదా లైసెన్స్-అనుకూల పాఠ్యానికి ప్రధాన మూలమైతే, కొత్త కంటెంట్ ఒప్పందాలు అవసరం లేకుండానే వాటి transcription నాణ్యతను మెరుగుపరచడం dataset విలువను పెంచగలదు. పూర్తిగా open inputs‌తో బలమైన మోడళ్లను నిర్మించాలనుకునే సమూహాలకు ఇది ప్రత్యేకంగా సంబంధించింది.

FineBooks రచయితలు చారిత్రక పుస్తకాలపై దృష్టి పెట్టారు, ఎందుకంటే స్థాయి పెద్దది, లాభం వెంటనే కనిపించగలదు. మూల పాఠ్యం ప్రకారం, గత సంవత్సరం విడుదలైన అతిపెద్ద openly licensed training corpusగా అక్కడ వివరించిన Common Pile‌లో, పాత OCR runs నుండి వచ్చిన పాఠ్యంతో సుమారు 3,00,000 ప్రజా-ప్రాంత పుస్తకాలు ఉన్నాయి. ఆ సేకరణలోని కొంత భాగాన్నైనా మెరుగైన టూల్స్‌తో తిరిగి ప్రాసెస్ చేయడం, ముఖ్యమైన open training resource యొక్క quality profile‌ను మార్చగలదు.

చిన్న మోడళ్లు ఊహించనంత బాగా పనిచేశాయి

మూల పాఠ్యంలో అత్యంత ఆశ్చర్యకరమైన కనుగొనింపుల్లో ఒకటి, చిన్న OCR మోడళ్లు తరచూ పెద్దవాటిని మించాయి. ఇది ఎక్కువ parameters సహజంగానే మెరుగైన పనితీరుగా మారతాయన్న సాధారణ అంచనాకు విరుద్ధం. ఆచరణలో, OCR నాణ్యత layout handling, శిక్షణ డేటా, భాషా కవరేజ్, మరియు ఒక మోడల్ దెబ్బతిన్న scans, విషయ సూచికలు, చిత్రాలు, మరియు అసాధారణ typographyతో ఎలా వ్యవహరిస్తుందనేదానిపై బాగా ఆధారపడి ఉంటుంది. పరిమాణం మాత్రమే సరిపోదు.

candidate metadataలో పేరు చెప్పబడిన అగ్ర మోడల్ dots.mocr, ఇది 97.6% character accuracy సాధించిందని నివేదించారు. FineBooks cost efficiencyపై కూడా గమనిస్తుంది, ఇది mass reprocessing‌ను ఆలోచిస్తున్న సంస్థలకు మరో ముఖ్యమైన అంశం. బలమైన OCR తక్కువ ఖర్చుతో నడిపించగలిగితే, చారిత్రక-పాఠ్య శుభ్రపరిచే ఆర్థికత భిన్నంగా కనిపించడం మొదలవుతుంది. ఆర్కైవ్ స్కానింగ్‌ను ప్రత్యేక, ఖరీదైన curation పనిగా చూడటం బదులుగా, డెవలపర్లు దాన్ని సాధారణ dataset preparation pipelines‌లో భాగం చేయగలరు.

2,165 ground-truth pagesలో మూడు: single-column English natural history text, multilingual table of contents, మరియు మొత్తం transcription కేవలం artist credit యొక్క ఒకే పంక్తిగా ఉన్న illustration plate. | Image: FineBooks / Biodiversity Heritage Library
2,165 ground-truth pagesలో మూడు: single-column English natural history text, multilingual table of contents, మరియు మొత్తం transcription కేవలం artist credit యొక్క ఒకే పంక్తిగా ఉన్న illustration plate. | Image: FineBooks / Biodiversity Heritage Library

బెంచ్‌మార్క్ dataset itself పుస్తక స్కానింగ్‌లోని నిజమైన సంక్లిష్టతలను ప్రతిబింబించేలా రూపొందించబడినట్లు కనిపిస్తోంది. మూల పాఠ్యం single-column English natural history పేజీ, multilingual table of contents, మరియు మొత్తం transcription కేవలం artist credit యొక్క ఒకే పంక్తిగా ఉన్న illustration plate వంటి ఉదాహరణలను వివరిస్తోంది. ఈ ఉదాహరణలు ముఖ్యమైనవి, ఎందుకంటే చారిత్రక పుస్తకాలు స్వచ్ఛమైన prose యొక్క ఏకరీతి బ్లాకులు కావు. OCR వ్యవస్థలు multilingual pages, decorative formatting, sparse text, మరియు recognition‌ను గందరగోళపరచగల visual artifacts‌తో వ్యవహరించాలి.

బలమైన open datasets‌కు ఒక మార్గం, కానీ పరిమితులతో

FineBooks పనికి సమీపకాలంలో అతిపెద్ద ప్రభావం end-user products కంటే open-data maintenance‌పై ఉండవచ్చు. Biodiversity Heritage Library వంటి archiveల నుండి మిలియన్ల పేజీలను తిరిగి ప్రాసెస్ చేయడం, భవిష్యత్తు open models‌కు ఆహారం ఇచ్చే పాఠ్య నాణ్యతను మెరుగుపరచగలదు. ఆ libraryలో మాత్రమే 3,00,000కు పైగా digitized natural history documents ఉన్నాయి, మొత్తం 6.4 కోట్లకు పైగా pages, కాబట్టి automation ఎందుకు అవసరమో ఇది చూపిస్తుంది. ఆ స్థాయిలో human transcription అవాస్తవికం.

అయినప్పటికీ, ప్రస్తుత OCR ప్రతి use case‌కు పూర్తి పరిష్కారం కాదని పరిశోధకులు చెబుతున్నారు. ఉత్తమ outputs AI training purposes‌కు ఇప్పటికే సరిపోతాయని, కానీ scholarly లేదా scientific applications‌కు ఇంకా ఎక్కువగా error-proneగా ఉన్నాయని మూల పాఠ్యం పేర్కొంటుంది. ఈ తేడా ముఖ్యమైనది. ఒక language model, ముఖ్యంగా లక్ష్యం broad pattern learning అయితే, బిలియన్ల tokens‌లో వ్యాపించిన కొంత noise‌ను భరించగలదు. కానీ ఖచ్చితమైన citations‌తో పని చేసే historian, librarian, లేదా scientist అలా చేయలేడు.

కాబట్టి ప్రాయోగిక నిర్ధారణ “OCR solved” కంటే సంకుచితమైనది. FineBooks OCR తగినంతగా మెరుగుపడి training corporaను గణనీయంగా అప్‌గ్రేడ్ చేయగలదని సూచిస్తోంది, కానీ textual fidelity కీలకమైన చోట జాగ్రత్తైన human review‌ను భర్తీ చేయగలదని కాదు. డెవలపర్లు మరియు పరిశోధకులు ఈ ప్రమాణాలను ఒక్కటిగా కలపకుండా ఉండాలి. Training usability మరియు archival accuracy సంబంధిత లక్ష్యాలు, కానీ ఒకేలా కావు.

ఇది ఒక బెంచ్‌మార్క్‌కు మించి ఎందుకు ముఖ్యం

FineBooks AI infrastructure‌లో పెద్ద మార్పులో భాగం: models‌ను మాత్రమే ఆప్టిమైజ్ చేయడం కాకుండా inputs‌ను మెరుగుపరచడం. ఇటీవలి సంవత్సరాల్లో AI పురోగతిపై ప్రజా చర్చ chips, parameters, మరియు benchmark scoresపై ఎక్కువగా కేంద్రీకృతమైంది. కానీ open-model builders ఒక మౌన పరిమితిని కూడా ఎదుర్కొంటున్నారు: వారు చట్టపరంగా మరియు practically ఉపయోగించగల text నాణ్యత. మెరుగైన OCR, ఇప్పటికే digital archivesలో ఉన్న public-domain పదార్థ విలువను విస్తరిస్తుంది.

బెంచ్‌మార్క్ నిలబడితే మరియు tooling విస్తృతంగా స్వీకరించబడితే, చారిత్రక సాహిత్యం, scientific texts, మరియు archival collectionsపై శిక్షణ పొందే భవిష్యత్ open models‌కు ఇది గణనీయమైన quality lift ఇవ్వగలదు. ఇది better curation, deduplication, మరియు filtering అవసరాన్ని తొలగించదు, కానీ నివారించగల ఒక స్పష్టమైన degradation మూలాన్ని తొలగిస్తుంది.

విస్తృత పాఠం ఏమిటంటే, data infrastructure ఇంకా పెద్ద లాభాలను ఇస్తుంది. తక్కువ ఖర్చుతో OCR improvement dataset quality, training efficiency, మరియు model behavior మీద వరుస ప్రభావాలను కలిగించగలదు. budget మరియు licensing constraints‌లో పనిచేస్తున్న open AI ecosystems‌కు, ఇది ఇప్పుడే అందుబాటులో ఉన్న అత్యంత కీలకమైన upgradesలో ఒకటిగా ఉండొచ్చు.

ఈ వ్యాసం The Decoder యొక్క రిపోర్టింగ్‌పై ఆధారపడింది. మూల వ్యాసాన్ని చదవండి.

Originally published on the-decoder.com