మెరుగైన టెక్స్ట్ ఎక్స్ట్రాక్షన్ శుభ్రమైన శిక్షణ డేటాను తెరవగలదు
Hugging Face మరియు EleutherAI చేసిన కొత్త బెంచ్మార్కింగ్ ప్రయత్నం ప్రకారం, ఓపెన్ భాషా మోడళ్లను మెరుగుపరచడానికి అత్యంత ప్రాయోగిక మార్గం పెద్ద మోడల్ ఆర్కిటెక్చర్ లేదా కొత్త శిక్షణ రెసిపీ కాదు, మెరుగైన మూల పాఠ్యం. వారి FineBooks ప్రాజెక్ట్, ఆధునిక open-weight optical character recognition వ్యవస్థలు ప్రజా-ప్రాంత పుస్తక డేటాసెట్లలో ఉన్న దీర్ఘకాలిక బలహీనతను సరిచేయగలవా అని పరిశీలిస్తోంది: లోపభూయిష్ట OCR టూల్స్తో సంవత్సరాల క్రితం స్కాన్ల నుండి తీసిన పాఠ్యం.
ఈ సమస్య ముఖ్యమైనది, ఎందుకంటే తెరిచి లైసెన్స్ ఉన్న చారిత్రక రచనల పెద్ద భాగం AI డెవలపర్లకు శబ్దభరిత రూపంలో చేరుతుంది. నేటి generative AI బూమ్కు చాలా ముందే లైబ్రరీలు భారీ సేకరణలను డిజిటైజ్ చేశాయి, మరియు వాటిలో చాలా పాత OCR పైప్లైన్లతో ప్రాసెస్ చేయబడి, తప్పిపోయిన అక్షరాలు, చెడు spacing, తప్పుగా ప్రతిలిపి చేసిన పదాలు, మరియు నిర్మాణాత్మక పొరపాట్లు వచ్చాయి. ఈ తప్పులు training corporaలోకి చేరిన తర్వాత, భాషా మోడళ్లను నేర్పడానికి ఉపయోగించే పదార్థ నాణ్యతను తగ్గిస్తాయి.
FineBooks పరిస్థితి ఎంత మెరుగుపడిందో కొలవడానికి చేసిన ప్రయత్నం. ఈ ప్రాజెక్ట్ చారిత్రక పుస్తకాల 2,165 పేజీలపై 14 open-weight OCR మోడళ్లను పరీక్షించి, ఫలితాలను leaderboardగా ప్రచురించింది. అందించిన మూల పాఠ్యం ప్రకారం, అత్యుత్తమ వ్యవస్థలు 97%కి పైగా character accuracy సాధించాయి, అదే సమయంలో వెయ్యి పేజీలకు రెండు అమెరికన్ డాలర్లకంటే తక్కువ ఖర్చుతో. ఈ కలయిక ప్రాముఖ్యమైనది, ఎందుకంటే పెద్ద స్థాయి శుభ్రపరిచే పని ఇప్పుడు ఖరీదైన proprietary processingను భరించలేని open-data ప్రాజెక్టులకు ఆపరేషనల్గా వాస్తవికంగా మారవచ్చని సూచిస్తోంది.
OCR నాణ్యత భాషా మోడళ్లకు ఎందుకు ముఖ్యం
మూల పాఠ్యం, చెడు OCR లోపాన్ని కొలిచిన Talkie ప్రాజెక్ట్లోని ముందరి ఫలితాన్ని సూచిస్తోంది. ఆ పోలికలో, OCR-derived పాఠ్యంపై శిక్షణ పొందిన భాషా మోడల్, అదే పుస్తకాల human transcriptionsపై శిక్షణ పొందిన మోడల్ సమర్థతలో కేవలం 30% వద్ద మాత్రమే నేర్చుకుంది. ఈ కనుగొనడం OCR తప్పులను చిన్న ఆర్కైవ్ అసౌకర్యంగా కాక, మోడల్ శిక్షణ నాణ్యతపై ప్రత్యక్ష bottleneckగా చూపిస్తుంది.
Open-model డెవలపర్లకు దీని అర్థం సూటిగా ఉంటుంది. ప్రజా-ప్రాంత పుస్తకాలు లైసెన్స్ ఉన్న లేదా లైసెన్స్-అనుకూల పాఠ్యానికి ప్రధాన మూలమైతే, కొత్త కంటెంట్ ఒప్పందాలు అవసరం లేకుండానే వాటి transcription నాణ్యతను మెరుగుపరచడం dataset విలువను పెంచగలదు. పూర్తిగా open inputsతో బలమైన మోడళ్లను నిర్మించాలనుకునే సమూహాలకు ఇది ప్రత్యేకంగా సంబంధించింది.
FineBooks రచయితలు చారిత్రక పుస్తకాలపై దృష్టి పెట్టారు, ఎందుకంటే స్థాయి పెద్దది, లాభం వెంటనే కనిపించగలదు. మూల పాఠ్యం ప్రకారం, గత సంవత్సరం విడుదలైన అతిపెద్ద openly licensed training corpusగా అక్కడ వివరించిన Common Pileలో, పాత OCR runs నుండి వచ్చిన పాఠ్యంతో సుమారు 3,00,000 ప్రజా-ప్రాంత పుస్తకాలు ఉన్నాయి. ఆ సేకరణలోని కొంత భాగాన్నైనా మెరుగైన టూల్స్తో తిరిగి ప్రాసెస్ చేయడం, ముఖ్యమైన open training resource యొక్క quality profileను మార్చగలదు.
చిన్న మోడళ్లు ఊహించనంత బాగా పనిచేశాయి
మూల పాఠ్యంలో అత్యంత ఆశ్చర్యకరమైన కనుగొనింపుల్లో ఒకటి, చిన్న OCR మోడళ్లు తరచూ పెద్దవాటిని మించాయి. ఇది ఎక్కువ parameters సహజంగానే మెరుగైన పనితీరుగా మారతాయన్న సాధారణ అంచనాకు విరుద్ధం. ఆచరణలో, OCR నాణ్యత layout handling, శిక్షణ డేటా, భాషా కవరేజ్, మరియు ఒక మోడల్ దెబ్బతిన్న scans, విషయ సూచికలు, చిత్రాలు, మరియు అసాధారణ typographyతో ఎలా వ్యవహరిస్తుందనేదానిపై బాగా ఆధారపడి ఉంటుంది. పరిమాణం మాత్రమే సరిపోదు.
candidate metadataలో పేరు చెప్పబడిన అగ్ర మోడల్ dots.mocr, ఇది 97.6% character accuracy సాధించిందని నివేదించారు. FineBooks cost efficiencyపై కూడా గమనిస్తుంది, ఇది mass reprocessingను ఆలోచిస్తున్న సంస్థలకు మరో ముఖ్యమైన అంశం. బలమైన OCR తక్కువ ఖర్చుతో నడిపించగలిగితే, చారిత్రక-పాఠ్య శుభ్రపరిచే ఆర్థికత భిన్నంగా కనిపించడం మొదలవుతుంది. ఆర్కైవ్ స్కానింగ్ను ప్రత్యేక, ఖరీదైన curation పనిగా చూడటం బదులుగా, డెవలపర్లు దాన్ని సాధారణ dataset preparation pipelinesలో భాగం చేయగలరు.

బెంచ్మార్క్ dataset itself పుస్తక స్కానింగ్లోని నిజమైన సంక్లిష్టతలను ప్రతిబింబించేలా రూపొందించబడినట్లు కనిపిస్తోంది. మూల పాఠ్యం single-column English natural history పేజీ, multilingual table of contents, మరియు మొత్తం transcription కేవలం artist credit యొక్క ఒకే పంక్తిగా ఉన్న illustration plate వంటి ఉదాహరణలను వివరిస్తోంది. ఈ ఉదాహరణలు ముఖ్యమైనవి, ఎందుకంటే చారిత్రక పుస్తకాలు స్వచ్ఛమైన prose యొక్క ఏకరీతి బ్లాకులు కావు. OCR వ్యవస్థలు multilingual pages, decorative formatting, sparse text, మరియు recognitionను గందరగోళపరచగల visual artifactsతో వ్యవహరించాలి.
బలమైన open datasetsకు ఒక మార్గం, కానీ పరిమితులతో
FineBooks పనికి సమీపకాలంలో అతిపెద్ద ప్రభావం end-user products కంటే open-data maintenanceపై ఉండవచ్చు. Biodiversity Heritage Library వంటి archiveల నుండి మిలియన్ల పేజీలను తిరిగి ప్రాసెస్ చేయడం, భవిష్యత్తు open modelsకు ఆహారం ఇచ్చే పాఠ్య నాణ్యతను మెరుగుపరచగలదు. ఆ libraryలో మాత్రమే 3,00,000కు పైగా digitized natural history documents ఉన్నాయి, మొత్తం 6.4 కోట్లకు పైగా pages, కాబట్టి automation ఎందుకు అవసరమో ఇది చూపిస్తుంది. ఆ స్థాయిలో human transcription అవాస్తవికం.
అయినప్పటికీ, ప్రస్తుత OCR ప్రతి use caseకు పూర్తి పరిష్కారం కాదని పరిశోధకులు చెబుతున్నారు. ఉత్తమ outputs AI training purposesకు ఇప్పటికే సరిపోతాయని, కానీ scholarly లేదా scientific applicationsకు ఇంకా ఎక్కువగా error-proneగా ఉన్నాయని మూల పాఠ్యం పేర్కొంటుంది. ఈ తేడా ముఖ్యమైనది. ఒక language model, ముఖ్యంగా లక్ష్యం broad pattern learning అయితే, బిలియన్ల tokensలో వ్యాపించిన కొంత noiseను భరించగలదు. కానీ ఖచ్చితమైన citationsతో పని చేసే historian, librarian, లేదా scientist అలా చేయలేడు.
కాబట్టి ప్రాయోగిక నిర్ధారణ “OCR solved” కంటే సంకుచితమైనది. FineBooks OCR తగినంతగా మెరుగుపడి training corporaను గణనీయంగా అప్గ్రేడ్ చేయగలదని సూచిస్తోంది, కానీ textual fidelity కీలకమైన చోట జాగ్రత్తైన human reviewను భర్తీ చేయగలదని కాదు. డెవలపర్లు మరియు పరిశోధకులు ఈ ప్రమాణాలను ఒక్కటిగా కలపకుండా ఉండాలి. Training usability మరియు archival accuracy సంబంధిత లక్ష్యాలు, కానీ ఒకేలా కావు.
ఇది ఒక బెంచ్మార్క్కు మించి ఎందుకు ముఖ్యం
FineBooks AI infrastructureలో పెద్ద మార్పులో భాగం: modelsను మాత్రమే ఆప్టిమైజ్ చేయడం కాకుండా inputsను మెరుగుపరచడం. ఇటీవలి సంవత్సరాల్లో AI పురోగతిపై ప్రజా చర్చ chips, parameters, మరియు benchmark scoresపై ఎక్కువగా కేంద్రీకృతమైంది. కానీ open-model builders ఒక మౌన పరిమితిని కూడా ఎదుర్కొంటున్నారు: వారు చట్టపరంగా మరియు practically ఉపయోగించగల text నాణ్యత. మెరుగైన OCR, ఇప్పటికే digital archivesలో ఉన్న public-domain పదార్థ విలువను విస్తరిస్తుంది.
బెంచ్మార్క్ నిలబడితే మరియు tooling విస్తృతంగా స్వీకరించబడితే, చారిత్రక సాహిత్యం, scientific texts, మరియు archival collectionsపై శిక్షణ పొందే భవిష్యత్ open modelsకు ఇది గణనీయమైన quality lift ఇవ్వగలదు. ఇది better curation, deduplication, మరియు filtering అవసరాన్ని తొలగించదు, కానీ నివారించగల ఒక స్పష్టమైన degradation మూలాన్ని తొలగిస్తుంది.
విస్తృత పాఠం ఏమిటంటే, data infrastructure ఇంకా పెద్ద లాభాలను ఇస్తుంది. తక్కువ ఖర్చుతో OCR improvement dataset quality, training efficiency, మరియు model behavior మీద వరుస ప్రభావాలను కలిగించగలదు. budget మరియు licensing constraintsలో పనిచేస్తున్న open AI ecosystemsకు, ఇది ఇప్పుడే అందుబాటులో ఉన్న అత్యంత కీలకమైన upgradesలో ఒకటిగా ఉండొచ్చు.
ఈ వ్యాసం The Decoder యొక్క రిపోర్టింగ్పై ఆధారపడింది. మూల వ్యాసాన్ని చదవండి.
Originally published on the-decoder.com


