更好的文本提取可能释放更干净的训练数据
Hugging Face与EleutherAI的一项新的基准测试工作认为,改进开源语言模型的一个最实用路径,不是更大的模型架构,也不是新的训练配方,而是更好的源文本。其FineBooks项目评估的是,现代开源权重光学字符识别系统是否能够修复公有领域图书数据集中的一个长期弱点:这些文本是多年前用错误率较高的OCR工具从扫描件中提取出来的。
这一问题之所以重要,是因为大量开放许可的历史文献以噪声较多的形式进入AI开发者手中。图书馆在今天生成式AI热潮之前很久就已大规模数字化,而许多档案使用的是较旧的OCR流程,带来了缺字、空格错误、误译词语和结构性错误。一旦这些错误进入训练语料,就会降低用于训练语言模型的材料质量。
FineBooks试图衡量这种情况改善了多少。该项目在2,165页历史图书页面上测试了14个开源权重OCR模型,并将结果发布为排行榜。根据所提供的来源文本,表现最佳的系统字符准确率超过97%,而成本不到每千页2美元。这个组合值得注意,因为它表明,对于负担不起昂贵专有处理的开源数据项目来说,大规模清理现在在运营上可能是现实可行的。
为什么OCR质量对语言模型很重要
来源文本提到Talkie项目的早期结果,量化了糟糕OCR的负面影响。在那项比较中,一个基于OCR文本训练的语言模型,其学习效率只有在同一本书的人类转录文本上训练的模型的30%。这一发现将OCR错误框定为不仅仅是轻微的档案麻烦,而是语言模型训练质量的直接瓶颈。
对于开源模型开发者来说,含义很直接。如果公有领域图书是许可或可许可兼容文本的核心来源,那么改进其转录质量就能在不必谈判新内容协议的情况下提升数据集价值。这对那些试图仅用完全开放输入构建强模型的社区尤其重要。
FineBooks作者聚焦历史图书,是因为规模巨大、回报也直接。来源文本指出,Common Pile被描述为去年发布的最大开放许可训练语料库,其中包含大约30万本其文本来自旧OCR运行的公有领域图书。即便只用更好的工具重新处理其中一部分,也可能改变一个重要开源训练资源的质量轮廓。
更小的模型出人意料地表现更好
来源文本中一个更引人注目的发现是,小型OCR模型往往胜过大型模型。这与“参数越多性能就一定越好”的常见假设相反。实际上,OCR质量很大程度上取决于版面处理、训练数据、语言覆盖,以及模型处理退化扫描、目录、插图和非常规排版的能力。仅靠规模并不够。
候选元数据中提到的最佳模型是dots.mocr,据称达到了97.6%的字符准确率。FineBooks也强调成本效率,这是组织考虑大规模重处理时的另一关键变量。如果强大的OCR可以低成本运行,历史文本清理的经济性就会发生变化。开发者也许不再把档案重扫视为一种专门而昂贵的整理工作,而是可以把它纳入普通的数据集准备流程。

该基准数据集本身似乎就是为了反映图书扫描中的真实复杂性而设计的。来源文本描述的示例包括一页英文自然历史单栏文本、一页多语种目录,以及一张整页图版,其完整转录只有一行作者署名。这些例子很重要,因为历史图书并不是整齐划一的纯文本块。OCR系统必须应对多语种页面、装饰性排版、稀疏文本以及可能干扰识别的视觉伪影。
通往更强开放数据集的路径,但也有局限
FineBooks工作的最大近期影响,可能更多在开放数据维护,而不是终端用户产品。重新处理来自如Biodiversity Heritage Library之类档案中的数百万页,可能会提高喂给未来开源模型的文本质量。来源文本称,仅该图书馆就包含超过30万份数字化自然历史文献,总计超过6400万页,这也说明自动化为何至关重要。在这个规模上,人工转录是不现实的。
不过,研究者并未把当前OCR描述为适用于所有场景的完整解决方案。来源文本指出,最佳输出已经足以用于AI训练,但对于学术或科学用途来说仍然过于容易出错。这个区分很重要。语言模型可以容忍在数十亿个词元中分散的一些噪声,尤其当目标是广泛模式学习时;而历史学家、图书馆员或科学家在使用精确引文时则不能。
因此,实际结论比“OCR已解决”更狭窄。FineBooks表明,OCR已经改进到足以实质性提升训练语料库,但并不意味着它可以取代需要文本高度保真的场景中的细致人工审校。开发者和研究者应避免把这两个标准混为一谈。训练可用性和档案准确性相关,但并不相同。
为什么这不仅仅是一个基准测试的问题
FineBooks反映了AI基础设施中的一个更大转向:改进输入,而不仅仅是优化模型。近年来,围绕AI进展的公众讨论大多集中在芯片、参数和基准分数上。但开源模型构建者还面对一个更安静的约束:他们在法律和实际层面能够使用的文本质量。更好的OCR会扩大公有领域材料在数字档案中的价值。
如果这一基准经得起检验并被广泛采用,那么结果可能是,未来在历史文学、科学文本和档案藏品上训练的开源模型质量明显提升。这不会消除更好整理、去重和过滤的需求,但会消除一个明确可避免的退化来源。
更广泛的教训是,数据基础设施仍然存在巨大收益。一次相对便宜的OCR改进,可以向下游传导到数据集质量、训练效率和模型行为。对于受预算和许可约束的开放AI生态系统而言,这可能是眼下最重要的升级之一。
本文基于 The Decoder 的报道。阅读原文。
Originally published on the-decoder.com


