用于催化剂发现的AI面临数据质量问题

人工智能常被视为加速寻找更优催化剂的一种方式,尤其适用于与气候和工业脱碳相关的反应。但一项新的多实验室研究表明,真正的瓶颈可能并不在模型设计,而在于喂给这些模型的实验是否一致。

Phys.org对发表于Nature Catalysis的这项研究进行了报道。该研究由美国四家实验室合作完成,测试了一种用于将二氧化碳转化为燃料过程中、会生成一氧化碳的催化剂。核心发现直截了当:流程和设备上的差异足以产生相当大的波动,从而削弱基于这些数据建立的AI和机器学习预测的可靠性。

这一结论之所以重要,是因为催化剂研究正越来越多地被视为AI的理想应用场景。原则上,模型可以吸收温度、反应时间和催化剂配方等变量,然后预测哪些组合最有前景。研究人员可以利用这些预测聚焦实验、降低成本,并更快找到可行的化学体系。但这一愿景依赖于一个前提,即底层数据反映的是稳定现实,而不是由彼此不兼容的测量条件拼凑而成的碎片化结果。

这项四实验室研究表明,这一假设很脆弱。实验不一致不仅仅是可以通过平均处理掉的不便,它还会直接塑造AI系统“学到”的内容,使系统对那些可能只是仪器差异或本地操作习惯产物的模式产生信心,而非真正的化学规律。

为什么当AI进入流程时,可重复性更重要

传统实验科学一直重视可重复性,但AI把问题放大到了新的尺度。单一的误导性数据集就可能让模型偏向错误方向,而大量不一致的数据集则会将这些不一致按规模编码进去,让预测看上去严谨,实则逐渐偏离研究者真正想理解的物理行为。

这项研究聚焦于一种能够将二氧化碳转化为一氧化碳的催化剂,而这一步被描述为将CO2变为有用燃料的关键第一步。这类化学反应在战略上很重要,因为它嵌入在更广泛的低碳工业流程和能源路径之中。如果AI工具要帮助筛选在耐久性和性能方面表现更佳的催化剂,它们所训练的数据必须经得起跨实验室、跨时间尺度和跨运行设置的比较。

这说起来容易,做起来难。Phys.org的报道指出,大多数实验室催化研究只观察以天为单位的短周期,而催化剂失活可能在数月乃至数年中逐步发生,因为杂质不断积累,材料也反复承受高温。AI模型之所以具有吸引力,部分原因在于它们可能探索人工实验难以复现的条件。但如果用于训练的短期数据在不同实验室之间本身就不一致,那么对长期行为进行外推就会更加冒险。

论文作者将此视为对科学家输入机器学习系统的信息的一种提醒。这一警告出现于一个关键时点:科研界对AI的热情有时会超越数据生成所需的严谨性。在许多领域,实验室积累了数十年的传统方法、自定义仪器和本地操作习惯。这些差异对单篇论文也许尚可控制,但一旦数据被汇入预测引擎,就会成为严重障碍。

标准化是一种赋能技术

这项研究最重要的启示之一是,标准化不应被视为官僚式的额外负担。它是科学AI的赋能技术。

For AI to drive science discoveries, highly reproducible data is key
一项在全国四家实验室开展的研究表明,实验流程和设备标准化如何决定结果的波动。认识到这种波动,对于将真实世界数据纳入AI/机器学习模型至关重要。图片来源:Adam Hoffman and Greg Stewart/SLAC National Accelerator Laboratory

据报道,这项四实验室合作显示,结果波动受流程和设备标准化的影响。这重新定义了问题。问题不仅仅是某些数据集噪声更大,而是产生数据的流程本身会决定AI模型学到的是化学,还是实验室特有的怪癖。

对于研究机构而言,这会带来运营层面的后果。要为材料科学构建真正有用的AI,可能需要在大规模建模工作开始前,就先投入到统一实验设计、共享基准、元数据规范以及跨站点验证中。换句话说,通往更好AI的道路,或许始于更好的实验室过程控制,而不是更大的算力集群。

这对希望汇聚多家机构数据的公私合作科研项目尤其重要。汇总信息会增加样本量,但前提是合并后的记录确实可以相互比较。否则,更多数据反而会变成负担,让模型看起来覆盖更广,却掩盖了贡献者之间的系统性分歧。

更现实的科学AI图景

这项研究并不是反对在催化剂发现中使用AI。恰恰相反,它澄清了AI真正能够发挥作用的条件。有了高质量数据,模型可以缩小实验搜索范围、降低时间和成本,并探索实验室里难以触及的条件。这些优势依然具有吸引力。四实验室对比补充的,是一个提醒:模型质量与数据来源和测量实践密不可分。

这一信息超越了催化领域。如今,许多科学领域都希望把自动化实验、机器学习和共享数据集合并起来。只要测量依赖本地仪器、校准流程或默认的操作选择,同样的风险就会出现。如果这些差异没有被显性化并加以控制,AI系统就可能放大隐藏的不一致,而不是消除它们。

从实际角度看,这项新工作可能会促使资助机构、国家实验室和大学联盟更加重视可重复性基础设施。科学AI中最吸引眼球的一层通常是模型,而真正持久的一层,是让可靠建模成为可能的测量体系。

下一步

这项研究的直接启示不是退回到AI之外,而是要把实验与建模之间的循环收紧。跨实验室基准、统一的测试条件,以及关于设备和流程的明确元数据,都可以提升催化剂数据的可靠性。专门检验一个实验环境中训练出的模型在面对另一环境生成的数据时是否仍然有效的验证方案,也同样重要。

对于二氧化碳转化研究来说,这些改进可能带来超出平均水平的价值。该领域正在寻找的催化剂,不仅要在短时间实验中表现活跃,还要在长时间运行窗口中保持稳定、可放大且具备实际可行性。AI也许仍能更快地识别这些候选者。新的研究表明,前提是科学家必须把可重复性视为模型本身的一部分。

这正是这里更深层的行业信号。在科研AI中,更好的预测并不是从算法开始运行时才出现的。它们始于第一项实验的设计方式,使得另一家实验室、另一台仪器,以及最终另一种模型都能信任结果所意味着的内容。

本文基于Phys.org的报道。阅读原文

Originally published on phys.org