AI 代理正变得擅长维护研究软件
OpenAI 及学术合作伙伴的一份新实地报告指出,AI 编码系统有一种务实、也不那么光鲜的用途:修复和现代化支撑科学研究大量工作的那些被冷落的软件。报告并没有把这些系统呈现为自主的科学思考者。相反,它展示的是它们作为快速的软件劳动者,能够重构代码、替换过时工具、迁移框架,并在某些情况下带来显著的性能提升。
这种区别很重要。许多研究工具最初只是为了支撑一篇论文或某个狭窄实验室工作流而编写的代码。随着时间推移,这些工具被嵌入更广泛的科学管线中,尽管它们并不是按照长期维护、测试或可移植性的要求设计的。当原作者离开、资金又紧张时,实验室就只能依赖那些依然至关重要、却十分脆弱的代码库。
报告中描述的案例表明,编码代理可能非常适合处理这类积压工作。它们可以阅读大型代码库,提出升级方案,把一种框架或语言转换成另一种,并生成构建系统、安装步骤和测试等周边基础设施。但报告也清晰划出了一条边界,说明这些系统能做什么、不能做什么。它们或许能快速重写软件,却并不能可靠判断重写后的系统在科学行为上是否真的正确。
从构建清理到全面重写
报告涵盖了八个案例研究,其中大多数来自生物学。工作范围从相对封闭的维护任务到老化科学软件的大规模重写不等。
一个较简单的例子涉及 cyvcf2,这是一个用于读取遗传数据的 Python 库。在该案例中,GPT-5.5 用更现代的方案替换了过时的构建与安装设置。这类工作往往枯燥,但很重要:如果软件变得难以安装或编译,它就可能在科学上仍然重要,却在运行上变得脆弱。
另一个更复杂的项目围绕 MHCflurry 展开,这是一个用于预测免疫细胞会识别哪些靶标的免疫学模型。根据报告,Claude Code 和 Codex 轮流扮演开发者与审阅者角色,将大约 10,000 行代码从 TensorFlow 迁移到 PyTorch。这正是许多团队会拖上很多年的那类迁移,因为它成本高、风险大,而且很容易出错。

最具雄心的例子是 rustar-aligner,这是对 STAR 的 Rust 重写。STAR 是一种广泛使用的工具,用于将测序读段比对到基因组位置。STAR 包含超过 20,000 行 C 和 C++ 代码,尽管仍然是许多研究管线的一部分,却已不再积极维护。重建这样的工具不只是一个软件工程练习。它还可能引入细微变化,如果结果出现偏差,就会影响下游分析。
性能提升是真实的,但信任必须赢得
报告中的性能收益大到足以解释为什么实验室会感兴趣。原文称,由编码代理主导的工作在某些案例中带来了超过 60 倍的加速。最明显的例子是 RustQC,它把 15 个独立的质量控制工具整合成一个程序。在一组大型数据集上,运行时间从 15 小时 34 分钟降到了 14 分钟 54 秒。对于处理大规模生物数据的研究人员来说,这种幅度的缩短会实质性改变分析运行的频率以及实验迭代的速度。
但速度并不是最重要的故事。更关键的问题是,重写后的工具是否仍然以科学上有意义的方式表现得和原始工具一致。报告显然把这项验证工作视为核心,而不是可有可无。
对于 rustar-aligner,团队使用来自酵母细胞的 10,000 条短测序读段,将重写版本与 STAR 进行了比较。对于单端读段,新工具与 STAR 的一致率达到 99.815%。对于双端读段,一致率达到 99.883%。比较并不只限于基因组中的比对位置,还包括每条读段生成的几个关键输出字段。原文还指出,没有任何一款工具能把另一款无法比对的读段比对出来。
这些兼容性数据已经非常强,但它们也说明了 AI 生成科学软件的核心局限。模型可以产出令人信服的代码,甚至看起来合理的测试,但人类仍然需要定义“等价”意味着什么,选择合适的基准,检查边缘情况,并判断偏差在科学上是否重要。

瓶颈正从编码转向审查
这或许是报告最重要的含义。如果编码代理继续进步,研究软件中最稀缺的资源可能不再是纯粹的实现时间。真正的瓶颈也许会变成专家验证。
在那种情况下,实验室不会只是把软件交给代理然后接受结果。相反,他们会监督一种工作流:模型高速生成候选实现,而领域专家把精力用在检查输出、复现先前行为,以及确认重写过程中没有夹带科学假设。工作流变了,但对专家监督的需求并不会消失。
这在研究环境中尤其重要,因为代码正确性只是问题的一层。一次重构即使在语法上干净、计算上更快,如果它改变了数值行为、默认参数或隐藏假设,科学上仍然可能是错误的。因此,报告中那句提醒,即这些系统无法判断科学是否正确,并不只是一个附注,而是负责任使用它们的前提。
这对科学基础设施意味着什么
如果这些发现具有普遍性,编码代理可能会成为学术界有价值的基础设施工具。科学领域往往依赖的软件既重要到不能忽视,又因为资金不足而无法靠人工持续现代化。AI 系统可能特别适合填补这一维护鸿沟,因为问题不在于发明新科学,而在于把陈旧、脆弱的代码转换成更容易运行、审查和扩展的形式。
其潜力相当可观:更快的迁移、更好的性能、重新激活的工具链,以及更少被遗弃的代码库。代价是,信任仍然必须以缓慢的方式建立。科学软件不能因为读起来顺畅或能顺利编译就被接受。它必须在真实工作负载上经过测试,并由既懂科学也懂代码的人来判断。
因此,这份实地报告与其说是在讲自动化发现,不如说是在讲分工。AI 也许会承担更多软件现代化工作,而研究人员仍然负责确认由此产生的系统是否配得上成为科学记录的一部分。
本文基于 The Decoder 的报道。阅读原文。
Originally published on the-decoder.com



