当AI实验室追逐千年难题
冲突始于一个非凡的声明:一个AI系统产生了Navier-Stokes方程的证明,这是克莱数学研究所七个千年难题之一,也是几十年来数学家们一直未能解决的挑战。这一事件本应成为AI辅助研究的里程碑。相反,它变成了一个警示故事,关于思想如何在独立研究人员和控制算法及开发平台的有力实验室之间流动。
所有主要当事方都已发表公开声明,但说法大相径庭。核心人物是数学家Tristan Buckmaster,他声称OpenAI在得知他与Levent Alpöge正在进行的研究项目后,存在不当行为。OpenAI否认最严重的指控,但承认其行为受到关于竞争对手实验室Anthropic模型所取得成就的传言的影响。
施压和抄袭的指控
Buckmaster的批评异常直率。他说OpenAI从他和Alpöge上传到OpenAI Codex环境的草稿中获取了材料,在研究过程中向他施压,试图仅仅因为Alpöge受雇于Anthropic而将其从共同作者中移除,并威胁他的职业生涯。在Buckmaster看来,这种行为完全属于学术不端。
关于施压的指控从外部无法验证。可以证实的是,OpenAI听到传言称Anthropic的模型解决了一个千年难题,并且据其自己承认,将资源指向了同一目标。OpenAI CEO Sam Altman和研究员Sébastien Bubeck否认抄袭。他们承认团队在传言流传后专门为这个问题开发了一个模型,但拒绝接受公司的成果是从Buckmaster和Alpöge那里窃取的说法。
同一工作的两个截然不同的版本
分歧的技术核心是原创性。OpenAI坚持其解决方案与数学家的作品有显著不同。Buckmaster和Alpöge不同意。他们指出,他们已将类似的方法输入OpenAI的系统,并怀疑这些输入最终进入了训练数据。如果属实,该公司可能利用竞争对手托付给其开发工具的思想加速超越了竞争对手。
这种可能性之所以重要,原因很简单:研究人员通常不会将未发表的工作提交给竞争对手进行训练。但是,当AI实验室提供编码助手和云平台时,用户可能正在将他们最有前途的知识产权直接输入到能够改进实验室自身模型的系统中。使用工具和将研究拱手让给工具之间的界限变得难以监管。
训练数据问题仍未解答
OpenAI员工指出,公司对提交的解决方案进行训练的可能性很低,特别是如果两位研究人员禁用了允许其输入用于训练的选项。他们是否这样做了,外界不得而知。从科学的角度来看,这种不确定性正是使争议变得危险的原因。当此类指控无法独立调查时,研究人员只能依赖一家没有法律义务向外部检查开放其训练流程的公司的说法。
OpenAI研究员Boaz Barak反驳了模型需要外部帮助的观点。按照他的说法,模型不仅仅是重现了一个已知的论证;它首先证明了比数学家们更强大的主张。在他看来,暗示其他情况是“应对”而非现实评估。然而,这一辩护无助于解决更深层次的来源问题。即使一个模型最终超越了研究人员的工作,它也可能受到他们草稿的影响。科学诚信不仅仅关乎输出是否被复制;同样关乎思想是否未经许可被使用。
陶哲轩的警告
最发人深省的回应之一来自数学家陶哲轩。他警告说,未来此类事件可能使独立数学家陷入不可能的境地。当传言传到大型科技公司时,该公司可以在几天内调动大量的计算资源和人才。小型学术团队无法匹敌这种速度,特别是如果传言基于他们自己未发表的工作。结果可能是AI实验室经常超越原始研究项目,仅仅因为他们有更好的耳朵和更大的机器。
陶的警告超出了眼前的争议。它指出了科学中正在出现的不对称性:创造最强大模型的群体也处于最佳位置,能够听到早期结果,将其整合到训练运行中,并首先发表。学术激励建立在优先权和开放性的基础上,但如果竞争对手可以在未经同意的情况下吸收未公开的数据,这些激励就变得毫无意义。
这对开放科学意味着什么
因此,Navier-Stokes争议不仅仅是两个人与一个实验室之间的纠纷。它提出了关于AI发展与开放研究之间关系的基本问题。
- 研究人员能否安全地使用AI编码平台,同时将其未发表的想法排除在公司的训练数据之外?大多数用户无法验证此类保护是否有效。
- AI实验室是否应被允许基于另一组织的机密或传闻工作重新调整其研究工作,尤其是当传言源于其自身工具时?
- 当共同作者受雇于竞争实验室时,这一事实是否应影响署名?Buckmaster表示OpenAI试图因此将Alpöge从论文中移除,而公司否认不当行为,但未澄清其署名政策。
- 当指控抄袭时,谁应有权访问训练数据和模型权重?当前的争议解决机制没有为外部审计员提供明确的途径。
- 如果初级研究人员担心其工作会被更强大的参与者挖掘,该领域分享早期成果的意愿会发生什么变化?
这些不是抽象的问题。争议已经损害了对AI公司能够作为中立科学伙伴的信任。即使对Navier-Stokes不感兴趣的研究人员也可能合理地犹豫,在将一个有前途的引理或未发表的方法上传到AI实验室运营的平台之前。
信任不能假设
OpenAI及其辩护者可能是对的,即没有发生不当使用。现有证据不完整,无辜巧合的可能性是真实的。但这一事件提高了负责任AI研究的门槛。为数学家开发工具的实验室不能依赖模糊的承诺,即不会使用他们的工作。它必须通过透明的数据处理政策和独立的审计机制来证明,用户的贡献不会未经同意出现在未来的模型中。
更广泛的教训可能是,科学家和AI实验室遵循不同的逻辑。学者分享以构建知识;公司分享以构建优势。当两个系统碰撞时,较弱的一方通常是企业墙外的研究人员。Navier-Stokes争议不仅会因其引发的数学成就而被铭记,还会因其揭示了生成式AI时代开放科学的脆弱性而被铭记。除非很快建立明确的规范,否则下一个千年难题可能不是由孤独的数学家在黑板上解决,而是由一家在看到问题发表之前就看到答案的公司团队解决。
本文基于The Decoder的报道。阅读原文。
Originally published on the-decoder.com





