AIラボがミレニアム問題に挑むとき

この紛争は、驚くべき主張から始まった。AIシステムが、クレイ数学研究所の7つのミレニアム問題の1つであり、数十年にわたり数学者を悩ませてきたナビエ・ストークス方程式の証明を生成したというものだ。この出来事は、AI支援研究の画期的な成果となるはずだった。しかし、その代わりに、独立した研究者と、アルゴリズムとそれを開発するためのプラットフォームの両方を支配する強力なラボとの間で、アイデアがどのように移動するかについての警告の物語となった。

主要な関係者はすべて公開声明を発表しており、その説明は大きく異なっている。中心にいるのは数学者のトリスタン・バックマスターで、彼はOpenAIが、自身がレベント・アルポーゲと進めていた研究プロジェクトを知った後に不正行為を行ったと主張している。OpenAIは最も深刻な告発を否定するが、ライバルであるAnthropicのモデルが達成したという噂によって行動が形成されたことを認めている。

圧力と盗用の疑惑

バックマスターは、異例なほど率直に批判している。彼は、OpenAIが自身とアルポーゲがOpenAIのCodex環境にアップロードした草稿から資料を取得し、研究プロセス中に圧力をかけ、アルポーゲがAnthropicに雇用されているという理由だけで共同執筆者から外そうとし、キャリアに影響を与えると脅したと述べている。バックマスターの見解では、この行動は絶対的な学術的不正行為に相当する。

圧力の告発は外部から検証することは不可能だ。文書化できるのは、OpenAIがAnthropicのモデルがミレニアム問題を解決したという噂を聞き、自らの認めるところによると、同じ目標にリソースを向けたということだ。OpenAIのCEOサム・アルトマンと研究者のセバスチャン・ブベックは盗用を否定している。彼らは、噂が流れた後、チームがその問題に特化したモデルを開発したことを認めるが、会社の結果がバックマスターとアルポーゲから盗用されたという示唆を拒否する。

同じ研究に対する2つの非常に異なるバージョン

意見の相違の技術的な核心は独創性である。OpenAIは、その解決策が数学者の研究とは大きく異なると主張している。バックマスターとアルポーゲは同意しない。彼らは、同様のアプローチをOpenAIのシステムに入力していたと指摘し、その入力がトレーニングデータに含まれたのではないかと疑っている。もしそれが真実なら、同社は競合他社が開発ツールに委ねたまさにそのアイデアを使って、競合他社を追い越した可能性がある。

その可能性が重要なのは、単純な理由による。研究者は通常、未発表の研究を競合他社にトレーニング用に提出しない。しかし、AIラボがコーディング支援ツールやクラウドプラットフォームを提供するとき、ユーザーは最も有望な知的財産を、ラボ自身のモデルを改善できるシステムに直接供給している可能性がある。ツールを使用することと、研究をツールに明け渡すことの境界線は、監視が困難になる。

トレーニングデータの問題は未解決のまま

OpenAIの従業員は、特に2人の研究者がトレーニングに自分の入力を使用することを許可するオプションを無効にしていた場合、同社が提出された解決策でトレーニングした可能性は低いと指摘する。彼らがそうしたかどうかは公には知られていない。科学的な観点からは、その不確実性こそが、この紛争を危険なものにしている。この種の告発が独立して調査できない場合、研究者は、トレーニングパイプラインを外部の検査に開放する法的義務を負わない企業の言葉に頼らざるを得なくなる。

OpenAIの研究者ボアズ・バラクは、モデルが外部の助けを必要としたという考えに反論している。彼の説明では、モデルは既知の議論を再現しただけでなく、数学者が行ったよりも強い主張を証明することから始めた。彼の見解では、そうでないと示唆することは、現実的な評価ではなく、対処療法である。しかし、この防御は、来歴というより深い問題を解決するものではない。最終的に研究者の研究を超えたモデルでさえ、彼らの草稿に影響を受けた可能性がある。科学的誠実性は、出力がコピーされたかどうかだけではなく、アイデアが許可なく取得されたかどうかも同様に重要である。

テレンス・タオからの警告

最も冷静な対応の1つは、数学者のテレンス・タオから来ている。彼は、この種の将来の出来事が、独立した数学者を不可能な立場に置くかもしれないと警告している。噂が大規模なテクノロジー企業に届くと、その企業は数日以内にかなりの計算リソースと人材を動員できる。小規模な学者チームは、特に噂が彼ら自身の未発表の研究に基づいている場合、そのペースに追いつくことはできない。その結果、AIラボが、より良い情報網とより大きな機械を持っているという理由だけで、元の研究プロジェクトを定期的に追い越す可能性がある。

タオの警告は、当面の紛争を超えて広がっている。それは科学における新たな非対称性を指し示している。最も強力なモデルを生み出すグループは、初期の結果を聞き、トレーニングに組み込み、最初に発表するのに最も良い立場にある。学術的なインセンティブは優先権と公開性を中心に構築されているが、競合他社が同意なしに未公開データを吸収できる場合、そのようなインセンティブは無意味になる。

オープンサイエンスへの影響

したがって、ナビエ・ストークス論争は、単に2人の個人と1つのラボの間の紛争ではない。それはAI開発とオープンリサーチの関係についての根本的な疑問を提起する。

  • 研究者は、未発表のアイデアを企業のトレーニングデータから守りながら、AIコーディングプラットフォームを安全に使用できるか?ほとんどのユーザーは、そのような保護が効果的であることを検証する方法がない。
  • AIラボは、特に噂が自社のツール内で発生した場合、別の組織の機密または噂の研究に基づいて研究努力を方向転換することを許可されるべきか?
  • 共同執筆者が競合他社のラボに雇用されている場合、その事実が著作者に影響を与えるべきか?バックマスターは、OpenAIがその理由でアルポーゲを論文から外そうとしたと述べているが、同社は不正行為を否定し、著作者ポリシーを明確にしていない。
  • 盗用が疑われる場合、誰がトレーニングデータとモデルの重みにアクセスできるべきか?現在の紛争解決メカニズムは、外部監査人に明確な道筋を提供していない。
  • 若手研究者が自分の研究がより強力な主体によって採掘されることを恐れた場合、分野の初期結果を共有する意欲はどうなるか?

これらは抽象的な懸念ではない。この紛争は、AI企業が中立的な科学的パートナーとして機能できるという考えへの信頼をすでに損なっている。ナビエ・ストークスに興味がない研究者でさえ、有望な補題や未発表の方法をAIラボが運営するプラットフォームにアップロードすることをためらうかもしれない。

信頼は当然視できない

OpenAIとその支持者は、不正使用がなかったという点で正しいかもしれない。利用可能な証拠は不完全であり、無実の偶然の可能性は現実にある。しかし、この出来事は、責任あるAI研究がどのように見えるべきかのハードルを引き上げた。数学者向けのツールを開発するラボは、彼らの研究を使用しないという漠然とした約束に頼ることはできない。透過的なデータ処理ポリシーと独立した監査メカニズムを通じて、ユーザーの貢献が同意なしに将来のモデルに表示されないことを実証しなければならない。

より広い教訓は、科学者とAIラボが異なる論理で運営されているということかもしれない。学者は知識を構築するために共有する。企業は優位性を構築するために共有する。2つのシステムが衝突するとき、弱い側は通常、企業の壁の外にいる研究者である。ナビエ・ストークス紛争は、それを引き起こした数学的成果だけでなく、生成AIの時代におけるオープンサイエンスの脆弱性について明らかにしたことで記憶されるだろう。明確な規範がすぐに確立されない限り、次のミレニアム問題は、黒板の前の孤独な数学者ではなく、質問が発表される前に答えを見た企業チームによって解決されるかもしれない。

この記事はThe Decoderの報道に基づいています。元の記事を読む

Originally published on the-decoder.com