次のAIのボトルネックはモデルサイズではなくデータかもしれない

OpenAIの元研究者が、次の大きなAI軍拡競争はスケーリングだけではなく学習データを中心に展開すると強く主張している。The Decoderの報道によれば、Andrew Hoは8か月でOpenAIを離れ、高品質で専門化されたデータセットの生成に特化する会社を立ち上げた。その背景には、大規模言語モデルは依然として経済的に重要なタスクでの汎化が弱いという見方がある。

この主張は、現代AIの最も根強い前提の一つに反している。つまり、より大きなモデルをより多くの計算資源で学習させれば、さまざまな領域で能力が広がり続けるという考えだ。Hoの立場は、それだけでは不十分だというものだ。彼の見方では、多くの価値ある仕事は文脈依存性が高すぎるか、既存データセットでの表現が乏しすぎるか、あるいは採点が難しすぎて、今日のスケーリング戦略では確実に捉えられない。

この議論が重要なのは、目立つフロンティアモデル研究所間の競争から、より地味だがますます戦略的重要性を増すデータ生成ビジネスへと視線を移すからだ。Hoが正しければ、次の持続的なAI優位は、産業規模でタスク特化の事例を集め、構造化し、検証できる主体に訪れるかもしれない。

なぜ現在のデータセットでは不十分なのか

元記事によると、Hoは、経済的に意味のあるスキルの大半が既存の学習コーパスではほとんど表現されていないことが核心問題だと考えている。インターネット規模のテキストは、有能なチャットボット、コードアシスタント、リサーチツールを生み出すには十分だったが、専門的な仕事を安定してこなす方法をモデルに教えるには、それだけでは足りないかもしれない。

Hoの批判が特に鋭いのは、それが外部の懐疑論者ではなくフロンティアモデルの内部から出ている点にある。彼は、人間があるタスクの「黄金ルート」を観察できたとしても、代替ルートが同様に良いのか、悪いのか、不完全なのかを判断するのは難しいと論じる。この曖昧さのために、多くの実世界スキルは整然としたベンチマーク環境に落とし込みにくい。

言い換えれば、課題は単にテキストをもっと集めることではない。重要なのは、誤りが高くつき、正しい成果が暗黙知に依存する領域で、文脈、結果、例外ケース、品質シグナルを保持するデータセットを構築することだ。これは、公開ウェブをスクレイピングするよりもはるかに難しいデータ問題である。

広いAIの野心から、より狭い領域での実行へ

Hoの主張は、ケンブリッジの研究者Adam Huntの研究と、Google DeepMindの研究者による支持によって補強されている。彼らは、現在のシステムはより汎用的になるのではなく、より専門化していると論じる。つまり、目立つ成果の一部は、より不均一な基盤の姿を隠している可能性がある。モデルは特定分野では鋭くなる一方で、他では停滞したり鈍ったりするかもしれない。

この違いは、研究所、医療ワークフロー、科学分析、その他の高価値領域にAIを導入しようとする企業にとって重要だ。デモでは優れて見えても、実環境では一貫しないモデルでは不十分だ。幅広いが浅い流暢さよりも、信頼性、再現性、そして領域固有の能力のほうが重要になる。

もしモデル開発者が創造的な問題解決や汎化転移で限界に近づいているなら、的を絞ったデータは、本当に重要な場所で能力を押し上げる手段になる。これが事実上のHoの賭けだ。スケーリングが無意味だと言っているのではなく、具体的なタスクに沿って設計されたデータを伴わなければ、その収益は逓減するということだ。

Two paths of AI development: gradual, broad improvement across all tasks (top) versus extreme specialization where a few capabilities spike while core skills stagnate or shrink (bottom). | Image: via Adam Hun
Two paths of AI development: gradual, broad improvement across all tasks (top) versus extreme specialization where a few capabilities spike while core skills stagnate or shrink (bottom). | Image: via Adam Hun

最初の対象: バイオインフォマティクスと日常的な実験室作業

Hoが立ち上げる会社は、まず2つの分野から始めると報じられている。1つはバイオインフォマティクスで、記事によると、GPT-5.6 Solのような現行モデルでさえ、OpenAIでのHoの以前の仕事に関連する複雑な科学分析では約30%の成功率しかないという。もう1つは日常的な実験室作業で、研究者が実験画像をAIシステムに提出して評価を受ける場面などが含まれる。

この出発点は示唆的だ。どちらの領域も、使えるAIには単なる言語模倣以上のものが求められる。バイオインフォマティクスでは、複数段階の推論、分野固有の慣習、科学的文脈、そして誤りへの高い感度がしばしば必要になる。実験室のワークフローでは、教科書的な答えではなく、視覚的判断、手順理解、実践的解釈に依存することがある。まさにこうした環境では、質の低いデータや汎用データが、総合指標では有能に見せながら、重要な用途では失敗する原因になりうる。

報道によれば、次の対象として化学、材料科学、医療、そしてより広い知識労働が計画されている。このロードマップは、誤りにコストが伴い、専用データが防御可能なインフラになりうる産業を軸にした商業戦略を示している。

フロンティアラボ経済への挑戦

Hoは、フロンティアAIラボに付く巨額の評価額にも懐疑的だとみられる。The Decoderの要約によれば、彼はOpenAIやAnthropicのような企業は慢性的に不採算だと主張している。なぜなら、QwenやKimiのような低コストの競合を引き離し続けるために、新しいモデルへ継続的に多額の投資をしなければならないからだ。この診断を全面的に受け入れるかは別として、市場には高まる緊張があることを示している。

フロンティアのスケーリングの限界費用が高いままで、オープン系や安価な競合が差を詰め続けるなら、独自の優位性はモデルサイズそのものよりも複製しにくい何かから生まれる必要があるかもしれない。精選されたデータセット、非公開のワークフロー、検証済みの成果、そして領域特化のフィードバックループは、生のスケールよりもこの要件に適している。構築には時間がかかり、模倣は難しく、しかも顧客のユースケースに密接に結びついていることが多い。

それは基盤モデルの重要性がなくなるという意味ではない。むしろ、それらの差別化は周囲を取り巻くデータの質にますます依存することになるということだ。そのシナリオでは、データ企業はモデル研究所の下流ではなく、能力スタックの重要な一部になる。

1000億ドル規模のデータ市場が意味するもの

今後数年でAIラボが対象を絞ったデータ収集に1000億ドル超を投じるというHoの見積もりは大胆だが、その戦略的な論理は理解しやすい。もし一般的なウェブデータが、簡単な成果を得る源泉として枯渇しているなら、業界には新しい原材料が必要になる。その原材料は、注釈付きの科学タスク、検証済みの企業ワークフロー、マルチモーダルな実験記録、あるいは現在のモデルが学習時に十分見ていない構造化された経験かもしれない。

こうした支出は、AIブームの恩恵を受ける主体も変えるだろう。価値が主に半導体メーカー、ハイパースケーラー、フロンティアモデル開発者に集中するのではなく、データ中心の循環は、ドメイン専門家、ラベリングシステム、合成データツール、企業データパートナーシップ、そして特殊環境で品質を測定できる組織を押し上げる。

より広い意味では、AI競争はより目に見えにくいが、より基盤的な段階に入るのかもしれない。次の飛躍は、単にモデルを大きくすることからは来ない可能性がある。今も自動化に抵抗している、散らかっていて文脈依存で、しかも高いリスクを伴う作業のためのデータで、より良く教えることから来るかもしれない。Hoは、この変化が脇役の話ではないと賭けている。次のAIサイクルを定義する市場の一つになると賭けているのだ。

この記事はThe Decoderの報道に基づいています。元記事を読む

Originally published on the-decoder.com