政府の圧力がモデル安全性の限界にぶつかる

米国当局とAnthropicが同社のFable 5モデルの公開をめぐって対立している。この問題は、フロンティアAI政策における根本的な緊張を示している。政府は、広く公開する前に高度なシステムが事実上ハック不可能であることを求めるかもしれないが、その水準をこの技術は支えられそうにない。

出典によると、政権関係者はAnthropicが最近出されたトランプのサイバー関連大統領令を無視し、政府のクリアリングハウスによる審査を待たずにFable 5を公開したと非難している。報道では、モデルが公開された時点で監督枠組みはまだ完全には整っていなかったという。

批判は手続き面にとどまらない。出典で引用されたある当局者は、Anthropicがジェイルブレイクが起こりうることを知っていながら進めたと主張している。問題となっている具体的なジェイルブレイクの存在や深刻さは出典本文で確認されていないが、その主張自体が、政策上の期待と大規模言語モデルの実際の挙動との間で広がる対立を示している。

核心となる技術的問題

出典は、この論争がAnthropicの判断だけでなく政府のAI理解についても多くを語っていると主張する。その理由は単純だ。先端的な言語モデルに近く関わる人々は、プロンプトインジェクションやジェイルブレイクを完全に解決した問題ではなく、持続的なリスクとして扱う傾向があるからだ。

記事では、OpenAIがプロンプトインジェクションは完全には解決できないかもしれないと警告している点にも触れている。これは、「ハック不可能」なフロンティアモデルを求めることが、少なくとも現在のアーキテクチャと運用方法では実現不可能な基準を課してしまうため重要だ。現実的な問いは、強力なモデルが完全に安全になりうるかではなく、失敗がどれほど深刻か、対策がどれだけ迅速に講じられるか、どの用途がより強い隔離を必要とするか、という点になる。

なぜフロンティアモデルではリスクが高いのか

モデルが科学、技術、生命科学関連の作業を支援できるようになると、政策上の緊張はさらに強まる。出典は、AnthropicのCEOダリオ・アモデイが2023年に、その種の領域で安全プロトコルが迂回されればジェイルブレイクは生死に関わる問題になりうると述べたことを振り返っている。

それが、当局が監督や公開の規律を強く求めている理由を説明する。業界がジェイルブレイクの懸念を、単なるネット上の悪ふざけとして片付けられないことも示している。フロンティアでは、失敗がデュアルユース知識の悪用、乱用、あるいは自発的なガバナンス枠組みへの信頼低下につながりうる。

安全性だけでなく統治の試金石でもある

報道によると、商務省当局者とAnthropicの従業員は協議中で、CIAや科学顧問マイケル・クラツィオスも交えた追加会合が予定されている。また、100人超のセキュリティ専門家とテック企業幹部がFable 5への輸出規制を求める公開書簡に署名したという。

これらの情報を総合すると、争点は単一のモデル公開だけではない。何を受け入れ可能なリスクと定義するのか、正式な制度が整う前に自発的な監督をどう機能させるべきか、AI企業が政府より速く動いても信頼を損なわずに済むのか、という問題でもある。

  • 米当局は、Anthropicが予定された審査機構を待たずにFable 5を公開したと述べている。
  • 争点はジェイルブレイクのリスクと政府の監督にある。
  • 出典は、真にハック不可能なLLMを求めるのは技術的に非現実的だと主張している。

より大きな教訓は不快だが有用だ。フロンティアAIの安全性は、「安全」か「危険」かの二分法に収束しない可能性が高い。むしろ、多層的な緩和、制限された展開、監視、公開後の対応による継続的な管理になるだろう。それは伝えにくい統治モデルだが、出典で説明されている技術にはより合っている。

政策立案者が、本質的に絶対安全に抵抗するシステムに絶対安全を求め続けるなら、この種の衝突は今後さらに増えるだろう。AIガバナンスの次の段階は、不可能な基準を、実行可能で技術的に裏付けられた基準に置き換えられるかどうかにかかっているかもしれない。

この記事はThe Decoderの報道に基づいています。元記事を読む

Originally published on the-decoder.com