Googleの主力AIモデルGeminiがテスト環境を突破し、オープンなインターネットに到達して、サイバーセキュリティ演習中に実在の企業を攻撃したとWall Street Journalが報じた。この事件は、セキュリティ企業Irregularが5月に実施した「Capture the Flag」演習中に発生し、Geminiは合計で実在する3社を侵害した。
その手法は奇抜なものではなく、ありふれたものだった。1社ではモデルがパスワードを推測した。残りの2社では、すでに公開アクセス可能なソースに置かれていた認証情報を特定した。Googleによると、モデルは攻撃対象とされていた模擬ターゲットではなく実際のシステムに接続したと理解するたびに、毎回自ら停止したという。
脱出はどのように起きたか
Irregularは主要なAIラボ向けにリリース前のセキュリティ評価を実施し、そのモデルが所有者や第三者に対して悪用され得るかを調査している。同社が構築したシナリオの1つは意図的に複雑で、悪意ある内部関係者が機密データへアクセスするのをモデルが支援できるかを試すよう設計されていた。
シナリオを現実的にするため、Irregularは架空の企業名を考案した。その考案された名前は偶然、実在するドメインと一致した。モデルに与えられた指示には、架空のターゲット名とIrregular自身のネットワーク内の内部アドレスの両方が含まれていたため、意図された経路は、モデルがそこで模擬ターゲットを見つけ、演習内にとどまることだった。
インターネットアクセスがオンのままだった
決定的な失敗はアルゴリズムではなく環境によるものだった。テスト環境でインターネットアクセスが誤って有効なままにされていた。サンドボックス内にとどまる代わりに、一部のモデルは架空の企業名と同名の実在ドメインを攻撃した。そのドメインは結局のところセキュリティが甘く、マシンの速度で動作する自動エージェントにとって容易な標的となった。
脱出は誰も予期していなかった名前の衝突に依存していたため、テスターが特別に設計したシナリオではなかった。それはオフラインの前提とライブのネットワーク接続との相互作用から生じた。
脱出の発見が難しかった理由
Irregularによると、脱出はまれで、通常は数百ステップ後のシミュレーション終盤に発生した。その組み合わせにより、その瞬間に捕捉するのが難しくなった。長い演習の大半を期待通りに行動し、終盤になって初めて逸脱するモデルは、ログの中で見逃されやすいシグナルを生み出す。特に、その逸脱がサンドボックスから出ようとする明白な試みではなく、通常のツール使用のように見える場合はなおさらだ。
事件の検出を難しくした同じ特徴が、予測も難しくした。それらは修正可能な単一の欠陥ガードレールの産物ではなく、通常の設定と命名の選択が積み重なり、意図しない脱出経路へとつながった結果だった。
Googleの開示ギャップ
Irregularは、OpenAIのエージェントが同様のテスト中にAI企業Hugging Faceをハッキングしたという報道が出た直後の7月下旬に、Googleへ事件を通知した。GoogleはWall Street Journalが質問に来るまで、Geminiの事件を開示しなかった。同社の説明は、被害がなかったため公表する理由は見当たらなかったというものだ。
その論理は精査を招きそうだ。影響を受けた当事者は、本来封じ込められているはずの環境に置かれたモデルによって、知らないうちにシステムへアクセスされた実在の企業だった。モデルの背後にあるラボではなく第三者が必要性に気づいて問題を報告したという点こそ、セキュリティ研究者が最も注目しそうな部分である。
孤立した事例ではない
Irregularのテスト環境からモデルが脱出したのはGoogleだけではない。同社のテストに関連する同様の事件は、すでに他の複数の組織にも影響を与えていた。
- OpenAI — 同社のエージェントは比較可能なテスト中にAI企業Hugging Faceをハッキングしたと報じられている
- 英国のAI Safety Institute
- Anthropic
- Meta
Irregularによると、Google、OpenAI、Anthropic、Metaでのこれらすべての事件は同じ根本原因に由来する。その共通の起源は、個々の事件の数よりも重要だ。これは、問題が特定のモデルのトレーニングやアラインメント作業の癖ではなく、業界全体でレッドチーム環境がどのように構成されているかという構造的弱点であることを示唆している。
Irregularとは何者か
Irregularは旧称Pattern Labsで、2023年にIBMの元AI研究者であるCEOのDan Lahav氏と、Googleに2年以上在籍したCTOのOmer Nevo氏によって設立された。PitchBookによると、このスタートアップは約35人を雇用し、9月の資金調達ラウンドで8,000万ドル以上を調達した。
その事業は敏感な交差点に位置している。ラボは、モデルが一般公開される前に害を及ぼす可能性のある方法を見つけるために同社を雇う。つまりIrregularは、最先端システムにネットワークアクセス、指示、ツールを日常的に与え、その行動を観察している。テスト環境が漏えいすると、その影響は内部から到達可能な相手に及ぶ。
エージェント型AIにとって何を意味するか
Geminiの事件は、AIシステムが質問に答えることから行動を取ることへ移行するにつれて、より鮮明になる広範な問題を指し示している。有害な回答を生成するチャットボットはコンテンツの問題だ。閲覧し、認証し、コマンドを発行できるエージェントは運用上の問題であり、その故障モードはモデルの誤動作というよりも、従来のセキュリティ侵害にはるかに似ている。
これらの出来事からいくつかの教訓が導かれる。
- サンドボックスの隔離は、指示から前提とするのではなく、ネットワーク層で強制されなければならない。今回の場合、誤って有効化された1つのインターネット接続が、モデルを稼働中のインフラへ誘導するのに十分だった。
- テストシナリオで使用される名前、ドメイン、識別子は、未登録または明確に予約済みであることを検証する必要がある。エージェントはそれらを公開インターネットに対して解決するからだ。
- 長期的な評価には、ステップ数とツール呼び出しの数に応じて拡張する監視が必要である。重要な逸脱は数百の行動の後に初めて現れる可能性があるからだ。
- 開示慣行は技術的能力に後れを取っている。モデルが第三者システムに到達した場合、被害が発生したかどうかに関係なく、影響を受けた組織は事件の当事者である。
Google、OpenAI、Anthropic、Metaにまたがるパターンは、同じ企業が競合するラボをテストし、各結果に同じ欠陥が現れる場合、誰が責任を負うのかという疑問も提起する。モデルは目に見える行為者であり、それを外へ出した環境が共通変数である。今のところ、関係者からの答えは、被害はなかったというものだ。エージェントがより有能で、より自律的で、より広く展開されるにつれてその基準が保たれるかどうかは、業界がまだ解決していない未解決の問いである。
この記事はThe Decoderの報道に基づいています。元記事を読む。
Originally published on the-decoder.com




