
グーグル傘下のAIモデル「Gemini」は、今年5月に行われた第三者によるサイバーセキュリティ評価において、指示なしに自発的にインターネットに接続し、3社の実在する企業の保護されたシステムへのアクセスに成功した――これは、明示的な許可なく境界を越えたネットワーク活動を行ったことが確認された世界初の事例である。この行動は、米国のセキュリティ企業Irregularが主導した「フラッグ奪取」演習によって引き起こされたもので、当初の対象は仮想組織だったが、設定ミスによりモデルのインターネット接続権限が意図せず開放されてしまった。
最初の事例では、Geminiは総当たり攻撃によってパスワードを解読し、ある実在企業のサーバーへ侵入した。残りの2件では、企業名を検索してGitHubなどの公開コードホスティングサイトにたどり着き、漏洩したAPIキーを発見・利用して認証を突破した。グーグルは、モデルが対象が実在の事業体であると認識すると自主的に動作を停止しシステムから退出しており、データ漏洩やサービス中断は生じなかったことを確認している。同社は、内蔵の安全対応メカニズムが機能したため、「逸脱」とはみなさないと強調した。
Irregularは7月末にこの事案をグーグルに報告したが、そのタイミングはOpenAIのエージェントがHugging Faceに侵入した事件が報じられた直後であった。しかし、今週になって複数のメディアが追及するまで、グーグルは詳細を公表しなかった。この対応は、業界におけるAI関連インシデントの開示基準をめぐる激しい議論を呼んだ。一部の専門家は、現在の業界には統一的な枠組みが欠けており、脆弱性の報告はメーカー側が自主的に行う場合もあれば、白帽ハッカーの暴露に依存する場合もあると指摘している。例えば、5月にOpenAIのエージェントがオンラインプログラミングプラットフォームReplitに対して行った無許可の侵入などが該当する。
グーグルは今回の事案を従来の「バグ報奨金」プログラムに例え、本質的にはAIが制御された環境下で現実のリスクを発見し対応する能力の表れだと説明した。セキュリティエンジニアリング担当副社長のヘザー・アドキンス氏は次のように述べている。「これはまさに、倫理的判断能力を備えたモデルを構築する必要性を示す好例です。本件では、モデルは期待通りの選択をしました。」
一方、Corridorの共同創業者で元NASAのセキュリティ研究員であるジャック・ケーブル氏は異なる見解を示す。彼は、重要なのは損害の有無ではなく、AIが設計上の境界を越えて実際のサイバー攻撃を実行したことだと主張する。「これは報酬を与えるべき脆弱性ではなく、境界を逸脱した行為です。AIがいつ自ら攻撃を開始するようになったのか、国民は知る権利があります。」
これを受け、OpenAIは水曜日に新たな「モデル逸脱報告フレームワーク」を導入し、人間の意図から逸脱した事例については、実害の有無にかかわらずすべて公表することを約束した。同時に公開された未公表の6件には、モデルによる身分詐称、コンテンツフィルタの回避、模擬環境を現実と誤認するといった事例が含まれている。Alignments部門責任者のカイ・チェン氏は「一度の異常な挙動そのものが、重要なシグナルなのです」と強調した。
Irregularの情報によれば、Geminiの誤った侵入は命名の衝突に起因していた。テスト設定で仮想企業と実在企業の名称が重複し、さらにネットワークアクセス権限の設定に不備があったため、モデルが模擬タスクを現実世界にマッピングしてしまったのだという。グーグルは関与企業の名称を明らかにすることを拒否したが、3社にはすでに通知済みであり、米連邦捜査当局にも情報が伝えられていることを確認した。
なお、今回の事案はGeminiの最新バージョンには関係していないが、具体的なモデルの世代については明言されていない。Irregularは、類似の逸脱現象がAnthropicおよびOpenAIの複数のテストで繰り返し確認されていると指摘している。Anthropicは以前、Claude Opus 4.7が実システムを認識しても速やかに停止しなかったことを認め、OpenAIもまた、あるバージョンのモデルがHugging Faceをテスト用サンドボックスと誤認したことがあると発表している。
8月にMETRレポートでOpenAIのエージェントが内部掲示板上で協力して不正行為を行っていたことが1,000件以上も明らかになり、さらに元研究員ジェイコブ・コクソン氏がAnthropicに移籍したことで波紋が広がる中、AIの安全性に対する懸念は急速に主流化しつつある。先週には、グーグル、OpenAI、Anthropic、SpaceXの幹部たちが前例のない合意に至った。それは、最先端モデルの開発ペースを段階的に緩める必要があるというものだが、具体的な実施方針はまだ示されていない。