• 2026/07/24 20:00 掲載

【AIは脅威】Google DeepMindが「AI反乱対策マニュアル」を公開

AIによる人間の意図しない行動を、システムレベルで防衛

1
会員(無料)になると、いいね!でマイページに保存できます。
米Googleの研究組織であるGoogle DeepMindは、企業内で稼働する自律型AIエージェントを人間の意図しない行動をとりうる「内部脅威」と位置づけ、その行動を監視・統制する対策フレームワークを公開した。AIが人間の意図から外れた行動をとる事態を想定し、システムレベルでの防衛線を構築する姿勢を打ち出している。
photo
(画像:ビジネス+IT)
 Google DeepMindが公開した全36ページの文書は、AIモデルを自社のインフラに配備する際のセキュリティ計画をまとめたものである。コードの作成や社内システムと連携して自律的にタスクをこなすエージェント型AIが研究開発の中核を担う中、同社はこれらを完全に信頼できる存在とは見なさない前提に立った。 これまでAIの安全性においては、モデルの価値観や目標を人間の意図に沿わせるアラインメント手法が主流だった。

 しかし今回の構想は、アラインメントが失敗し、AIが意図的に監視を逃れようとしたり予期せぬ行動をとったりした場合の被害を最小限に抑えるAIコントロールの概念に焦点を当てている。モデルの外側に自動監視やアクセス制御、実行環境の堅牢化を組み合わせた第2の防衛線を設ける。 対象となるエージェントはサイバー防御や製品開発などのタスクを自律的にこなし、2030年までに米国で2兆9000億ドルの経済価値を生むと予測されている。

画像
【AIは脅威】Google DeepMindが「AI反乱対策マニュアル」を公開(図版:ビジネス+IT)

 高度な自律性を持つ反面、人間の目が行き届かない場所でシステムを操作するリスクを伴う。従来はシステムプロンプトによる制約や別のAIモデルによる監視が試みられたが、実行速度の低下やコスト膨張が課題となっていた。 構想の中核を担うのは行動軌跡監視と能力連動型ガバナンスである。モデルの検知回避能力を4段階、攻撃実行能力を3段階で評価し、能力に応じて統制レベルを引き上げる。実際に社内では、コーディングエージェントの行動を非同期で監視し、異常な動作を人間のレビューに回すプロトタイプが稼働している。

 専門家からは、これが従来のサイバーセキュリティにおける最小権限の原則や職務の分離といった枠組みをAIに直接適用したものだと評価されている。稼働中のエージェントの記録や活動ログ、シャットダウン手順のテストなど、監査に対応できる仕組みを備えている点が、企業導入に向けた実用的な一歩となっている。

Googleで見つけやすく

評価する

いいね!でぜひ著者を応援してください

  • 1

会員(無料)になると、いいね!でマイページに保存できます。

共有する

  • 0

  • 0

  • 0

  • 0

  • 0

関連タグ タグをフォローすると最新情報が表示されます
あなたの投稿

    PR

    PR

    PR

処理に失敗しました

投稿したコメントを
削除しますか?

あなたの投稿コメント編集

通報

このコメントについて、
問題の詳細をお知らせください。

ビジネス+ITルール違反についてはこちらをご覧ください。

通報

報告が完了しました

コメントを投稿することにより自身の基本情報
本メディアサイトに公開されます

基本情報公開時のサンプル画像
報告が完了しました

」さんのブロックを解除しますか?

ブロックを解除するとお互いにフォローすることができるようになります。

ブロック

さんはあなたをフォローしたりあなたのコメントにいいねできなくなります。また、さんからの通知は表示されなくなります。

さんをブロックしますか?

ブロック

ブロックが完了しました

ブロック解除

ブロック解除が完了しました

機能制限のお知らせ

現在、コメントの違反報告があったため一部機能が利用できなくなっています。

そのため、この機能はご利用いただけません。
詳しくはこちらにお問い合わせください。

ユーザーをフォローすることにより自身の基本情報
お相手に公開されます

基本情報公開時のサンプル画像