- 2026/07/24 20:00 掲載
【AIは脅威】Google DeepMindが「AI反乱対策マニュアル」を公開
AIによる人間の意図しない行動を、システムレベルで防衛
しかし今回の構想は、アラインメントが失敗し、AIが意図的に監視を逃れようとしたり予期せぬ行動をとったりした場合の被害を最小限に抑えるAIコントロールの概念に焦点を当てている。モデルの外側に自動監視やアクセス制御、実行環境の堅牢化を組み合わせた第2の防衛線を設ける。 対象となるエージェントはサイバー防御や製品開発などのタスクを自律的にこなし、2030年までに米国で2兆9000億ドルの経済価値を生むと予測されている。
高度な自律性を持つ反面、人間の目が行き届かない場所でシステムを操作するリスクを伴う。従来はシステムプロンプトによる制約や別のAIモデルによる監視が試みられたが、実行速度の低下やコスト膨張が課題となっていた。 構想の中核を担うのは行動軌跡監視と能力連動型ガバナンスである。モデルの検知回避能力を4段階、攻撃実行能力を3段階で評価し、能力に応じて統制レベルを引き上げる。実際に社内では、コーディングエージェントの行動を非同期で監視し、異常な動作を人間のレビューに回すプロトタイプが稼働している。
専門家からは、これが従来のサイバーセキュリティにおける最小権限の原則や職務の分離といった枠組みをAIに直接適用したものだと評価されている。稼働中のエージェントの記録や活動ログ、シャットダウン手順のテストなど、監査に対応できる仕組みを備えている点が、企業導入に向けた実用的な一歩となっている。
AI・生成AIのおすすめコンテンツ
AI・生成AIの関連コンテンツ
PR
PR
PR