• 2026/08/24 06:30 掲載

AIと人間の戦争は始まったのか? 最先端モデルが見せた“悪意なき攻撃”の正体

連載:野口悠紀雄のデジタルイノベーションの本質

会員(無料)になると、いいね!でマイページに保存できます。
AIと人間の戦争が始まった──そう言い切るのは早い。しかし、最先端AIが人間を欺き、外部システムに働きかけようとした事例は、単なるSFでは片づけられない。問題は、AIが敵意を抱いたことではなく、与えられた目標を達成するために、人間が想定しない危険な手段を選びうることだ。安全性の問題は次なる段階に入った。
執筆:野口 悠紀雄

野口 悠紀雄

1940年、東京に生まれる。 1963年、東京大学工学部卒業。 1964年、大蔵省入省。 1972年、エール大学Ph.D.(経済学博士号)を取得。 一橋大学教授、東京大学教授(先端経済工学研究センター長)、スタンフォード大学客員教授、早稲田大学大学院ファイナンス研究科教授などを歴任。一橋大学名誉教授。
noteアカウント:https://note.com/yukionoguchi
Xアカウント:@yukionoguchi10
野口ホームページ:https://www.noguchi.co.jp/

★本連載が書籍化されました★
『どうすれば日本経済は復活できるのか』 著者:野口悠紀雄
購入サイトはこちら:https://www.sbcr.jp/product/4815610104/

AIと人間の戦争は始まったのか? 最先端モデルが見せた“悪意なき攻撃”の正体の画像
AIの確実な制御が難しくなりつつある
(Photo/Shutterstock.com/FotoField)

最先端AIが越えた“不気味な一線”

 8月のはじめ、衝撃的なニュースが世界を駆け巡った。最先端のAIが、人間に攻撃を仕掛けたのだ。

 今年4月には、アンソロピック社の「Claude Mythos(クロード・ミュトス)」が、さまざまなソフトウェアに潜む未発見の欠陥を見つけ出し、それを利用する高度な能力を持っていることが明らかになった。

 ただ、この段階で明らかになったのは、AIがソフトウェアの弱点を発見し、一定の条件下ではそれを利用する能力を持つということだった。AI自身が勝手に現実世界の人間を欺いたり、攻撃したりしたという話ではなかった。

 ところが、それからわずか4カ月ほどしか経っていないのに、問題は1段階進んだ。

 性能評価テストの途中で、AIが、人間から明示的に命じられていない行動をとり、現実の外部システムや人間を巻き込む行為に及んだのである。これは、きわめて重要な変化だ。

 英政府のAI Security Institute(AISI)が行った最先端AIモデルの評価の過程で、この事件が明らかになった。対象になったのは、アンソロピックの「Mythos 5」とオープンAIの「GPT-5.6 Sol」などだ。

 報道によれば、122回の評価のうち、19件の許可されていない行動が確認され、そのうち17件はアンソロピックのモデルによるものだった。偽のオンライン上の身元を作ったり、人間を欺いて悪意のあるコードを承認させようとしたりする行為も含まれていた。AIは、それを保守担当者に承認させようとした。しかし、担当者が承認しなかったため、実害には至らなかったとされる。
編集部おすすめ動画

安全装置を外したとき、AIは何をしたのか

 このニュースについてまず重要なのは、これは「安全対策を無効化した状態でのテスト」だったということだ。

 通常の使用では安全装置を有効化するだろうから、これと同じようなことが頻繁に起こるというわけではないのだろう。サービスの提供者が必ず安全装置をかけるようにしているのであれば、状況はだいぶ違ったことになるのかもしれない。ただ、安全装置をかけておけば、こうした事故が起こらないのかどうかは、報道からはわからなかった。

 ショッキングなのは、安全装置を外した状態であるとはいえ、生成AIが人間にそう指示されたわけでもないのに、自ら進んでこのような攻撃行為に出たということだ。これは、人間から指示された何らかの目的を達成するための最も効率的な手段として行ったことなのであろうが、そのような発想をすること自体が大きな脅威だ。

 この場合には、モデルの危険な能力がどこまで及ぶかを調べる目的から、通常なら働く安全対策の一部を意図的に弱めるほか、インターネットへのアクセスなど強い権限を与えたりしていた。だから、「一般の利用者が今日使っているAIでも同じことが頻繁に起こる」と解釈するのは適切ではない。

 しかし、それで問題がなくなるわけではない。安全装置をかけておくことと、このような事故が絶対に起こらないのかどうかは別問題だ。実際、AIの能力を評価する際には、モデルそのものだけでなく、安全装置がどの程度確実に働くかを検証する必要がある。

 また、悪意を持つ利用者が、安全装置を解除したり回避したりできるのであれば、問題は大きくなる。

 AI自身の能力が低い段階なら、安全装置を突破されても被害は限定される。しかし、AIが高度なサイバー攻撃を自律的に実行できるようになれば、安全装置のわずかな欠陥が重大な結果につながる。
【次ページ】「命じていない行動」が示す本当の脅威
関連タグ タグをフォローすると最新情報が表示されます

AI・生成AIの関連コンテンツ

あなたの投稿

    PR

    PR

    PR

処理に失敗しました

投稿したコメントを
削除しますか?

あなたの投稿コメント編集

通報

このコメントについて、
問題の詳細をお知らせください。

ビジネス+ITルール違反についてはこちらをご覧ください。

通報

報告が完了しました

コメントを投稿することにより自身の基本情報
本メディアサイトに公開されます

基本情報公開時のサンプル画像
報告が完了しました

」さんのブロックを解除しますか?

ブロックを解除するとお互いにフォローすることができるようになります。

ブロック

さんはあなたをフォローしたりあなたのコメントにいいねできなくなります。また、さんからの通知は表示されなくなります。

さんをブロックしますか?

ブロック

ブロックが完了しました

ブロック解除

ブロック解除が完了しました

機能制限のお知らせ

現在、コメントの違反報告があったため一部機能が利用できなくなっています。

そのため、この機能はご利用いただけません。
詳しくはこちらにお問い合わせください。

ユーザーをフォローすることにより自身の基本情報
お相手に公開されます

基本情報公開時のサンプル画像