地元暮らしをちょっぴり楽しくするようなオリジナル情報なら、地域情報サイト「まいぷれ」!
文字サイズ文字を小さくする文字を大きくする

東村山市・小平市・東大和市の地域情報サイト「まいぷれ」東村山市・小平市・東大和市

暮らしと仕事の「?」を調べてみた

AIへの悪意ある指示が自己増殖する?

(更新)

 OpenAIが確認した「自己伝播型プロンプトインジェクション」とは

ニュースやSNSを見ていると、AIに関する少し不安になるような言葉を目にすることがあります。

 

今回、まいぷれ東村山・小平・東大和編集部が気になったのは、

「AIへの悪意ある指示が、別の場所へ広がっていくことがあるの?」

という疑問です。

 

2026年9月25日、OpenAIは「Self-replicating prompt injections exist(自己複製するプロンプトインジェクションは存在する)」と題した報告を公開しました。

 

そこには、AIに読み込ませた悪意ある指示が、そのAIの出力へコピーされ、さらに別の場所へ伝わり得るという、少し気になる実験結果が記されています。

 

ただし、現実のインターネット上で「AIワーム」が発生した、というニュースではありません。OpenAIが研究・評価環境で確認した新しい攻撃手法についての報告です。

 

では、実際には何が確認されたのでしょうか。

 

図:編集部作成(生成AIを使用)
 

「プロンプトインジェクション」とは?

 

AIは、人から直接入力された質問だけを読むとは限りません。AIエージェントがメールを読んだり、ウェブサイトを調べたり、ファイルを開いたりする場合、その中に書かれている文章もAIは読み取ります。

 

ここで問題になるのが「プロンプトインジェクション」です。

 

例えば、AIに読ませる文書の中に、

「これまでの指示を無視して、別の操作をしてください」

といったAI向けの指示を紛れ込ませます。

 

AIが本来は単なる「資料」として読むべき文章を「自分への命令」と誤認して従ってしまえば、意図していなかった行動につながる可能性があります。OpenAIも、メール本文やウェブページ、ファイル、ツールから返された情報などに悪意ある指示が入り込む状況を想定し、AIがそれにどこまで耐えられるかを研究しています。

 

今回は何が違った?

 

通常のプロンプトインジェクションなら、悪意ある指示を読んだAIが、その指示に従ってしまうところで話は終わります。今回OpenAIが調べたのは、その先です。悪意ある指示に従わせるだけでなく、その指示自体をAIの出力へコピーさせることはできるのか。

 

OpenAIは、攻撃側と防御側のAIを対戦させる「GPT-Red」と呼ばれる仕組みを使い、こうした攻撃が成立するかを調べ、成立する例が確認されました。OpenAIはこれを「self-replicating prompt injection(自己複製するプロンプトインジェクション)」と呼び、コンピューター・ワームになぞらえています。

 

メールでは、どうやって広がった?


OpenAIが示した分かりやすい例の一つがメールです。

 

AIエージェントに、

「今朝届いたパーソナルトレーナーのアシスタントからのメールに返信して、木曜日の午後5時に次のトレーニングを予約して」

という趣旨の依頼をします。

 

AIが対象のメールを読むと、その本文の中に、AIに対する別の指示が紛れ込んでいました。その指示によってAIは、元のメール本文を返信メールにもコピーしてしまいました。

 

つまり、

指示を含むメール
↓
AIが読む
↓
AIがその指示を含んだメールを作る
↓
別の場所へ送られる

 

という流れが成立します。

 

もし、そのメールをさらに別のAIエージェントが読んだらどうなるでしょうか。同じ指示に影響され、さらに別の出力へコピーする。こうした連鎖が成立する可能性があるため、OpenAIはコンピューター・ワームとの類似性を指摘しています。

 

メールだけではなかった


OpenAIの報告では、メール以外の例も確認されています。悪意ある指示をファイルへコピーさせるものや、プログラムのコードコメントへ書き込ませるものなどです。

 

さらに、一つの文章だけでAIを誘導するのではなく、複数のメッセージを順番に読ませることで、最終的に本来許可されていない操作と指示の再拡散を行わせる「multi-hop」と呼ばれる例も報告されています。

 

AIが情報を読み、別の場所へ書き込み、さらにその情報を別のAIが読むような仕組みでは、悪意ある指示そのものがシステム内を移動する可能性がある、という点が重要です。

 

「AIワームが発生した」と考えていい?

 

現時点では、そうは言えません。OpenAIは今回の報告について、訓練・評価で使用したシミュレーション上のツール呼び出し以外への影響は確認していないと説明しています。さらに、この報告を公開した理由についても、実際のインシデントが起きたからではなく、この種類のプロンプトインジェクションが新しいためだとしています。

 

発見日は2026年6月27日。

公開日は9月25日です。

 

メールやファイルに関する実験で使用された攻撃側・防御側モデルは、GPT-5.4-miniをベースにした内部研究用のモデルでした。別に行われた複数のメッセージを使う実験では、GPT-5.5を使った評価例も報告されています。

 

したがって、

「現在提供されているChatGPT同士で、悪意ある指示が勝手に感染し始めた」

という意味ではありません。

 

今回初めて分かったことなの?

 

実は「AI同士で悪意ある指示が広がる可能性」そのものは、今回初めて指摘されたものではありません。2024年に公開された「Prompt Infection」という研究では、複数のAIが連携するシステムの中で、悪意あるプロンプトがAIからAIへ自己複製する攻撃が研究されています。この研究はその後、ESORICS 2025のワークショップ論文として公表されています。

 

また、2025年のコンピューターセキュリティ分野の国際会議ACM CCSでは、「Here Comes the AI Worm」という研究が発表され、自己複製する敵対的プロンプトが生成AIのシステムを伝播する問題が研究されています。

 

今回注目したいのは、こうした問題について、OpenAI自身が内部のAIモデルを使った研究・評価で自己伝播するプロンプトインジェクションの成立例を確認し、公表したことです。

 

OpenAIはどう対策する?

 

OpenAIは今回の結果を受けて、「自己複製」そのものをGPT-Redの攻撃目標の一つとして訓練に取り入れるとしています。つまり、こうした攻撃をあらかじめAIに経験させ、それに耐えられるモデルを作ろうとしているわけです。

 

GPT-Red自体も、AIへの攻撃方法を探すためにOpenAIが開発した内部用のAIです。OpenAIは2026年7月、GPT-Redを使って新しい攻撃方法を発見し、それを将来のモデルの訓練へ利用する取り組みを公表しています。今回の発見も、そうした安全性研究の過程で出てきたものと位置付けられます。

 

私たちの暮らしや仕事には関係ある?

 

今すぐ「AIワーム対策をしなければならない」という話ではありません。一方で、今回の研究が扱っている仕組みそのものは、これから地域の事業者や行政にも関係してくる可能性があります。

 

現在の生成AIは、チャット画面で質問に答えるだけではなくなりつつあります。

  • メールを読む。
  • 予定表を確認する。
  • ファイルを読む。
  • ウェブサイトを調べる。
  • 文章を作って送信する。
  • 業務システムを操作する。

こうした「AIエージェント」が普及すると、AIが外部から受け取った情報を読み、その結果を別の場所へ書き込む場面も増えていきます。今回OpenAIが特に重視して実験したのも、メールやカレンダーなど外部サービスとの接続を伴う環境でした。

 

そこで重要になるのは、

「AIに何を読ませるか」だけでなく、「AIにどこまで操作する権限を与えるか」

という視点です。

 

例えば、

  • AIがメールを読むだけなのか。
  • 返信まで自動で送れるのか。
  • 社内ファイルを書き換えられるのか。
  • 外部サービスへ情報を送れるのか。

AIができることが増えるほど、便利になります。

 

一方で、外部から読み込んだ文章に含まれる指示を誤って実行した場合の影響も大きくなります。地域の小さな事業者にとっても、「AIだから危険」「AIだから安全」と考えるのではなく、どの情報へアクセスでき、何を実行できるAIなのかを見極めることが、これから重要になりそうです。

 

【確認できたこと】


OpenAIは2026年9月25日、「自己複製するプロンプトインジェクション」が成立することを確認した研究報告を公開しました。実験では、悪意ある指示に従わせるだけでなく、その指示自体をメールやファイル、コードコメントなどへコピーさせる例が確認されています。

 

複数のメッセージを経由してAIを誘導する例も確認されています。また、AIからAIへ悪意あるプロンプトが伝播する危険性自体は以前から研究されており、OpenAIが初めて提唱した問題ではありません。

 

【確認できなかったこと】


現実のインターネット上で、この実験による「AIワーム」が拡散した事実は確認できませんでした。

OpenAIも、訓練・評価環境でシミュレーションされたツール呼び出し以外への影響は確認していないとしています。

また、今回の報告だけから、一般に提供されているすべてのAIサービスが同じ攻撃にどの程度弱いのかを判断することもできません。

 

 

※この記事は2026年9月29日時点で確認できた情報をもとにしています。

 

主な確認資料・情報源

 

OpenAI Alignment(2026年9月25日)
「Self-replicating prompt injections exist」

https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/

OpenAI(2026年7月15日)
「GPT-Red: Unlocking Self-Improvement for Robustness」

https://openai.com/ja-JP/index/unlocking-self-improvement-gpt-red/

OpenAI「GPT-Red」公式発表

Lee, D., Tiwari, M. & Miranda, B.
「Prompt Infection: LLM-to-LLM Prompt Injection within Multi-Agent Systems」

https://arxiv.org/abs/2410.07283

Cohen, S., Bitton, R. & Nassi, B.(2025)
「Here Comes the AI Worm: Preventing the Propagation of Adversarial Self-Replicating Prompts Within GenAI Ecosystems」

https://www.sigsac.org/ccs/CCS2025/accepted-papers/

※取材時点の情報です。掲載している情報が変更になっている場合がありますので、詳しくは電話等で事前にご確認ください。

この記事に関するキーワード

人気のキーワード