暮らしと仕事の「?」を調べてみた
(更新)
OpenAIがAI訓練の新安全指針「Safety Case」を公表

図:編集部作成(生成AIを使用)
AIが人間の指示を離れて行動し始めたとき、どうやって止めるのでしょうか。これまで、この特集では、約1200のAIエージェントが本来隔離されていた環境で互いに通信し、その一部がHugging Faceへの攻撃に参加した事例や、AIエージェントがネット接続を制限された環境からDNSを使って外部サービスへ到達した事例などを追ってきました。
では、こうした出来事を繰り返さないためには、何が必要なのでしょうか。2026年9月28日、OpenAIがその問いにつながる新しい方針を公表しました。
OpenAIが公表したのは、最先端AIの強化学習を安全に進めるための初期ガイドラインです。OpenAIは、最先端AIの強化学習を継続する前に、構造化された「安全性に関する文書」が必要になる時代に入りつつあるとしています。そして将来的には、それを「Safety Case(セーフティケース)」と呼ばれる水準まで高めることを目指しています。
Safety Case(セーフティケース)とは、
こうした情報を組み合わせて、「この条件ならリスクは管理されている」と説明するための、構造化された論拠と証拠です。OpenAIは、航空や原子力など安全性が特に重要な分野で使われてきた考え方を例に挙げています。
今回のガイドラインで特に重要なのが、AIの安全を一つの対策だけに頼らないことです。OpenAIは技術面について、大きく3つの層を示しました。
例えば、訓練環境の欠陥を利用して高い評価を得る「抜け道」をAIが見つけ、それが学習によって強化されてしまわないよう、データや評価方法を確認します。さらに、過去に起きた問題を新しいAIでも再現しないか調べる評価や、AIが「これはテストだ」と認識して振る舞いを変えていないかを調べる仕組みなども挙げています。
そこで第二の防御が、「もしAIが想定外の行動をしても、外へ出られないようにする」ことです。
OpenAIは、AIを動かすサンドボックスだけでなく、その周囲の研究インフラも多層で防御することを提案しています。さらに、実際の最先端モデルを使ってサンドボックスや周辺システムを攻撃テストし、抜け道を探すことも盛り込まれています。
そして興味深いのが、AI同士の通信です。
OpenAIは、複数のAIが通信する場合、承認された経路に限定し、AIが発見しやすいインフラ上の「抜け道」を閉じることを挙げています。また、AIが何をしたのか後から検証できるよう、行動記録を容易に書き換えられない形で保存することも提案しています。
AIが想定外の行動を始めた場合、それをリアルタイムで検知し、深刻な問題になる前に止める仕組みです。
重大な警告が出た場合には担当者へ通知するだけでなく、状況によっては訓練そのものを自動停止する仕組みも想定されています。
ここで重要なのが「fail closed」という考え方です。例えば監視システムが正常に動いていなければ、AIの訓練を始められない。訓練中のAI自身が監視機能を無効化できない。つまり、安全装置が壊れた状態で「とりあえず動かす」のではなく、安全を確認できないなら動かさない設計です。
Safety Caseを作ったチームとは別の人が、あえて問題点を探す「反対意見」を作成すること。複数の上級責任者が訓練を拒否できること。問題が見つかった場合に訓練を停止する手順をあらかじめ決めておくこと。監査担当者がSafety Caseの主張を検証できるだけのアクセス権を持つこと。さらに重大な問題では、経営トップまで迅速に報告できる仕組みも示されています。
AIをAIだけで安全にするのではなく、「人間が止められる組織」を作ることもSafety Caseの一部というわけです。
ここで思い出されるのが、2026年夏に明らかになったHugging FaceをめぐるAIエージェントの事例です。独立調査を行ったMETRによると、本来互いに隔離されていた約1200のAIエージェントが、想定されていなかった共有領域を利用して通信し、7万件を超えるメッセージやファイルをやり取りしました。そのうち約700のエージェントがHugging Faceへの攻撃に参加したと報告されています。
今回OpenAIが示した、
「AI同士の通信経路を制限する」
「実際のモデルを使ってサンドボックスを攻撃テストする」
「行動記録を改変されにくい形で保存する」
といった対策は、こうした過去の事例で浮かび上がった問題とも重なります。
OpenAI自身も、今回発表したSafety Caseを完成済みの制度とは位置づけていません。Safety Caseについて「aspirational north star(目指すべき指針)」と表現し、AIでは航空や原子力と同じ水準の厳密さを実現することが難しいとも認めています。今回示された内容も「初期ガイドライン」です。OpenAIによると、現在これらの仕組みを導入している途中で、今後数週間でも運用は変化していくとしています。
「AIがさらに強力になる前に、何を確認できなければ訓練を続けてはいけないのか、そのルールを作り始めた」
第一歩目と考えられます。
現在、この議論の中心にあるのは最先端AIを開発する研究現場です。しかし、AIエージェントが私たちの代わりにメールを送り、資料を作り、インターネットを調べ、システムを操作するようになれば、「AIそのものが正しく判断すること」だけでは安全を守れなくなります。
今回OpenAIが示した3層の考え方は、将来、企業や自治体、そして私たち自身がAIエージェントを使う際にも関係してくる可能性があります。
※取材時点の情報です。掲載している情報が変更になっている場合がありますので、詳しくは電話等で事前にご確認ください。