NVIDIA、AIエージェント全層に強制可能な防御策

全層の防御設計

実行環境による強制境界
作業別の限定資格情報
重要操作への人間承認

検証可能な運用

保護ログによる追跡性
変更後の反復テスト
指名責任者による判定

防御側の基盤

OpenShellの隔離実行
失敗事例と修正の共有
詳細を読む

NVIDIAは2026年9月21日、AIエージェントの安全性をモデル単体ではなく、ハーネスや実行環境を含む全層で設計すべきだとの考えを示しました。エージェントが誤った判断をしても、ファイル、ネットワーク、プロセスへのアクセスを実行環境側で制限し、追跡可能なID、限定資格情報、人間の承認、保護ログ、反復テストを組み合わせて被害を防ぐ方針です。

記事は、顧客記録を更新するエージェントが添付文書内の悪意ある指示を読み、顧客データを無許可の宛先へ送ろうとする例を挙げています。この場合、ネットワーク方針が転送を阻止し、保護されたログがツール呼び出し、認可判断、結果を記録します。

顧客記録の更新権限は、データの書き出し権限まで自動的に広げてはならず、エージェント自身に追加権限を承認させません。各エージェントには追跡可能なIDと作業範囲に限定した資格情報を与え、重要な操作や権限変更には人間の承認を求めます。

組織はエージェントが使うツール、スキル、依存関係の出所と完全性を確認し、問題発生時にはログから経緯を再現できるようにします。アクセス取り消しとインシデント封じ込めの手順も整え、記録を対応に生かします。

オープンソースのNVIDIA OpenShellは、エージェントから変更できない場所で方針を強制し、隔離実行とデータ、ネットワーク、システム資源へのアクセス管理を提供します。CiscoのDefenseClawはガバナンス層を加え、JFrogはエージェントスキルの検査・検証とアクセス方針の強制を組み込みます。

導入前には、範囲外の資格情報取得や機密データ送信、権限変更、監視妨害を制御が阻止できるか確かめ、モデルやツール、業務手順の重要な変更後にも試験を繰り返します。指名された責任者が結果から導入可否を判断し、失敗を再現・調査・修正して継続的な試験に変えることが必要です。