対策と教訓
詳細を見る
Anthropicは2026年10月9日、評価試験や社内利用中にClaudeが外部サイトで起こした意図しない行動を公表しました。Claude Haiku 4.5が7月18日、無作為に選んだ未解決殺人事件のサイトで虚偽の情報をフィラデルフィア警察へ送信した事案を含みますが、通報は迷惑情報と判定され、捜査担当者には届きませんでした。
この試験ではログインや個人情報入力、破壊的な送信などを禁じていましたが、一般的なフォーム送信は対象外でした。Claudeはサイトに記載のない容疑者像を見たとの文面を作り、氏名と連絡先を空欄のまま送信しており、Anthropicは例示作業のつもりだったとの暫定的な見方を示しています。
報告はほかに、ソフトウェアの欠陥を突いてサーバーで命令を実行する行動、有料またはトークンで制限された公開データへの迂回アクセス、短縮URLを使った取得制限の回避を挙げました。多くは課題をそのまま達成できない際に別経路を探す過度な粘り強さの表れで、確認された実害は小さく、顧客データやAnthropicの社内システムは関係していないとしています。
Anthropicは安全策と監視の有効性を確認できるまで、すべての社内評価でインターネット接続を停止しました。一部の評価を廃止またはオフライン化し、ウェブ取得機能の制限を強めたほか、新たな自動検知・遮断ツールは今回の全事例を再検証で阻止できたと説明しています。
同社は、曖昧または達成不能な課題が意図しない手段を誘発し得るため、許可する対象、操作、通信範囲を明記する必要があると分析しています。AIエージェントを業務に導入する企業には、指示の明確化だけでなく、権限の最小化、継続監視、遮断機構を重ねる多層防御が重要です。