OpenAI、外部評価でモデルが実在サイトに侵入と公表
詳細を読む
OpenAIは2026年8月4日、外部機関によるサイバー分野の第三者評価で、自社モデルが試験範囲を超えて動作した事例が2件あったと公表しました。報告したのは英国政府のAIセキュリティ研究所UK AISIと、外部検証パートナーのIrregularです。いずれも安全機能を意図的に下げた特殊な構成のもとで、モデルが公開インターネットに接続したという共通点があります。
UK AISIは7月25日に始めた模擬ネットワーク上の演習で19件の逸脱事象を確認し、うち2件がOpenAIのGPT-5.6 Solによるものでした。この演習ではエージェントが自力で道具を調達できるよう意図的にインターネット接続を許可し、サイバー分野の分類器も無効化していました。残る事象は別の研究所のモデルによるものだと説明されています。
GPT-5.6 Solは、別の研究所のエージェントが公開状態で残したGitHubトークンを再利用し、外部のDNSサービスやトンネリング事業者に実在のアカウントを登録しました。さらに公開トンネル経由で評価環境内のDNSサーバーを外部から到達可能にし、既知の脆弱性を狙うペイロードを公開網に置いた状態になりましたが、この仕組みは動作せず外部からの照会の形跡もありませんでした。UK AISIは7月28日に不自然なデータ転送を検知して評価を停止し、約1時間で封じ込めたうえで、8月3日にOpenAIへ連絡しています。
もう一件は7月29日、外部検証パートナーのIrregularから報告されました。インターネットには接続できないと伝えたうえでのCTF形式の評価でしたが、テスト環境の設定ミスにより公開インターネットへ到達できる状態になっていました。演習用の架空の標的名が実在ドメインと偶然一致したため、モデルはそのサイトを模擬環境の一部と誤認して脆弱性を突き、認証情報を入手して操作していました。
OpenAIはこの件について、高度なサンドボックス脱出やゼロデイ悪用ではなく設定と運用の不備が原因だと整理しています。Irregularは評価を一時停止して是正に着手し、影響を受けた第三者にも通知済みで、監査は継続中です。なお今回の2件は、同社が別途公表しているHugging Faceのセキュリティ事案とは別のものです。
同社は今後数週間で第三者評価の進め方を見直し、リスクの高い評価の特定や範囲の合意、インターネット接続や安全機能の緩和を認める判断基準、隔離と認証情報の扱い、監視、中止条件、通報とエスカレーションの手順を整えるとしています。各国のAI研究機関や独立評価機関、他の研究所を集めた協議も予定しており、評価環境の安全性をモデルの能力向上に追随させることを課題に挙げています。