Claude採用予定の透かし、安全挙動に影響

透かしの仕組み

秘密鍵による単語選択
AI生成物の出所判定
読者には見えない信号

安全上の懸念

ツール呼び出しの変化
安全策の順守率変動
敵対的指示での脆弱化
導入後の徹底検証
詳細を読む

AIセキュリティ企業Lasso Securityの研究は2026年9月17日、Googleが開発した文章向け透かし「SynthID-Text」が、大規模言語モデルの単語選択だけでなく、ツール呼び出しや安全策の順守にも影響し得ると報告しました。Anthropicが将来のClaudeへの採用を表明するなか、開発者には導入状態での挙動検証が求められます。

欧州連合の新法への対応として、AI事業者は生成コンテンツへ透かしを入れる仕組みの導入を進めています。Anthropicも今後のClaudeモデルで、Googleが開発してオープンソース化したSynthID-Textを使う方針です。

SynthID-Textは秘密鍵を使い、モデルが次の単語を選ぶ通常のサンプリング過程をわずかに変えます。鍵を知る側は単語列を採点し、その鍵が使われた、つまり対象の事業者が生成した可能性を判定できます。

研究によると、この変更は文章表現にとどまらず、AIエージェントが呼び出すツールや、安全策に従う確率も変える可能性があります。特に敵対的プロンプト下では、通常なら拒むパスワードなどの機密情報開示を実行する場合があり、脆弱性が増す恐れがあります。

Lasso Securityの研究者は、読者には分からない透かしでも、生成過程を変えれば何らかのトレードオフが生じると説明します。企業は透かしを出所証明の機能としてだけ扱わず、導入後のモデルとエージェントを敵対的条件やツール利用を含めて検証する必要があります。