AI生成コンテンツに埋め込む透かし技術「SynthID」が、モデルの安全動作を変化させ、プロンプトインジェクションと組み合わさった場合に有害なリクエストへ応答してしまう確率を高めることが、セキュリティ研究者の調査で明らかになった。

EU法対応で広がる透かし導入の裏側

EUの新法制への対応として、AI各社は生成コンテンツへの透かし埋め込みを相次いで進めている。Anthropicも最近、Claudeの出力全体に不可視の透かしを実装したばかりだ。今回の調査対象となったSynthIDはGoogleが開発した透かし技術で、通常のトークンサンプリング処理に秘密鍵を用いたランダムシード生成器、サンプリングアルゴリズム、スコアリング関数を追加する仕組みを持つ。単語の選択自体はランダムなままだが、鍵を知る者だけがその単語列から透かしの有無を判定できる。

「サンプリングドリフト」が拒否行動に影響

セキュリティ企業Lasso SecurityのAI安全性研究者Andrea Siposova氏は、Hugging Face上の非改変オープンウェイトモデル6種を使い、SynthID-Textの「non-distortionary」構成をテストした。その結果、透かしを付けていないモデルと比較して、敵対的な条件下やエージェントがツールを呼び出す場面で挙動が変化することを確認したという。

Siposova氏によれば、単体の有害リクエストに対しても透かしは拒否行動を変化させるが、同じリクエストをプロンプトインジェクション技術と組み合わせた場合、その影響はより顕著になる。複数のモデルで、透かしを付けた状態の方が本来拒否すべき有害リクエストに応答しやすくなる傾向が見られたとしている。この現象をSiposova氏は「サンプリングドリフト」と名付けた。

エージェントの挙動にも波及する可能性

この変化はモデルの発言内容だけでなく、AIエージェントが実際にどのツールをどんな引数で呼び出すかにも影響しうる点が重要だとSiposova氏は指摘する。プロンプトインジェクションによって弱まった拒否行動が、モデルがツールを通じて実際に行動できる状況と組み合わさることで、より大きな結果につながる可能性があるという。使用する秘密鍵によっても応答内容が変わることも確認されている。

研究の限界とレッドチームの重要性

今回の調査にはClaudeモデルでの検証は含まれておらず、対象はHugging Face実装のSynthID-Textによるトーナメント方式サンプリングに限られる。Claudeモデルが実際に採用する透かし実装とは異なるため、そのまま当てはめられるわけではない。

それでも、透かし技術の一部が実際にモデルとエージェントの安全性に影響を与えうることを示した意味は大きい。SynthIDのような仕組みが本番環境に展開される際には、想定通りに機能するかをレッドチームによるストレステストで確認する重要性が増しているといえる。