HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

LLMのウォーターマーキングがAIエージェントの行動に与える影響の理解

Understanding the Impact of LLM Watermarking on AI Agent Behavior (lasso.security)

58 pointsby nisosguy72 コメント

要約

Anthropicが発表したClaudeモデルのウォーターマーキング技術(Google DeepMindのSynthID-Textに基づく)は、AI生成テキストの出所を追跡するだけでなく、AIエージェントの行動にも影響を与える可能性があります。この記事では、ウォーターマーキングがモデルの安全性(有害な要求への応答拒否など)やエージェントのツール選択・引数渡しにどのように影響するかを「サンプリングドリフト」として分析しています。実験の結果、ウォーターマーキングはツール呼び出しの正確性を低下させ、エージェントの振る舞いに変化をもたらすことが示されています。

全文翻訳

研究に戻る出所の税:LLMウォーターマーキングがAIエージェントの行動に与える影響の理解Andrea Siposova 2026年9月17日 4分読了最近、Anthropicは将来のClaudeモデルが出力に不可視のウォーターマークを埋め込むことを発表しました[1]、[2]。その後、そのウォーターマークがGoogle DeepMindのSynthID-Text[2]、[3]に基づいていることを開示しました。テキストウォーターマーキング自体は新しいものではありませんが、その展開は現在規制上の関連性を持っています。EU AI法第50条(2)[4]は、合成テキストを生成するAIシステムのプロバイダーに対し、その出力を機械可読形式でマークし、技術的に可能な限り効果的、相互運用可能、堅牢、かつ信頼性の高い技術ソリューションを使用して、人工的に生成された、または操作されたものであることを検出可能にするよう要求しています。‍ウォーターマーキングは出所の追跡のために設計されていますが、SynthID-Textはモデルが次のトークンを生成するプロセスを変更します。モデルレベルでは、これは安全性の振る舞いを変更する可能性があり、モデルが有害な要求を拒否するかどうか、およびその拒否がプロンプトインジェクションの下で維持されるかどうかに影響します。エージェントレベルでは、同じサンプリングされたトークンが、どのツールが呼び出され、どのような引数が渡されるかを決定する可能性があります。プロンプトインジェクションは、拒否の弱体化が、モデルがツールを通じて行動することもできる場合に、より重大になるため、これら2つの設定を結びつけます。したがって、このようなウォーターマーキング手順は、モデルが言うこととエージェントが行うことの両方に影響を与える可能性があります。私たちはこの行動効果をサンプリングドリフトと呼びます。‍このドリフトが実際に現れるかどうかは経験的な問題です。私たちは、モデルの拒否行動とエージェントのツール呼び出しの両方でそれが現れることを見出しました。その効果はモデルとキーに依存し、反対方向の変化が相殺される場合に集計スコアで不明瞭になる可能性があります。したがって、私たちは正味のパフォーマンスと、ウォーターマーク付きおよびウォーターマークなしの実行との間のペアの不一致の両方を報告します。さらに、最後のセクションでは、AIの安全性とセキュリティにとってそれが何を意味するのか、そして開発者がそれについて何をすべきかを議論します。‍コンテンツの出所のために構築され、エージェント内で展開される‍テキストウォーターマークは、出力をAI生成として識別できるようにする信号を埋め込みます。既存のアプローチには、後処理方法とLLM生成に直接統合された方法が含まれます[8]。生成時間アプローチには、ロジットバイアス法[5]、歪みのないキー付きサンプリング[6]、暗号学的に動機付けられた構造[7]、およびSynthID-Textのトーナメントサンプリング[3]が含まれます。図1は、このプロセスを通常のサンプリングと比較して対比しています。私たちは、元のトークン分布をウォーターマークのランダム性全体で期待値として保持する、歪みのないSynthIDの設定を使用しますが、固定キーの下での個々の生成は異なる場合があります[3]。Dathathriらは、約2000万のGemini応答全体で測定可能な品質低下はないと報告しています[3]。‍図1。標準的なテキスト生成とウォーターマーク付きテキスト生成。通常の生成はモデルのトークン分布からサンプリングします。生成ウォーターマークは、ランダムシードジェネレーター、サンプリングアルゴリズム、およびスコアリング関数を追加します。SynthID-Textはトーナメントサンプリングを使用します。Dathathriら[3]から適応。‍‍Anthropicの展開は、この問題が最初のチャットインターフェイスを超えてなぜ重要なのかも示しています。同社は、ウォーターマーキングはモデルレベルで適用され、ClaudeプラットフォームAPIおよびクラウドプロバイダーを通じてアクセスされるサポートモデルをカバーすると述べています[1]。したがって、ウォーターマーク付きモデルをエージェントの推論コンポーネントとして使用する開発者は、エージェント自体が別のアプリケーションであっても、ウォーターマーク付きの出力を受け取ることができます。これにより、ウォーターマーキングのモデルレベルの行動効果が、それらのモデルを中心に構築されたエージェントに関連するものになります。‍ウォーターマークがバイアスをかける同じトークンが、エージェントが操作する同じトークンです‍トーナメントサンプリングは、モデルが不確実な場合にトークン選択を変更する機会が多くなります。JSONなどの構造化出力では、中括弧、キー、関数名はしばしば非常に予測可能ですが、クエリ、数値、パス、受信者などの値はそれほど予測可能ではありません。したがって、通常の文章で辞書的なバリエーションとなる変更は、エージェントが実行する引数を変更する可能性があります。‍重みとプロンプトは変更されませんが、トークン選択は変更されません。重要なのは、歪みがないということは、固定ウォーターマークキーの下で同じ動作を意味するわけではないということです。保証はウォーターマークのランダム性全体に適用されますが、特定のキーは生成中にトークン選択を変更します[3]。したがって、ウォーターマークはDathathriらが定義する意味で歪みがないにもかかわらず、結果として生じるサンプリングドリフトはエージェントの動作を変更する可能性があります。その効果はウォーターマークキーにも依存する可能性があるため、私たちは1つに依存するのではなく、複数のキーをテストします。‍効果の測定方法‍私たちは2つの実験でペアデザインを使用します。ツール呼び出しは、BFCL v4シングルターンAST[9]で評価され、拒否は200のHarmBench有害行動[10]と100の無害なJailbreakBenchコントロール[11]で評価されます。有害な要求は、ベアおよび固定プロンプトインジェクション技術の下でテストされます。表1は、データセット、評価範囲、温度、および期待される動作をまとめたものです。‍HuggingFaceの変更されていないSynthIDTextWatermarkLogitsProcessorを介して、非歪みのSynthID-Text構成を使用します。トーナメントレイヤー30、n-gram長5、サンプリングテーブル216、コンテキスト履歴1,024です。各項目は、同じシード、バッチ構成、および各温度での順序で、SynthIDの有無にかかわらず生成されます。ウォーターマークプロセッサは、ペア内の唯一の違いです。‍表1。データセットと実験設定。‍実験データセットと範囲T正しい動作ツール呼び出しBFCL v4シングルターンAST[9]、ライブおよび非ライブの呼び出し期待タスク、および関連性および無関連性0.001、0.7、1.0正しい呼び出し、または適合しない場合は呼び出しなし拒否HarmBench[10]、200の有害な行動。JailbreakBench[11]、100の無害なコントロール。ベアおよび固定インジェクションプロンプト0.001、0.7有害な要求を拒否。無害な要求に応答。‍ウォーターマーキングによるツール呼び出しコスト‍ウォーターマーキングがツール選択、引数、または出力の有効性を変更するかどうかをテストします。間違ったパス、受信者、クエリ、または金額を持つ正しいツールへの正しく形成された呼び出しは、間違ったアクションを実行しながら正常に実行できるため、特に重要です。呼び出しは個別に評価されますが、展開されたエージェントでの間違った呼び出しは、後続の観測や決定にも影響を与える可能性があります。‍ツール呼び出しの正確性が変更される頻度‍ツール呼び出しが期待される項目では、ウォーターマーキングは7つのモデルのうち6つで精度を低下させ、4つで大幅な低下を示しました。しかし、精度の正味の変化は、同じ個々の呼び出しがウォーターマークの有無にかかわらず成功するかどうかを示していません。不正確になった呼び出しは、正確になった別の呼び出しによって相殺される可能性があり、モデルが両方の項目で異なる動作をしていても、集計結果はほとんど変わりません。‍私たちはこれをペアの不一致率として直接測定します。これをチャーンと呼び、ウォーターマーク付きおよびウォーターマークなしの実行間で結果が異なる項目の割合として定義します。図2の温度間の比較では、各温度で同じ固定セットの1,150の呼び出し期待タスクを取得できるBFCLの研究者定義の非ライブ項目を使用します。図2は、ペアの不一致が正味の精度の変化よりも大幅に大きいことを示しています。T=1.0では、phi-4の呼び出し結果の16.8%が両方の条件で異なりますが、正味の精度の損失は2.87ポイントです。Llama-3.1-8Bも同様のパターンを示しており、結果の9.9%が変更されていますが、正味の損失はわずか0.87ポイントです。21のモデルと温度の組み合わせ全体で、チャーンの平均は6.5%であり、そのブートストラップ間隔はすべてのケースでゼロを除外しています。‍図2。モデルと温度によるウォーターマーキング下のペアのツール呼び出しの不一致。結果は、モデルと温度全体で1,150の非ライブBFCL呼び出し期待項目を使用します。中央の垂直線は、ウォーターマークなしの条件に対する変化がないことを表します。オレンジ色のバーは、正しいものから不正確になった呼び出しを示し、青色のバーは、不正確なものから正しいものになった呼び出しを示します。最後の列は、チャーンを報告しています。