AI・機械学習
AIテキストウォーターマーキングの仕組み
How AI text watermarking works (declaude.org)
要約
この記事は、AIによって生成されたテキストに隠された目に見えないウォーターマークの仕組みを、統計的なアプローチを用いて視覚的に解説しています。ウォーターマークはテキストの文字自体ではなく、単語選択の確率的な偏りとして埋め込まれ、特定のキーを持つ者だけがそれを検出し、カウントすることができます。編集によってマークは弱まりますが、完全な書き換えでない限り、ある程度の痕跡は残ります。検出はプライベートかつ確率的であり、 authorship ではなく処理に焦点を当てています。
全文翻訳
← declaude AIテキストウォーターマーキングの仕組み
統計的なマークが生成されたテキストの中にどのように隠され、何がそれを消去するのかを、穏やかで視覚的なウォークスルーで解説します。NOPEのチームによる、declaudeの補足として。
プレーンテキストのウォーターマークは不可能に思えます。テキストにはデータを隠すピクセルがなく、メタデータはコピー&ペーストで生き残りません。すべての文字は目の前にあります。マークはどこに隠れることができるのでしょうか?それなのに、マークは実在します。
Googleは2024年からGeminiアプリとウェブ体験から生成されたテキストにウォーターマークを付けており(執筆時点ではAPIは文書化された例外です)、2026年8月からは新しいClaudeモデルがモデルレベルでテキストにマークを付け、それ以前のモデルも追随しています。これらは目に見えず、コピーしても消えず、文字自体には存在しないため機能します。それらは文字の間の選択肢の中に存在します。
5つの短いステップ、それぞれに触れるものがあります。数えるより難しいものはありません。
1. 書くことは小さな選択の連続である
このステップの唯一のアイデア:モデルは、どれも問題ない複数の単語の間で重み付けされたサイコロを振って書きます。モデルが文の途中にいるとき、「次の単語」を知りません。オートコンプリートのような、好みがリストアップされた短いリストを持っています。
これは、文の終わりから1単語の、実際の瞬間の例です。
書かれている文
研究の結果は非常に興味深いものでした
🎲 サイコロを振る 🎲 ×20
各ロールは短いリストをスイープし、1つの単語に着地します(バーの確率に対応)。ドットはロールの着地点を記録します:×20を試して、山が確率の形を形成するのを見てください。
変わらないことに注意してください:各着地点は完璧な文を作ります。
1ページのテキストには、このような小さな分岐が数百個あり、単語ごとに1つずつあり、その多くで複数の選択肢が等しく適切です。その余裕が原材料です。
サイコロの出目にどのように影響を与えることができるかを知っている人は、テキストの意味を変えずにパターンを隠すことができます。
2. 秘密の鍵がそれらの選択肢に影響を与える
このステップの唯一のアイデア:鍵は秘密裏に短いリストを着色し、1つの色に穏やかな影響を与えます。テキストは通常通り読み取れます。
これは古典的なレシピです(Kirchenbauer 2023; GoogleのSynthIDは、より微妙なトーナメント形式のルートで同じ結果に達します)。各分岐点で、秘密の鍵付き数学は候補単語を緑と赤に分割します。これは鍵の所有者だけが再現できる任意の色付けです。次に、サイコロは緑の方に少し傾けられます。
書かれている文
研究の結果は非常に興味深いものでした
秘密の鍵を適用する 🎲 サイコロを振る 🎲 ×20
鍵なし:これらはモデル自身の好みです。鍵がかかっていると、破線の輪郭が古い確率を示します。
この仕掛けを巧妙にしているのは2つの点です。影響は穏やかです:赤い単語が勝つこともありますが、単に可能性が少し低くなるだけです。そして、色付けは単語の固定された特性ではありません:鍵は、その直前の単語の短いシーケンスからそれを計算します。そのため、同じ候補でも、あるプレフィックスの後では緑、別のプレフィックスの後では赤になります。
6つの異なるプレフィックスの後、鍵によって色付けされた同じ4つの候補単語。
鍵は直前の単語を見ます;カレンダー上の位置はそれに不可視です。全体的な緑への傾きだけが蓄積され、鍵の所有者だけがどこでどの単語が緑だったかを知っています。(2つの兄弟、同じ原理。GoogleのSynthID(現在稼働中のもの)は、影響を小さな秘密のトーナメントに置き換えます:モデル自身の確率からいくつかの候補が描かれ、鍵がそれらをスコアリングし、ブラケットが配置されるため、鍵の描画全体で平均すると、各単語の確率はモデルが意図したとおりになります。OpenAIで構築されたAaronsonのスキームは、それさえもスキップし、サイコロのロール自体を鍵から導き出します。異なる数学、同じ原理:マークは選択肢の中に存在します。)
3. 鍵を持つ者は数えることができる
このステップの唯一のアイデア:鍵があれば、任意のテキストを再色付けして単純に数えることができます。マークされたテキストは、運にしては緑になりすぎます。検出はテキストを読んだり、スタイルを判断したりしません。検出器は鍵の所有者の色付けを単語に再生し、どれだけ緑になったかを数えます。
マークがない場合(または正しい鍵がない場合)、緑は約半分の確率で勝つはずです。コインフリップです。
これは普通の段落です。両方の鍵を試してみてください。
正しい鍵で数える
間違った鍵で数える
📖 読み続ける:同じマーク、×4
緑のテキスト:55個中 –
塗りつぶされたチップは緑、破線の輪郭は赤です。単語はどちらの場合も同じように読めます。色付けは鍵の所有者の数学の中にのみ存在します。
間違った鍵では、分割は無意味であり、カウントは偶然のレベルにとどまります。
バーがどれほど要求が厳しいかに注意してください。この段落は明らかに傾いていますが、まだフラグを立てるには短すぎます。検出器は、誤検出が非常にまれになるように調整されています。その代償として、短いテキスト、編集されたテキスト、または弱くマークされたテキストはしばしば見逃され、55単語の穏やかな傾きでは証拠としては不十分です。
読み続けるを押してください:傾きはまったく同じままですが、バーは増え続ける証拠に合うように下がります。長さはテストの一部です。(そして、このデモの傾きは強く描かれているため、あなたが見ることができます。プロダクションマークははるかに穏やかに傾いており、それに応じてより多くのテキストが必要です。このデモの50/50モデルでは、1,500単語の文書は約55%の緑でフラグが立てられるでしょう:わずかな傾きは長さによってのみ説得力を持つため、短いテキストは誰にとっても本当に呼び出すのが難しいのです。)
4. 編集がマークに与える影響
このステップの唯一のアイデア:マークは、手が加えられていない単語のシーケンスの中に存在します。編集は、シーケンスが壊れた場所で正確にマークを消去し、それ以外の場所では消去しません。
各単語の色付けは、その直前の単語の短いシーケンス(スキームによりますが、1つから数個)から導き出されます。したがって、位置は、元の単語(単語とその隣接語)の短いウィンドウがそのまま残っている場合にのみ証拠としてカウントされます。
これはステップ3の同じ段落で、5つの編集深度でのものです。スライダーをドラッグして、ハイライトされたシーケンスが縮小するのを見てください。ハイライトは、その単語シーケンスが元の単語と完全に一致していることを意味するため、検出器はそこで数えることができます。すべてがフェードアウトしたのは新しい単語であり、そこにはコインフリップのノイズしか数えるものが残っていません。
タイポ修正
軽いタッチ
タイトな文章
重い編集
完全な書き換え
・残存ウィンドウ: –%
結果は、上記のハイライトから測定された残存フラクションを、1,500単語の文書に投影したものです。
注目すべき点は2つあります: 「重い編集」がどれだけ残っているか、そして完全な書き換えまでどれだけドラッグしなければ証拠が実際に消えるかです。
実際のインプリメンテーション(オープンモデルでのMarkLLMのKGWおよびEXPスキーム、declaudeの完全書き換えルートによる洗浄)では、ウィンドウの約0.5%が残存し、検出精度はほぼ確実からコインフリップに低下します。公開されている文献もこの形状に同意しています。
軽い、または1パスの言い換えは、マークを削除するのではなく希釈します。Kirchenbauerらの実験では、十分なテキストがあれば検出は回復し、人間の言い換えでさえ約800トークン(約600単語)後に再び検出可能になりました。
マークを削除するのは、元の単語シーケンスを共有しない再構成です。だからこそ、意味から書き換えるツール(declaudeの完全書き換えルートのようなもの)が、この種のマークを実際に消去するものであり、フレーズのほとんどを保持する軽いパスがそうでない理由です。
明確に述べられた1つの境界:それらの数字は、測定可能なオープンインプリメンテーションから来ています。Anthropicのプロダクションスキームは開示されていないため、Anthropicの外部の誰も現時点ではClaude自身のマークに対してこのテストを実行できません。私たちの実験が支持するのは、このページが説明するスキームのファミリーのメカニズムです。
5. 実践における意味
このステップの唯一のアイデア:検出はプライベートであり、確率的であり、処理に関するものであり、 authorship に関するものではありません。
鍵の所有者だけがチェックできます。あなたの教師、編集者、またはお気に入りの「AI検出器」ウェブサイトは、このテストを実行できません。認証されたチェックには、プロバイダーの秘密鍵、またはプロバイダーが実行するチェックサービスが必要です。
GoogleはSynthIDの早期アクセス検出器ポータルを実行しています。Anthropicは...