HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Claudeのテキスト透かし(ウォーターマーク)の仕組み

How Claude's text watermarking works (anthropic.com)

33 pointsby surprisetalk34 コメント

要約

Anthropicは、EU AI法への準拠のため、Claudeモデルが生成するテキストに透かし(ウォーターマーク)を埋め込むことを発表しました。この技術は、単語選択のランダム性に微細なパターンを適用することで、読者には感知できないものの、特定のキーを持つことでClaudeによる生成の可能性を検出できるようにします。この透かしは出力の品質や内容に影響を与えず、個人に追跡されることもありません。

全文翻訳

発表 Claudeのテキスト透かしの仕組み 2026年8月14日 将来のClaudeモデルは、透かしを含むテキストを生成するようになります。これはClaudeがテキストの作成に関与した可能性を判断する方法であり、EU AI法への準拠のため、当社および他の主要なAIプロバイダー数社がこの変更を実装しています。 この記事では、私たちが選択した透かし方法がどのように機能するか、Claudeの出力に影響を与えるか、そしてなぜこの変更を行うのかについて、受け取った質問への回答を共有します。要約すると以下のようになります。 * 私たちは、Claudeの出力の品質や内容に実質的な影響を与えない透かし方法を使用しています。 * 透かしのあるテキストとないテキストの違いは、読者には区別できません。 * テキストに追加されるものはありませんし、隠された文字もありません。 * 透かしには追加のトークンは必要なく、より高価になることもありません。 * 透かしには識別情報は含まれておらず、特定の個人、組織、またはチャットに追跡されることはありません。 * 透かしはClaude固有のものではありません。8月2日現在、EUは市場にサービスを提供するAIプロバイダーに対し、AI生成コンテンツにマークを付けることを義務付けています。他の主要なモデル開発者も同じ行動規範に署名しており、独自の透かしを実装する予定です。 透かしとは何ですか? Claudeのような大規模言語モデルは、一度に一つの単語を生成することで機能します。モデルが次の単語を決定するたびに、候補リストの中から選択し、最終的に先行するテキストに基づいて最も妥当または可能性の高いものを選びます。「今日の天気は寒くて…」という文を例にとると、次の単語が「甘い」である可能性は非常に低いですが、「曇り」や「どんより」である可能性はかなり高いです。ほとんどの場合、モデルがこれらの後者の2つの単語のどちらを選択しても、読者にとって大きな違いはありません。文の意味はどちらにしてもほぼ同じです。このような場合、選択は乱数によって決定されます。 透かしは、生成されたテキストの多くの箇所で発生する、このような低リスクの選択を利用して、Claudeの応答にパターンを残します。そのパターンは読者には検知できませんが、それをエンコードするキーを持っている人には検知可能です。透かしが使用される場合、選択は依然としてランダムに行われますが、ランダム性の源が異なります。次の単語を選択するために任意の乱数ジェネレーターを使用する代わりに、透かしはキーと先行するいくつかの単語を使用して、モデルが選択すべき単語を決定します。つまり、Claudeが選択する単語は依然としてランダムですが、 now、単語のシーケンスをチェックして、キーを使用してClaudeが行うであろう選択と一致しているかどうかを確認できます。一致している場合、そのテキストがClaudeによって生成された確率を割り当てることができます。 重要なのは、モデルが常に曇りやどんよりに向かうようになるわけではないということです。透かしのないテキストと同様に、先行する単語に応じて、ある文では曇りが選択され、次の文ではどんよりが選択される可能性があります。また、透かし方法がClaudeに通常では考慮しない単語(例えば、「nubilous」のような、曇りやどんよりの難解な同義語で、Claudeが通常の状況ではまず使用しないであろう単語)を選択させるわけでもありません。 透かしはClaudeの出力にどのように影響しますか? 透かしはClaudeの出力の品質に影響を与えません。読者にとって、透かしのある応答は透かしのないものと区別がつきません(この点で、AIの透かしは紙幣、その他の物理的なオブジェクト、および一部のデジタルドキュメントの透かしとは大きく異なります。それらは肉眼で見えます)。 内部テストでは、透かしがClaudeのテキストのコンテンツ、創造性、または可読性に影響を与えていないことを確認しました。SynthID-Text論文では、私たちが使用する技術を紹介しており、Google DeepMindはモデルの一部に透かしを使用したGeminiトラフィックを提供し、サムズアップとサムズダウンの評価を比較することでこの影響をテストしました。彼らは、透かしのないモデルと比較して統計的に有意な差がないことを見出しました。また、管理された研究では、透かしのある回答と透かしのない回答を並べて比較した人間の評価者は、品質の違いを見ませんでした。 有用なアナロジーとして、モノポリーのようなゲームをプレイしていると想像してください。各ターン、各プレイヤーはサイコロを振ってボード上のランダムな数のマスを進みます。ランダム性を得るためにサイコロを振る代わりに、円周率の数字のブックを使用することにしたとします。私たちはランダムに選ばれた数字(例えば、小数点以下1,012,845桁目の数字、これは6です)から開始し、そこから各プレイヤーはシーケンスの次の数字を次の「ロール」として使用します。 あらゆる目的において、動きは依然としてランダムです。プレイヤーにとっても、ゲームの結果にとっても、ランダム性が毎回パイから来るのか、サイコロの目から来るのかは関係ありません。しかし、ゲームの後にすべての動きのシーケンスを見ることができ(そして円周率の値を知っていれば)、これがパイを使用して動きを決定したゲームであったかどうかを判断できます。パイを使用したゲームは、ある意味で「透かし」が施されています。 Claude生成テキストも同様です。透かしは、それを読んでいる人の意味や体験を変えるものではありませんが、後でそのテキストがClaudeによって生成された可能性が高いかどうかを確認したい場合、透かしによってそれが可能になります。 具体的にどのような透かし方法を使用していますか? Claudeのテキスト透かしは、2024年にNature誌に掲載されたGoogle DeepMindのSynthID-Textアプローチのバージョンです。これは、2022年のScott Aaronsonの提案に遡る一連のアプローチに属しており、すべて同じ設計原則を共有しています。それは、透かしは単語の選択に使用されるランダム性の源を変えるだけであるというものです。透かしには有効性の限界があります。私たちのキーを使用すると、「これはClaudeによって部分的に書かれた可能性はどのくらいか?」という質問にしか答えられません。テキストが人間によって書かれたかどうかを確認するものではなく、別のAIによって書かれたかどうか(たとえその別のAIが透かしを使用していたとしても、キーが異なるでしょうし、透かし方法自体も異なる可能性があります)を判断することもできません。また、透かしの検出は、単語の選択肢が少なく、情報量が少ない短いサンプルではうまく機能しません。文章が長くなるにつれて、Claudeの関与に関する信頼度も高まります。 透かしは、テキストの精度を低下させることなく行える選択肢が少ない事実に基づいた文章では、より疎になります。例えば、「アイザック・ニュートンの最も有名な作品はプリンキピアと呼ばれていました…」という文を考えてみましょう。次の単語が「Mathematica」であることは非常に重要です(それが唯一の正しい答えです)、したがって透かしは何も作用できません。校正の場合も同様です。Claudeに文章を渡し、文法と句読点のみを編集するように依頼した場合、透かしは修正の数少ない箇所にしか存在できず、登録するには少なすぎる可能性があります。透かしは、Claudeが書く量が多いほど、より多くの決定を下し、透かしのためのスペースが増えます。 Claudeが人間のテキストを校正または編集した場合はどうなりますか? 透かしはClaudeが選択した単語にのみ適用されます。Claudeが人間の書いたテキストを校正する場合、返されるものは一般的に軽微な編集のみです。単語のほとんどがその人のものであるため、透かしが付着する余地はほとんど(あるいは全く)ありません。テキストの長さとClaudeによる編集の度合いによっては、Claudeの関与が検出可能になるほど十分ではない場合があります。Claudeが書く量が多いほど、より多くの決定を下し、透かしのためのスペースが増えます。 コードについてはどうですか? 上記で述べたように、AIの透かしは、どちらの単語を選択しても同等に良いという決定を利用します。正確な出力が必要な場合、つまり選択肢がなく、事実として間違っているか、異なる用語が選択されるとコードが壊れるような場合には、透かしは適用されません。 例えば、モデルが「2 + 2 =」と書いた後、次の単語の非常に明確な最良の選択肢があります。