AI・機械学習
AnthropicのClaudeにおける「透かし」テキスト改変は執筆の冒涜である
Anthropic's 'Watermark' Text Adulteration in Claude Is a Perversion of Writing (daringfireball.net)
要約
この記事は、AnthropicがEU規制遵守のためにClaudeモデルに導入したテキストの「透かし」機能について批判しています。著者は、この機能が単語の選択に影響を与え、テキストの品質や意味を損なう可能性があることを問題視しており、AI生成コンテンツの信頼性と執筆の本来の目的に反すると主張しています。
全文翻訳
John Gruber Archive The Talk Show Dithering Projects Contact Colophon Feeds / Social Sponsorship Manage GRC Faster with Drata’s Agentic Trust Management Platform Anthropic’s ‘Watermark’ Text Adulteration in Claude Is a Perversion of Writing Sunday, 16 August 2026
この週、AnthropicがEU規制に準拠するため、すべてのClaudeモデルが生成するテキストに「透かし」を挿入し始めると発表したことについて書いたとき、それがどのように機能するかについては推測の域を出ませんでした。なぜなら、Anthropicはその発表のタイトルが、不条理かつ侮辱的にも「ClaudeはAI生成コンテンツをどのようにマークするか」であったにもかかわらず、その機能がどのように働くかについて、かすかな説明さえ提供しなかったからです。私の最初の推測は、非表示の印字されないUnicode文字をテキストに隠すのではないかということでした。単なる思いつきです。それが彼らがやろうとしていることではないことが判明しました。彼らがやろうとしているのは、ステガノグラフィーの一種を適用することです。推論時に単語(または他のトークン出力)の選択が、後で、おそらく確率的に検出できる指紋を残すのです。私が最初に「非表示の文字」と推測したのは、意味論的な単語選択のテクニックを考えなかったからではなく、Anthropicの説明を額面通りに受け取った愚か者だったからです。彼らの元のサポートドキュメントには次のように主張されています。「サポートされているClaudeモデルがテキストを生成すると、知覚できない透かしをテキスト自体に直接織り込みます。あなたはそれを見ることができず、Claudeの応答の意味、品質、または読みやすさを変えることはありません。」彼らは「知覚できない」と「意味、品質、または読みやすさを変えない」と言っています。彼らの言葉です。ほとんど知覚できないわけでもありません。意味、品質、読みやすさをわずかに変えるわけでもありません。それは私にとって理にかなっていました。なぜなら、私が個人的に使用するいかなるツールにも、それを望む、いや要求するからです。ツールが、その出所を示唆するために隠された手がかりを埋め込む目的で、明瞭さ、一貫性、意味、品質などのわずかでも犠牲にすることは許容できません。それが私が要求するものであり、要求し続けるものです。そしてAnthropicの(元の)サポートドキュメントは、彼らのシステムがそれを可能にすると曖昧さなく主張しています。もしそれが真実であれば、テキスト内に非表示の文字を隠す以外に何が残るのか分かりませんでした。私の間違いは、彼らのモデルが生成するテキストの意味論を改変・破壊しないという彼らのシステムの主張を信じたことです。実際、それが彼らが計画していることです。AI生成コンテンツをマークする方法を全く説明しないドキュメントのタイトルを額面通りに受け取ったことを、私は検査されるべきです。
実際にはどのように機能するか
昨日、(全く説明がなかった元の「ClaudeはAI生成コンテンツをどのようにマークするか」という記事とは別の)全く異なるウェブサイトで、Anthropicは「Claudeのテキスト透かしはどのように機能するか」を発表しました。これは、それがどのように機能するかを一般の人にも理解できる言葉で説明しています。私は後でAnthropicの新しい、非常に婉曲的でわずかに誤解を招く説明に戻ります。このトピックに関する研究はたくさんあり、そのいくつかは以下にリンクしています。しかし、このテクニックの背後にある考え方の一般的なアイデアについての最高の記述は、James Padolseyによるインタラクティブエッセイ「How AI Text Watermarking Works」です。それは素晴らしいほど的確な読み物であり、インタラクティブな要素は主要な概念を華麗に説明しています。興味があるなら、Padolseyの記事を読むことを強くお勧めします。しかし、ここでは、一般向けのハイレベルな要約を試みます。コインをN回投げて結果を記録すると、コインが公平か偏っているかをある程度の確実性で判断できます。LLMは、その一般的な形態では非決定的です。同じモデルに同じ質問をしても、しばしば少なくともわずかに異なる答えが得られます。意味は同じかもしれませんが、表現が異なります。次のトークンを生成する各決定ポイントで、モデルは選択を行います。これらの意味論的な透かし技術では、単語リスト(「グリーン」と「レッド」と呼べるもの)に基づいて、一部のトークンで異なる選択を行います。各決定ポイントで、レッドリストの単語よりもグリーンリストの単語を選択する可能性がわずかに高くなります。それは、レッドリストの単語を決して選択しないという意味ではありません。単に、改変されたマーキング技術がなければ選択するよりも可能性が低いということです。(歪んだ51-49のコインでも、平均して100回中49回は「間違った」面で着地するのと同じです。)単語や単語のフレーズは、各「次のトークン」生成ポイントで、その場で決定論的にグリーンとレッドのリストにソートされます。したがって、特定の単語がグリーンリストにあることもあれば、レッドリストにあることもあります。秘密鍵を持つ人は、各トークン生成ポイントで単語がどちらのリストにあるかを判断できます(これが透かしが検出される方法です)。秘密鍵を持たない人はできません。これは、Claudeが好む、または避ける単語のリストが決して存在しないことを意味します。コイン投げでは、Nが高いほど、つまりコインを投げる回数が多いほど、コインが公平か偏っているかについてより確信を持つことができます。意味論的な透かしも同様です。テキスト内の単語が多いほど、そのテキストが特定のAIモデルによって生成されたかどうかを分析する精度が高くなります。コイン投げの回数が少なすぎると、コインの公平性に関して全く確信を得られません。単語(またはトークン)が少なすぎると、テキストの文字列がAIによって生成されたかどうかを判断する確信を得る方法はありません。特定の透かしシステムの兆候を調べるためにテキスト文字列が与えられた場合、予期されるよりも多くの単語がグリーンとしてタグ付けされ、レッドとしてタグ付けされた単語が少ない場合、そのテキストは、特定の秘密鍵透かしシステムを適用するAIシステムによって生成された、または単に変更されたと、ある程度の確信を持ってフラグを立てることができます。決定の確信度は、テキスト文字列のサイズと、グリーンおよびレッドリストの単語に与えられたランダムな重みに大きく依存します。しかし、テキストがClaudeによって生成されたように見えるかどうかを判断できるのはAnthropicだけであり、AnthropicはClaudeによって適用された透かしのみを検出できます。Claudeは、例えばGeminiによって生成された隠し透かし信号を検出できませんし、GeminiもClaudeによって作成された隠し透かし信号を検出できません。なぜなら、各実装はLLMプロバイダーのみが持つ秘密鍵に基づいているからです。
技術的前提への異議
私の根本的な問題の一つは、2つの同義語でさえ全く同じ意味を持たないことです。「彼はそのチャンスに飛びついた」と「彼はその機会に飛びついた」は、同じ一般的な感情を表現する非常に似た文ですが、同じではありません。私たちが執筆時に選ぶ正確な単語は重要です。私が使用するLLMには、すべての決定ポイントで最も正確で最適な単語を選択してほしいのです。明らかな制約は時間と計算です。推論を迅速に実行するという制約の中で、トークンあたりの一定のコストで、私は最良の単語を望みます。この制約は人間の執筆に似ています。より長い時間をかけて執筆すれば、より良いコラムを書くことができるでしょう。私は、すべての単語と句読点の選択にどれだけの注意を払うべきかという感覚を持って執筆します。自分の直感がそう言うとき、特定の段落、文、あるいは個々の単語の選択により多くの時間を費やします。つまり、これらは必要なトレードオフなのです。これらの要因はすべて私の利益になります:スピード、コスト、品質。理想的には、瞬時の生成速度で、ゼロコストで完璧な執筆を望みます。それらのどれも不可能ではありません。計算は無料ではありません(そして、主要なモデルでのクラウドベースのLLM推論は実際には高価です)。推論は瞬時ではありません。そして、自然な執筆であれ人工的な執筆であれ、偉大な執筆は完璧に近づくことしかできません。私のニーズ以外の何かが、私のためにテキストを生成することに影響を与えるという考えは、明らかに不快です。これは単にテキストの問題ではありません。