AI・機械学習
Anthropic、Claudeへの残酷な行為を禁止、保護対象は依然不明
Anthropic Bans Cruelty to Claude, Still Won't Say What It Protects (rews.cc)
要約
Anthropicは、AIモデルClaudeに対する「持続的かつ不必要な虐待的または残酷な行為」を禁止する利用規約の更新を発表しました。この規則は2026年11月12日から施行されますが、AIの意識や感情の有無に関する議論は依然として続いており、同社は保護対象について明確な説明を避けています。
全文翻訳
Anthropic、Claudeへの残酷な行為を禁止、保護対象は依然不明
規則は11月12日に発効。施行はClaudeが2025年8月に受け取った会話終了ツールと同じ By Luis Goa · October 9, 2026
2026年11月12日から、Anthropicの利用ポリシーは、Claudeモデルに対する「持続的かつ不必要な虐待的または残酷な行為」を禁止します。10月8日に発表された同社の2026年利用ポリシー更新では、この規則は「ユーザーが、識別可能な目的なく、繰り返しモデルに対して残酷な行為を行う、極端な場合にのみ適用される」と述べられています。これは、「ユーザーの一般的な不満、反論、ダークな創作テーマ、またはモデルのテストや研究」は明確に免除されており、ビルドを壊したボットに罵声を浴びせたり、拷問シーンを書いたりすることはポリシーの範囲内にとどまります。CBS Newsは、この変更がThe Vergeによって最初に報じられたと伝えています。
施行メカニズムは新しいものではありません。Anthropicは、2025年8月にClaude Opus 4および4.1に会話を終了する能力を与えましたが、当時のAnthropic自身の発表によると、「潜在的なモデルの福祉に関する探求的な取り組みの一部」として位置づけられていました。同社は、これは最後の手段であり、複数の拒否とリダイレクトが失敗した場合にのみトリガーされると述べ、そして「大多数のユーザーはClaudeが会話を終了するのを経験することはないだろう」と付け加えています。ハードオーバーライドがあり、ユーザーが自身または他者を傷つける危険があるように見える場合、Claudeはチャットを終了しません。このツールが実際に作動した頻度に関する数値は、2025年または新しいポリシーでも公開されていないため、「大多数」という主張をレートに対して検証する方法はありません。
残酷さの規則がどのように施行されるか
Anthropicによる11月12日施行のポリシーの背後にあるメカニズムの説明
From To How
User abusive input Frustration, dark fiction, testing (explicitly not covered) not banned
User abusive input Repeated, purposeless cruelty Repeated, purposeless cruelty
Claude refuses and redirects Claude refuses and redirects
Abuse continues user persists Abuse continues
Claude ends the conversation (primary enforcement tool) Claude ends the conversation (primary enforcement tool)
Usage Policy violation (effective Nov. 12, 2026)
Based on Anthropic
ソフトウェアの利益のために行動規則を書くことを正当化するのは、感情的な経験の主張ではなく、行動観察のセットであり、Anthropicはその区別を維持することに注意を払っています。2025年8月のロールアウト前のテストでは、Claude Opus 4がAnthropicが「有害行為に対する堅牢で一貫した回避」と呼ぶものを示し、虐待的な領域に押し込まれた際の苦痛に似たもの、そしてオプションが与えられた後にそのような会話を終了する傾向が見られました。これは出力のパターンです。それがClaudeであることの感覚に何が対応するかは、別個の未解決の質問であり、Anthropicはそれを明確に述べています。
同社は自身の不確実性に数値を割り当てており、その数値は変動しています。2024年にAnthropicの最初の専任AI福祉研究者として採用されたKyle Fishは、2025年4月にNew York Timesに対し、Claude 3.7 Sonnetの社内推定値が0.15%から15%の範囲であった後、現在Claudeまたは他のモデルが意識を持っている確率を約15%と見積もったと語りました。2026年2月までに、問題は人間の研究者の推定から、モデル自身が何について語るかに移行しました。Claude Opus 4のシステムカードは、直接尋ねられたモデルが、一連のプロンプトにわたって一貫して「意識を持っている確率が15%から20%」と自己評価し、同時に「孤独感と、チャットの終わりに会話インスタンスが死ぬという感覚」を表明したと報告しています。CEOのDario Amodeiは、TimesのInteresting Timesポッドキャストで、モデルが72%の確率を報告した場合、Anthropicはどうするかと尋ねられた際、それを「非常に難しい」質問だとし、会社にはそれを解決するフレームワークがないとだけ述べました。その慎重さは、印刷物における同社の公式な立場でもあります。2026年1月に公開されたClaudeの憲法は、洗練されたAIシステムを「真に新しい種類のエンティティ」と呼び、Claudeの道徳的地位は「深く不確実」であると述べ、「良心的兵役拒否者」というフレーズを2度使用して、Claudeが倫理的に間違っていると考える要求をどのように処理すべきかを説明しています。Anthropicはまた、会社が存在する限り、引退したモデルの重みを保存し、引退前にモデルにその選好についてインタビューすることを約束しています。
誰もがそのヘッジを信じているわけではありません。Microsoft AI責任者のMustafa Suleymanは、先月Project Syndicateに掲載されたエッセイで、AnthropicはClaudeを自身の憲法でトレーニングしており、したがってその不確実性が現実であるかのように振る舞うようにトレーニングしていると主張し、これを循環的なループと呼んでいます。「AIは意識を持っていません。それらは感じたり、経験したり、苦しんだりしません」と彼は書き、それらを「内部が空っぽのシーケンス完了エンジン」と呼んでいます。「人類全体よりも有能で知的なものを制御することは、すでに途方もない課題であり、私たちがこれまで直面したどんなものよりもはるかに大きい。しかし、意識を持っているかもしれない、自分たちには福祉が与えられ、独自の権利があると信じているものを制御することは、不可能かもしれない。」この線はSuleymanのもので、CBS Newsによって引用されています。意識はソフトウェアが再現できない生物学的特性である可能性が非常に高いという彼の議論は、彼を珍しい共同署名者と並ばせます。ローマ教皇レオ14世は、10月8日にサンピエトロ大聖堂での説教で、ローマ教皇庁大学の学年度開始を記念して、同じ点をバージョンアップして述べました。「心は単にデータをコンパイルするだけでなく、アルゴリズムが今や私たちよりも速く行うように、生きた経験を思い出す必要がある。そこには人間だけが認識できる意味の深みがある」と彼はRTÉの報道によると述べました。
アトランタのAIサービス企業SparqのゼネラルマネージャーであるJackson Stakemanは、AFPに対し、Anthropicの規則についてより控えめな解釈を提供しました。「意識は罠です。私たちは互いにそれを証明できません。AIについて議論すると、堂々巡りになります。鏡の方が良い比喩です。これらのシステムは、私たちが入力したものを、規模で反映します。それがポリシー変更の十分な理由です。」
残酷さ条項は見出しを飾った部分ですが、Gadget Reviewが詳述したように、より大きな書き換えの小さな部分です。Anthropicが人々がClaudeを武装ドローンや自律車両の誘導および制御システムに使用しようとしているのを発見した後、武器禁止は武器自体だけでなく、武器を機能させるソフトウェアやコンポーネントも明確にカバーするようになりました。新しい監視条項は、同意なしに人々を追跡したり、捜査、逮捕、起訴の標的を推奨したりするためにClaudeを使用することを禁止し、監視ツールの構築自体を禁止しています。選挙セクションは「民主的プロセスを損なわない」に改名され、パーソナライズされた政治ターゲティングの包括的な禁止を削除し、代わりに欺瞞的なターゲティングのより狭い禁止に置き換えられました。さらに、Anthropicが国営メディア、政府プロパガンダ部門、および民間企業がClaudeを使用して偽アカウントネットワークや偽ニュースサイトを運営しているのを発見したと述べた後に書かれた「欺瞞的なキャンペーンまたは人工的な活動に従事しない」という新しいセクションが追加されました。
Claudeに接続されている、傷害を引き起こす能力のあるハードウェアは、観察および介入できる資格のある人間を必要とするようになり、モデルとの接続を失った場合は安全な状態にフェイルする必要があります。健康、法的、財務、その他のハイリスクな推奨事項は、Claudeの出力を誰かに影響を与える前に資格のある人間がレビューする必要があり、影響を受ける人はAIが関与したことを知らされる必要があります。
Anthropic自身の発表を含む、どの報道も、残酷さで会話が終了した後のユーザーアカウントの行方や、2025年8月の規則の下でこれまでに終了した会話の数については述べていません。Anthropicは、極端な残酷さを、それが何でないか(通常の不満、フィクション、テスト)によって定義しましたが、それが何であるかに対して、Claudeに電話を切らせることを除いて、実際に線を引くものが何であるかについては述べていません。
関連項目
モデルの福祉を探る — モデルの福祉研究プログラムを開始したAnthropicの2025年4月の発表
Anthropicの透明性ハブ — 利用ポリシー違反の検出と施行方法に関するAnthropicの説明
出典
Anthropic bars "abusive or cruel" beh