HN 日本語サマリー

← 一覧へ戻る
Web開発

Cloudflareの顧客向け新AIトラフィックオプション

Cloudflare's new AI traffic options for customers (blog.cloudflare.com)

162 pointsby alphabetatango133 コメント

要約

Cloudflareは、AIボットによるコンテンツ利用に関する新たな管理オプションを発表しました。従来の「AIボットブロック」に加え、AIの利用目的を「検索(Search)」、「エージェント(Agent)」、「トレーニング(Training)」の3つに分類し、ウェブサイト所有者がより詳細にトラフィックを制御できるようにします。新たなデフォルト設定では、広告表示ページにおいてトレーニングおよびエージェントボットはブロックされ、検索ボットは許可されるようになります。

全文翻訳

1年前、私たちは最初のコンテンツ独立記念日を宣言し、ウェブサイト所有者にコンテンツの管理を取り戻す手段を提供しました。30年間続いてきたクローラーとウェブサイト所有者間の取引――我々がクロールし、あなたは参照トラフィックを得る――はもはや通用しなくなっていました。AIはすべてを奪い、何も返さないため、ウェブサイト所有者にとって存続の危機をもたらしました。そこで私たちは、ワンクリックの「AIボットをブロック」オプションと、クロールごとの従量課金マーケットプレイスを立ち上げました。 1年で多くのことが変わりました。昨年7月、「AIボット」に関する会話は、補償なしでのAIトレーニングをブロックすることを中心に展開され、コンテンツがモデルトレーニングに使用されてもウェブサイト所有者には価値が還元されないという、勝者なしの取引が指摘されていました。しかし、よりニュアンスのあるアプローチへの欲求が生まれています。コンテンツ所有者は依然としてコンテンツを保護したいと考えており、作成、キュレーション、共有に費やしたオリジナルコンテンツに対して報酬を得られるべきです。また、コンテンツを完全にロックダウンすることが万能な解決策ではないことも理解しています。ウェブサイト所有者は、「常にすべての自動化をブロックする」という手段に頼る以上の選択肢を求めています。 小規模なサイトを運営している場合、問題は誰かがあなたのコンテンツでモデルをトレーニングできるということだけではありません。そもそも誰もあなたを見つけられないということです。そのため、あなたはファウスト的な取引をしなければなりません。検索に表示されてAIにトレーニングさせるか、あるいは発見可能性を失うリスクを冒すかです。これは、インカレントな検索プロバイダーが検索とトレーニングに同じボットを使用する場合、不当に有利になります。そしてこの不当な優位性は、競争のギャップを埋めようとする新しいプレイヤーに回避的な行動を促します。 今日、AIはあらゆるものになり得ます。Google検索は、AIによってソートされるものから、結果ページで直接あなたの質問に答える完全な回答エンジンへと変化しました。そしてGoogleだけがこの状況にあるわけではありません。これが「検索」が進む方向です。 今日「AI」と見なされるもののカットオフについて議論することもできますが、明日にはその基準が変わってしまうでしょう。そのため、ボットを主に「AI」であるか否かで定義するのではなく、ボットまたはエージェントの行動についてより深い質問をすることで、分類に対する私たちの更新されたアプローチは、彼らは私のサイトで何をしているのか?何を保存しているのか?そして私のコンテンツをどのように再共有するのか?を問います。 これらの質問に対処するには、よりニュアンスのある視点、つまり顧客が気にかけているAIユースケースに合致する実用的な分類法が必要です。そこで私たちは、AIトレーニングだけに留まらず、すべての顧客が管理できるようにしたい3つのAIユースケースに焦点を当てて議論を開きます。 検索:後でそれについて質問に答えるために、あなたのコンテンツを収集またはインデックス化するあらゆる行動。重要なのは、検索が後でクエリに応答するために、あなたのサイトのデータベースを積極的に構築しているということです。サイト所有者は、その結果として参照トラフィックやその他の公平な補償を期待すべきです。 エージェント:通常リアルタイムで、誰かのために何かをすぐに完了するために行動する自動化された行動。これには、チャットフェッチボット(例:ChatGPT-User)やブラウザ使用エージェント(例:GeminiまたはClaudeがChromeを駆動するもの)が含まれます。重要なのは、それがジョブを完了するためにあなたのウェブアプリケーションを訪問し、しばしばその背後に人間が待っているということです。 トレーニング:モデルをトレーニングまたはファインチューニングするためにコンテンツを取得するクローラー。重要なのは、あなたのデータがAIの機能を改善するために、AIの基盤となるアーキテクチャに永続的に吸収されることです。 ウェブ上の多くの人気のあるクローラーは、上記の分類のいずれかに該当します。いくつかは複数の分類に該当します。私たちは、広告検証、フィードフェッチ、エージェントトランザクション(後述)を含む、上記の3つ以外の多くの行動を分類しています。しかし、すべてのウェブサイト所有者がこれらの3つのAI中心のユースケースへのアクセスを管理することを容易にすべきだと信じています。ボットオペレーターはクローラーを分離すべきだと考えています。なぜなら、それはウェブサイト所有者により多くの透明性をもたらし、特定のクローラーが訪問している理由をよりよく理解し、そのクローラーに与えるアクセスをよりよく管理できるようにするからです。もし企業が検索インデックスを構築し、エージェントとして機能し、モデルをトレーニングするためにデータを収集する自動化を実行している場合、私たちはその企業に自動化を3つの別々のクローラーに分離することを強く推奨します。 私たちは、自動化されたトラフィックの世界が進化するにつれて、スケーラブルで代表的な分類システムを求めています。ボットの目的を追跡することは新しいことではありませんが、私たちの新しい分類法には、今日のボットトラフィックの状況をよりよく表すいくつかの更新が含まれています。最も注目すべきは、複数の目的を持つボットは、1つの目的だけでなく、すべての目的で追跡されるべきであることを認識したいということです。 AIトラフィックを管理するための新しいオプション Cloudflareネットワーク上のすべてのウェブサイト所有者に、さまざまな種類のAIトラフィックを管理するためのより多くのオプションを提供したいと考えています。 過去に発表した「AIボットをブロック」という管理プリセットには、以下に示すように、モデルトレーニングのためにデータをクロールする単一目的のボットが含まれていました。 しかし、AIの利用はすべて同じではなく、顧客が必要なコントロールを持てるようにしたいと考えています。そのため、検索、エージェント、トレーニングクローラーの3つの主要なユースケースに基づいたAIトラフィックの管理機能をリリースします。これらの新しいオプションにより、顧客はAIボットトラフィックの管理方法をより細かく調整できるようになります。これには、無料ティアの顧客も含まれます。 新しいデフォルト設定 2026年9月15日、これらの3つの分類のそれぞれについて新しいデフォルト設定を行います。Cloudflareに新規オンボーディングするすべてのドメインでは、広告が表示されるページにおいて、トレーニングとエージェントのカテゴリはデフォルトでブロックされますが、検索はデフォルトで許可されたままになります。広告は、ウェブサイト所有者が人間が訪問してそれを見ることを意図した信号であり、ビジネスを支える収益化可能なものです。そのため、これらのページでは、人間の注意を最終目標として扱い、この注意を妨げる可能性のあるボット(つまり、トレーニングおよびエージェントボット)を遠ざけます。一方、検索は最も自然に訪問者を誘導する行動であり、ほとんどのサイト所有者の利益になると考えています。 9月15日に適用されるもう1つの変更は、マルチパーパスクローラー(特に検索とトレーニングを組み合わせるもの)は、ウェブサイト所有者への透明性という私たちの呼びかけに沿って、すべての行動に沿って許可/ブロックされるということです。デフォルトは最も制限の厳しい適用ルールによって強制されるため、Googlebot、Applebot、BingBotのようなマルチパーパスクローラーは、トレーニングをブロックすることを選択した顧客(新しいAIトラフィック管理オプションまたは従来のAIボットブロックサービスを通じて)によってブロックされます。 もちろん、顧客の選択が最優先です。ウェブサイト所有者がこれらの新しいデフォルト構成をオプトアウトしたい場合は、9月15日までにセキュリティ設定で簡単にマークでき、トレーニング目的で検索もクロールするトレーニングクローラーに変更がないことを確認できます。また、デフォルトとは異なる設定を選択したい顧客がそうする機会を得られるように、9月15日が近づくにつれて、デフォルトへの変更について顧客に通知を続けます。 BotBase:エンタープライズ顧客向けの新しい可視性レイヤー エンタープライズボット管理の新しい機能として、主要な可視性アップデートをリリースできることを嬉しく思います。Cloudflareの追跡ボットのディレクトリが成長するにつれて、これらのボットを合理的なグループで管理し、特定のボットについてより詳細を理解したいという願望も高まっています。BotBaseの紹介。BotBaseは、検証済みボットやエージェントを含む、すべての既知のボットを追跡する新しいデータベースです。このデータベースは、Cloudflareダッシュボード上で、私たちのボットディレクトリ全体の包括的で検索可能なビューを提供します。まず可視性に取り組みますが、今年後半には、BotBaseを拡張して、ウェブサイト上の既知の自動コンテンツの直接制御センターを提供します。 この新しいビューにより、エンタープライズボット管理の顧客は、Fu