HN 日本語サマリー

← 一覧へ戻る
Web開発

AIトレーニングクローラーをブロックするサイトの多くは、回答時間ボットの存在を無視している

Sites that block AI training crawlers mostly ignore the answer time bots (sitedex.dev)

8 pointsby zeppelin_70 コメント

要約

2023年にAIトレーニングボット(GPTBotなど)をブロックするためにrobots.txtを更新したサイトの多くは、その後の「回答時間ボット」(リアルタイムで質問に答えるためにページを取得するボット)に対してはルールを更新していません。これは、AIベンダーが2種類のボットを運用しているにもかかわらず、多くのサイト管理者がその区別を認識しておらず、AIによるウェブコンテンツの利用方法の進化に対応できていない現状を示唆しています。

全文翻訳

← InsightsData Study あなたのrobots.txtは2023年の戦争記念碑です 私たちはトップ10,000サイトのrobots.txtを読みました。GPTBotのルールで日付を特定できたものの38%は、GPTBotがローンチし、Timesが訴訟を起こした直後の2023年の1四半期に集中して記述されていました。その後、すべてのAI企業は静かに2番目のボット、つまりリアルタイムで質問に答えるボットを追加しましたが、それに対してルールを書いた人はほとんどいませんでした。 2026年7月4日 7月1日、Cloudflareは、サイト所有者がAI企業に料金を請求できる方法を発表しました。これは、AIボットがモデルをトレーニングするために数ヶ月後にページを取得するのではなく、誰かの質問に答えるためにページを取得したその瞬間に請求されるものです。これはまだ初期段階で実験的ですが、それだけではありません。x402のようなオープンな決済レールも、同じアイデアのために構築されています。ウェブには長い間、そのフェッチをブロックする方法がありました。そして今、それに対して課金する方法が構築され始めています。回答は取引になりつつあります。これは、AIに関するウェブのルールブックがその瞬間をほとんど認識していないため、料金を徴収するには奇妙なことです。 私たちはバイブスではなくデータでそれをチェックしたかったので、退屈なことをしました。トップ10,000サイトのrobots.txtを取得し、各サイトが宣言していることを読みました。サーバーが実際に提供しているもの、エッジが静かにブロックしているものではありません。なぜなら、外部からはそれを見ることができないからです。単に各サイトが玄関先に公開しているルールブックです。そのうち5,577件は、私たちが読めるものでした。これは、そのルールブックが回答時代について何を言っているかの研究です。短いバージョン:それは別の戦争のために書かれました。 ルールは戦争記念碑です 最初に気づくのは日付です。これらのAIルールの記述時期を、最初に書かれた時期と並べると、AI時代全体に広がるのではなく、その始まりに集中しています。日付を特定できたGPTBotルールの861サイトのうち、38%が1つの四半期、つまり2023年の最後の3ヶ月(323サイト、次の最も多い四半期の3倍)にそれを書きました。半数は、クローラーのローンチから約6ヶ月以内に書かれました(861サイト中430サイト)。その四半期は偶然ではありませんでした。OpenAIは2023年8月にGPTBotをリリースしました。New York Timesは8週間後にOpenAIを訴えました。その秋にウェブサイトを運営していたなら、あなたは本当にショックを受け、合理的に、テキストファイルに4行を貼り付けてトレーニングクローラーを締め出すことで対応しました。それは2023年には合理的なことでした。今日でも正しい判断かもしれません。 これほど古いファイルは時代遅れになると予想するでしょう。ほとんどはそうではありません。パニックウィンドウでGPTBotルールを書いた430サイトのうち、87%は後で戻ってきて新しいボットルールを追加しました。戻ってこなかったのはわずか57サイトです。誰かがこれらのファイルを開き続けています。しかし、追加されたものを見ると、その勤勉さは損なわれます。新しい行は、ほとんどすべてがトレーニングクローラーです。ClaudeBotは現在これらのサイトの671に、PerplexityBotは540にあり、2026年まで増加し続けています。一方、回答時間ボット、つまりライブの回答を作成するためにページを取得するボットは、その注意のほんの一部しか引きつけていません。そして、GPTBot以降何もパニック速度で動いていません。後続のすべてのクローラーは、最初の2四半期でルールの3%から23%しか予約しておらず、2023年の洪水に対するゆっくりとした滴りです。パニックは一度きりのイベントでした。それ以降すべては筋肉の記憶です。 したがって、そのファイルは戦争記念碑です。ただし、放棄されたものではありません。人々が戻ってきて、そこに刻まれたすべての名前が同じ戦争からの別のトレーニングクローラーであるようなものです。それは怠慢ではありません。それは盲点であり、ファイルをより熱心に手入れしても盲点は修正されません。 AIルールが最初に書かれたとき、四半期ごと トレーニングクローラー(GPTBot) 回答時間ボット — サイトごとの最初のルール(OAI-SearchBot、Claude-User、Claude-SearchBot、Perplexity-User) ルールがボットで観察された最初の四半期 · すべての1,197ブロッカー 0 100 200 300 サイト 323 — パニック四半期 81 2023 2024 2025 2026 各サイトは、ルールが最初に現れた四半期に一度カウントされます。合計1,197ブロッカーのうち、861は日付付きのGPTBotルールを一度でも書き、その半数(406)しか回答時間ボットのルールを書いたことがありません。これは、2023年のスパイクに達しない低い帯域です。Internet Archiveから最初の出現時期で日付付けされています。方法を参照してください。 すべてのAI企業は2つのボットを実行します。ほとんどのルールは1つしか認識していません。 ここに、2023年のルールブックが見落とした部分があります。主要なAIベンダーのそれぞれは、あなたのサイトに1つのボットを送るわけではありません。2つ送り、それらは異なる仕事をします。1つはトレーニングクローラーです。モデルを構築するためにウェブを大量に読み取ります。もう1つは回答時間フェッチャーです。実際の人が質問をした後に現れ、あなたのページを、目の前で書かれている回答に引き込みます。最初のものが2023年に皆が怒っていたものです。2番目のものが現在重要です。なぜなら、それは回答ごとの料金を測定するものであるからです。すべてのAIベンダーは2つのボットを実行します。ほとんどのルールはトレーニングクローラーの名前しか挙げていません。 トレーニングクローラー モデルを構築するためにウェブを読む 回答時間フェッチャー 誰かが質問したときに到着する GPTBot OpenAI OAI-SearchBot + ChatGPT-User OpenAI ClaudeBot Anthropic Claude-User + Claude-SearchBot Anthropic PerplexityBot Perplexity Perplexity-User Perplexity 分割。 左側のトレーニングクローラーをブロックすることは、右側の回答時間フェッチャーについては何も言いません。 そのため、私たちは、各トレーニングクローラーを完全にブロックしたサイトについて尋ねました。そのベンダーの回答時間ボットについて何か言及していましたか?ほとんどの場合、いいえ。各トレーニングクローラーを完全にブロックしたサイト(読み取り可能なrobots.txt、トップ10,000)のうち、回答時間ボットについて何も言及していないサイトは、それを明示的に許可したサイトよりもはるかに多いです。 ベンダー ブロックしたトレーニングクローラー 対象の回答時間ボット(s) 何も言及していない 明示的に許可した Anthropic ClaudeBot Claude-User, Claude-SearchBot 71% (840件中598件) 1.9% (840件中16件) OpenAI GPTBot OAI-SearchBot, ChatGPT-User 53% (932件中493件) 4.0% (932件中37件) Perplexity PerplexityBot Perplexity-User 50% (461件中229件) 0.9% (461件中4件) 右側の2つの列を一緒に読んでください。なぜなら、それらの間のギャップが発見だからです。Anthropicのトレーニングクローラーを締め出したサイトの10件中7件は、Claudeで回答するボットに関するルールを一切持っていません。そして、興味深いことを意図的に行った人々の数 — トレーニングはブロックし、回答は維持する、これは実際に参照トラフィックを望むがモデルに餌を与えたくないパブリッシャーにとって理にかなう姿勢ですが — はわずかです。Anthropicでは2%未満。OpenAIでは4%。誰もが理論化している「トレーニングなし、回答あり」の姿勢は、現実にはほとんど存在しません。 その沈黙に意図を読み取る前に1つの注意点があります。それは盲点の限界値であり、その測定値ではありません。外部からは、OAI-SearchBotに一度も遭遇しなかったサイトは、それに遭遇し、肩をすくめ、冗長な許可を書き込む理由がないと判断したサイトと区別がつきません。誰もが喜んで許可するボットのルールを書くことはありません。私たちが意図を見ることができるのは、誰かがそれに基づいて行動したときです。そして、それはテーブルの最後の列です。トレーニングクローラーをブロックし、回答時間ボットを意図的に通過させる数パーセントです。Forbesはその一例です。GPTBotは許可されていませんが、OpenAIの検索フェッチャーは明示的に許可されています。その姿勢は本物です。ただ稀です。 ギャップは、明確に試みたファイルではより簡単に見ることができます。The Economistは、2026年7月3日のスキャンと2026年7月4日の再チェックで読み取られたrobots.txtによると、2つのOpenAIボットを名前で拒否しています。GPTBotとChatGPT-Userの両方が「Disallow: /」を平らに描いています。3番目のOAI-SearchBot、ライブ検索回答にページを引き込むフェッチャーは、ファイルにまったく含まれていません。The Economistは明らかにここに注意を払っていました。意図的にボットに名前を付け、擁護可能な決定を下しました。OpenAIは、管理している2つ以上のボットを実行しており、除外されたのは検索フェッチャーです。約10秒でどのサイトでも同じようにチェックできます。そのrobots.txtを開き、回答時間ボットの名前を探してください。 管理者が読めないルールブック さらに静かな失敗もあります。私たちに応答した7,627サイトのうち883サイトでは、正直に識別されたボットが /robots.txt を要求したにもかかわらず、チャレンジまたは拒否を受けました。ルールをすべて述べること全体が仕事であるルールブックが、訪問者に裏向きに渡されました。GoDaddyはその一例です。私たちは、意図的な反AI姿勢と、私たちを含むすべてのデータセンターIPに挑戦するセキュリティベンダーを区別することはできません。そして、私たちはそれを偽りません。しかし、ルールブックは...