AI・機械学習
スクレイパー問題に関するアップデート
An Update on the scraper situation (lwn.net)
要約
大規模言語モデル(LLM)の学習データ収集を目的としたウェブサイトのスクレイピング問題が深刻化しており、ウェブサイトへの過剰なトラフィック負荷を引き起こしています。このトラフィックの多くは、ユーザーの同意なく悪用される「レジデンシャルプロキシ」と呼ばれるシステムから発生しており、犯罪組織や一部の企業が関与しています。
全文翻訳
LWN.netへようこそLWN購読者により、以下の購読者限定コンテンツが利用可能になりました。何千人もの購読者が、Linuxおよびフリーソフトウェアコミュニティからの最高のニュースのためにLWNに依存しています。この記事を楽しんでいただけたなら、LWNを購読することを検討してください。LWN.netへのご訪問ありがとうございます!Jonathan Corbet 2026年7月10日2025年初頭に公開された記事「AIスクレイパーボットの災厄との戦い」では、大規模言語モデルや関連プロジェクトの学習データを探すためのウェブサイトの広範なスクレイピングの問題について議論しました。この活動はサイトにトラフィックを過剰に発生させます。この記事が公開されてから1年以上経ちますが、問題は依然として拡大しています。影の行為者によるサイトへの攻撃は新たな高みに達し、オープンウェブの維持はますます困難になっています。このトラフィックはどこから来て、何ができるのでしょうか?レジデンシャルプロキシ昨年説明したように、スクレイパー攻撃はネットワーク上の膨大な数のソースから来ています。数時間のうちに数百万の一意のIPアドレスからの協調的なリクエストを見ることは珍しくなく、それぞれがサイトに最大2〜3回ヒットします。攻撃者が制御するデータ(ユーザーエージェントフィールドなど)は完全に偽造されており、各ヒットはウェブブラウザを持つ別の人間のように見せかけられています。違いを見分ける方法(たとえば、ボットは通常画像をフェッチしない)はありますが、その判断が下される頃には、問題のIPアドレスは再び使用されなくなります。その時点でIPアドレスをブロックしても時間の無駄です。このトラフィックは主に住宅用およびモバイルネットワークから発生し、中央のコマンドアンドコントロールノードによって指示されます。通常のシステムにインストールされたソフトウェアは、制御ノードからの命令を受け取り、要求に応じてウェブページを取得し、結果のデータをコントローラーに転送します。多くの場合、この活動は、問題のデバイスの所有者の知識や同意なしに行われます。「レジデンシャルプロキシ」という用語は、このように使用されるシステムを指します。ウェブサイトを攻撃するためにレジデンシャルプロキシネットワークを実行しているオペレーターには、表面上少なくともいくつかの異なるタイプがあります。1つのタイプは純粋に犯罪的であり、何らかのマルウェアに侵害されたシステムでスクレイパーを実行しています。今年の初めに、GoogleはIPIDEAと呼ばれるボットネットワークを停止するための措置を講じ、これらの操作がどのように機能するかについての多くの情報を提供しました。IPIDEAのシャットダウンは、LWNでのスクレイパートラフィックの大幅な減少と相関しており、数ヶ月間は比較的平和でした。しかし、その平和な期間はすでに終わっています。最近では、メディアストリーミングデバイスが悪意のあるスクレイピングソフトウェアの主要なキャリアとして特定されています。デバイスはソースで侵害されることもあれば、セキュリティが不十分で後から簡単に侵害されることもあります。2番目のタイプのオペレーターは、より公然と活動し、ある程度の正当性を装って「倫理的に調達された」IPアドレスを提供しています。Bright Dataという会社はその中でも最も著名なものの1つであり、ウェブサイトのアクセス制御やトラフィック制限を回避する能力を喜んで宣伝しています。Bright Dataは「無料」VPNサービスを提供しており、ユーザーはBright Dataにユーザーのデバイスを介してトラフィックをルーティングする能力を与える(つまり、同社のレジデンシャルプロキシネットワークの一部になる)だけで済みます。このVPNを使用するすべての電話またはその他のデバイスは、ウェブサイトを攻撃するために使用される別のエンドポイントになります。このタイプのオペレーターは他にもたくさんあります。多くの場合、アプリ開発者が提供物にリンクして、ユーザーのネットワーク接続をハイジャックすることに対して報酬を得られるライブラリを提供しています。そのうちの1社は、LWNで広告を実行することについて問い合わせてきましたが、それは、言うまでもなく、短い会話でした。一般的に、これらの企業は、たとえば「GDPR準拠」を宣伝するなど、ある程度の正当性を装うものから、あからさまに卑劣なものまで様々です。これらのレジデンシャルプロキシネットワークはウェブサイトのスクレイピングに使用されますが、これらのオペレーターが数百万のデバイスが接続されている可能性のあるネットワーク上のリソースにアクセスできるコードを実行できる能力を持っていることを強調する価値があります。このタイプのアクセスがスクレイピングにのみ使用されると仮定するのは、少なくとも楽観的です。そしてもちろん、モデル開発を中核事業とする著名な企業もあります。これらの企業は独自のスクレイピングを行っており、それらに簡単に帰属できるトラフィックはユーザーエージェントフィールドで明確に識別され、原則としてrobots.txtのような措置を遵守しています。彼らもまた、サイト全体を繰り返しスクレイピングしており、2003年に書かれた記事が過去1日で何らかの形で変更された可能性があるという理論に基づいているようですが、数百万のシステムからの過剰なトラフィックを生成するわけではなく、最大の問題ではありません。不明なのは、誰がレジデンシャルプロキシを使用しているかということです。誰かがこれらの攻撃をウェブサイトで実行するために支払っています。フロンティアモデル企業がこれらのネットワークを使用しているという証拠はありません(私が知る限り)。しかし、もしそうであることが判明した場合、世界の驚愕の増加はほとんど登録されないでしょう。これらの企業はモデルに何らかの方法でデータを供給しており、学習データをどのように取得するかについては公表しておらず、コンテンツクリエイター、あるいは彼らの事業に対する懸念を持つ人々に対する敬意のレベルで際立っていません。しかし、公開されているモデルごとに、膨大な数の隠密モデルが存在するはずです。多くの企業が独自のモデルを構築しようとしているに違いありません。結局のところ、AIが世界を乗っ取ることになると私たちは確実に知らされており、その競争でトップに立つ企業は計り知れない価値を持つでしょう。多くの国で、独自のモデルを開発し、見つけられる場所ならどこでも学習データを求めている影の政府機関が存在するはずです。大規模な犯罪組織(政府と区別される範囲で)もおそらく独自のモデルを欲しがっているでしょう。これらのツールは武器と見なされており、軍拡競争が行われています。インターネット全体がその十字架を背負っています。オープンインターネットの防御これに応答して、ウェブサイトオペレーターは、実際のユーザーへの影響を最小限に抑えながら、サイトを防御するために奔走しています。プルーフ・オブ・ワークを要求することでスクレイパーを撃退しようとするAnubisが広く普及しています。「人間であることを証明してください」というボタンで知られることもある商用サービスを使用するサイトもあります。あるいは、サイトはユーザーに街灯(ただしLED電球のもののみ)を含む四角形を選ばせたり、パズルピースを配置させたり、スペースバーを押し続けながら歌を歌わせたりします。多くのサイト機能がログインゲートまたはペイウォールの背後に置かれています。一部のサイトは、iocaneのようなツールを使用してスクレイパーに送信されるデータを積極的に汚染しようとしています。これらのメカニズムを設定および維持する必要性と、ウェブサイトにアクセスするためにユーザーがそれらに対応する必要性は、スクレイパーとその支払い者によって世界全体に課せられる重い税金となっています。最近、LWNは、これまでにない最も激しいスクレイパー攻撃を受けました。実装された防御のおかげで、サイトはトラフィックによく耐えたため、ほとんどの実際の読者は気づかなかったでしょう。サイトを防御するために取った対策を説明するようにという要求がありましたが、明白な理由から、それらを詳細に議論したくありません。これもまた、このレベルでの軍拡競争です。実際の読者への影響を可能な限り最小限に抑えるように努めたと言えます。Anubisのようなツールは使用していません。これは、サイトへのアクセスを試みる人々にとって迷惑な遅延を引き起こすだけでなく、スクレイパーがいずれそれを回避する方法を見つけることは避けられないように思われるためでもあります。実際、すでにそれが起こっている兆候がいくつかあります。プルーフ・オブ・ワークの要件は、数百万のシステムがあれば大きな障害にはなりません