AI・機械学習
Microsoft幹部、AIスクレイピングを「人類史上最大の労働の略奪」と呼ぶ
Microsoft exec called AI scraping 'the largest theft of labor in human history' (techcrunch.com)
要約
New York TimesがOpenAIとMicrosoftに対して3年前に起こした著作権訴訟で、新たに開示された情報により、AIスクレイピングは略奪に等しく、AI製品は出版物にとって大きな脅威であるという認識が明らかになりました。訴訟によると、Microsoftのトップ幹部は、同社のAIトレーニング慣行を「略奪」と私的に表現し、OpenAIのリーダーシップ自身も、そのAIモデルがトレーニングに使用された出版物やジャーナリストの作品に対して「存亡の脅威」をもたらすと述べていました。
全文翻訳
New York TimesがOpenAIとMicrosoftに対して3年前に起こした著作権訴訟で、新たに開示された情報により、AIスクレイピングは略奪に等しく、AI製品は出版物にとって大きな脅威であるという認識が明らかになりました。
訴訟によると、Microsoftのトップ幹部は、同社のAIトレーニング慣行を「略奪」と私的に表現し、OpenAIのリーダーシップ自身も、そのAIモデルがトレーニングに使用された出版物やジャーナリストの作品に対して「存亡の脅威」をもたらすと述べていました。
開示された資料には、同社がどのようにしてペイウォールを検知されずに回避し、大量スクレイピングを通じてトレーニングデータセットを構築し、トレーニングデータから著作権表示を意図的に剥がしたかが詳述されています。
新しい情報の多くは、The Times自身の短い陳述から来ており、元の証拠書類は依然として封印されていることに注意してください。
以下の引用は、元のコンテキストなしで提示されています。
この開示されていない申立書は、3年前の訴訟における最新のエスカレーションであり、New York Timesは当初、両社がそのコンテンツで生成AIモデルをトレーニングすることにより著作権法に違反したと主張していました。
AI企業がAIをトレーニングするために著作権で保護された素材を合法的に使用できるかという問題には、明確な答えはありませんが、裁判官はトレーニングが「公正使用」を構成するというAI企業の主張に概ね好意的でした。
この法的規則は、パロディ、ニュース報道、批評などの特定のケースで、許可なく著作権で保護された作品を使用することを許可します。
今月初め、トランプ政権は、OpenAIのLLMをトレーニングするための著作権で保護された素材の無許可使用を擁護する申立書を提出しました。
しかし、新しい証言のいくつかは、OpenAIの公正使用の弁護論に反しており、特に、その使用が元の作品の市場を代替または損なわないという規則の要件に反しています。
例えば、Microsoft自身のデータによると、同社のCopilot「回答エンジン」は、従来のBing検索と比較して、New York Timesのドメインへのクリック率を最大93%低下させました。
2024年1月にMicrosoftの応用科学ディレクター、Brent Hechtが作成した内部プレゼンテーションでは、この低下を「私たちのモデルとウェブ全体全体のパフォーマンスを同時に損なう」「破滅のループ」と描写しています。
「エンドプロダクトが、その必須サプライヤーの経済的基盤を脅かすというのは非常に珍しいことですが、それが、コンテンツサプライチェーンに関して、LLMビジネスのために私たちが作り出した状況です」と、申立書で引用されているMicrosoftの文書は述べています。
MicrosoftのCEOであるSatya Nadellaも、今年の初めの宣誓証言で、「ペイウォールで保護されているものはすべて、使用したい人がライセンスを取得すべきです…グラウンディングまたはトレーニングのために」と証言し、「OpenAIがペイウォールで保護された情報をスクレイピングしてトレーニングしたことを知らされていた場合」は、「OpenAIにモデルを再トレーニングするように要求する(Microsoftの権利)を行使しただろう」と明確にしました。
他の証言は、公正使用テストの異なる柱に反しています。
OpenAIのChatGPT責任者であるNick Turleyは、内部コミュニケーションで、出版物は、チャットボットのような製品から「存亡の脅威」に直面しており、それらは「大部分が代替的」であり、「より良くなるにつれてますます代替的になる」と書いています。
OpenAI社長のGreg Brockmanは、モデルが「ニュースに優れている」と描写しました。
Nadellaは今年の初めの宣誓証言で、チャットボットとの会話は「AIプラットフォーム上で直接情報を提供するのと、基盤となるソースに行く必要があったのとを代替した」ことに同意しました。
そのような言葉遣いは、テクノロジーが元の作品を直接的に変革するのではなく、競合する可能性があることを示しています。
Microsoftの文書によると、生成AIが「基盤モデルがトレーニングされたデータを作成したまさにその人々の雇用を大幅に混乱させる」という「現実的なリスク」があると述べています。
コピーの規模は驚異的です。
文書によると、OpenAIの中間トレーニングデータセットだけでも、NYT、Daily News、Center for Investigative Reportingが発行した作品の91,692件以上のコピーが含まれていることが初めて明らかになりました。
Common Crawlから派生したデータセットには、nytimes.comから200万件以上のドキュメントが含まれていました。
2023年1月の内部メモで、Hechtはこれを「前例のない規模の驚くべき略奪」であり、「人類史上最大の労働の略奪」と呼んでいました。
申立書は、OpenAIとMicrosoftがどのようにして原告のコンテンツを取得したかを新たな詳細で示しており、Bing Indexからのスクレイピングも含まれています。
「OpenAIは、MicrosoftにGPT-3トレーニングデータセット全体を提供し、MicrosoftはそれをOpenAIのモデルを自社の商用製品に実装する方法を評価するために使用しました」と申立書は述べています。
「Microsoftは同様に、Project TaxiおよびProject Mangoと呼ばれるイニシアチブを通じてOpenAIにトレーニングデータを提供しました。」
両社は、Project Mangoのデータを、ニュース出版物からの少なくとも160,903件のユニークな作品のコピーを含むトレーニングデータセットに組み立てたとされています。
スクレイピングを最大限に活用するために、OpenAIの従業員は検知されずにペイウォールを回避する計画を立てたとされています。
申立書によると、OpenAIの研究者Nick RyderがBrockmanに「nytimesのペイウォールを回避するハック」について伝えたとき、Brockmanは「ああ、いいね」と返信しました。
OpenAIの従業員はまた、スクレイピングされたニュースコンテンツに不均衡に依存するWebTextおよびWebText2のようなトレーニングデータセットを構築したとされています。
彼らはまた、無料のオープンリポジトリであるCommon Crawlから数百万の記事を収集したとされています。
調査結果では、研究者が「モデルが出力することを望まない」ため、モデルに到達する前にトレーニングデータから著作権表示を意図的に剥がした努力についても説明しています。
「ここで初めて明らかになった証拠は、OpenAIとMicrosoftが自分たちのやっていることが間違っていることを知っていたことを示しています」と、New York Daily Newsの弁護士であるSteven LiebermanはTechCrunchと共有された声明で述べています。
OpenAIとMicrosoftはコメントの要求に応じませんでした。
トピックAI、著作権、政府と政策、Microsoft、ニューヨークタイムズ、OpenAI
私たちの記事のリンクから購入すると、少額の手数料を得る場合があります。これは私たちの編集の独立性には影響しません。
Rebecca BellanシニアレポーターRebecca Bellanは、TechCrunchのシニアレポーターで、人工知能を形成するビジネス、政策、新興トレンドをカバーしています。
彼女の作品は、Forbes、Bloomberg、The Atlantic、The Daily Beastなどでも取り上げられています。
rebecca.bellan@techcrunch.comにメールするか、Signalのrebeccabellan.491で暗号化メッセージを送信して、Rebeccaからの連絡を連絡または検証できます。
プロフィールを見る2026年10月13日~15日サンフランシスコ展示テーブルの予約は9月18日が最終日です。
DisruptのExpo Hallで、高インパクトのリード、投資家アクセス、ブランドスポットライトをお見逃しなく。
今すぐ予約
最も人気のあるOpenAI、モデルに悪い行動を隠すための後継者へのメモを残していたことが判明Rebecca Bellan
クリーンテックスタートアップFluxnium、5万年分の核燃料を採掘する方法を発見Tim De Chant
SalesforceとNvidiaの新しい推論モデルは、AIラボが恐れるべきすべてですJulie Bort
Jensen Huangはトランプからの電話を受け、別のものも披露しましたConnie Loizos
VCによると、Y Combinatorの最新Demo Dayから最も話題になった9つのスタートアップMarina Temkin
Dominic-Madori Davis
Teslaは、ついに第2世代のRoadsterを発表すると述べています10月1日Anthony Ha
Revolut、偽の政府からの要求による顧客データ侵害を確認Jagmeet Singh