HN 日本語サマリー

← 一覧へ戻る
科学・技術

AirTagが明らかにした、AmazonがAI学習のために希少本を破棄している事実

AirTag reveals Amazon is trashing rare books to train AI (arstechnica.com)

53 pointsby jefurii20 コメント

要約

匿名の情報源とAirTagを用いた追跡調査により、AmazonがAIモデルの学習データとして希少本を大量購入し、スキャン後に破棄している実態が明らかになりました。この行為は、AI開発競争におけるデータ獲得の過熱と、書籍の歴史的・文化的価値を無視した非倫理的な手法への懸念を浮き彫りにしています。

全文翻訳

過去1年ほど、書籍販売業者の間では、AI企業が大量の希少本を購入し、スキャンしてAIをトレーニングした後、それらを破棄しているのではないかという疑念がありました。しかし、これを証明するのは困難でしたが、404 Mediaの報道によると、希少本に隠されたAirTagが、少なくとも一つの巨大テクノロジー企業が、最先端モデルを進化させる競争の中で、一部の大量購入の背後にいることを示しました。それはAmazonです。 月曜日、404 Mediaは、希少本の一部である大量購入された書籍にAirTagを仕掛けることに同意した書籍販売業者と連絡を取り、そのAirTagがラスベガスのAmazonのAIトレーニング施設に追跡されたことを明らかにしました。この施設には、書籍を背表紙から引き剥がし、ページをスキャンすることに特化したチームがいました。404 Mediaは報じています。破壊的な書籍スキャニングに対する高まる反発に、明らかに鈍感な様子で、そのチームの倉庫のドアにあったロゴ、VGT3は、本を食べようとしているティラノサウルス・レックスのシンボルを表示していました。404 Mediaは記録しています。 Amazonはコメントを避ける Amazonは404 Mediaの発見についてコメントを控え、Arsに404 Mediaに提供したのと同じ声明を提供したのみで、AIトレーニングについては具体的に言及していません。「Amazonは、顧客が利用する製品やサービスを開発・改善するために、商業的なチャネルを通じて書籍を購入しています」とAmazonの声明は述べています。 しかし、Amazonは、Google、OpenAI、Anthropicのような主要企業と競争力を維持するために、膨大な量のユニークなトレーニングデータを必要とする、自社が最先端と考えるAIモデルを開発しています。現在、企業は競争上の優位性を失わないように、トレーニングデータを慎重に管理しています。そして、見つけるのが難しい希少本のテキストでモデルをトレーニングすることは、特にAnthropicやxAIのような競合他社が希少本やアンティーク本でトレーニングしていないと公に述べていることを考えると、Amazonにとって有利になるでしょう。 さらに、Amazonはオリジナルのテキストの新しいソースを必要としていたようです。404 Mediaは、オンラインフォーラムでの議論を指摘しており、VGT3の作業員は、今年初めにAmazonがスキャンする書籍が不足していたと示唆していました。不足は非常に深刻で、Amazonがさらに書籍を見つけてスキャンできなければ、倉庫が閉鎖されるのではないかと彼らは心配していました。ある時点では、供給が完全に枯渇したと作業員は述べています。しかし、施設はまだ稼働しており、404 Mediaは報じています。そして、そこに届けられた希少本の大量購入が、このチームによって体系的に破壊されていることが確認されました。 多くの書籍愛好家は、破壊的な書籍スキャンに愕然としています(代替手段があるため)。熱心な批評家の一人であるマイケル・バリーでさえ、この行為を「悪魔そのもの」と呼んだと伝えられています。しかし、Amazonの作業員はフォーラムで、この仕事は、柔軟な時間で退屈な仕事に惹かれる人々にとって「良い」機会だと考えていると報告しています。 希少本を巡る議論が続く 書籍販売業者が価値を置く希少作品がAmazonのAIマシンに食い荒らされていることを明らかにしたことに加え、404 Mediaは、その調査が、AI企業がなぜ特定の希少本を選んで購入し、他の本を選ばないのかについての別の書籍販売業者の理論を固めるのに役立ったと示唆しました。報告によると、販売が歴史的な年となった後、書籍販売業者は、AI企業がトレーニングデータセットにユニークな作品の最大量を確実に含めるために、ISBN番号を持つ書籍を標的にしていると疑っていました。そして、Amazonの作業員によるオンラインでの議論のレビューは、彼らが書籍をスキャンする前にバーコードまたはISBNをスキャンするように訓練されていたことを示唆しています。404 Mediaは、その慣行が、「AI企業がISBNのリストをたどって、世界中のすべての印刷された書籍を体系的にスキャンしようとしている」という書籍販売業者の理論に「さらなる信憑性を与える」と報告しています。 書籍販売業者にとって、金銭的な報酬は大きいかもしれませんが、注意深く調達したコレクションがAmazonのような破壊的な書籍スキャンに運命づけられるリスクは、倫理的なジレンマを生み出します。彼らは、幅広い希少本の価値を評価する方法を知っており、AI企業は、チェックリストを完成させるために低コストでユニークなISBNを求めて、そのステップをスキップしているようです。現在、AI企業が購入していると思われる書籍は、必ずしも高く評価される有名な作品の貴重な初版のようなものではありません。代わりに、AI企業はしばしば、今日広く使われていない外国語に翻訳されなかった書籍や、広く流通するほど人気がなかった書籍など、金銭的価値の低い古い書籍を標的にします。しかし、これらの作品には、AI企業が見過ごしている「歴史的価値、知的価値、感傷的価値」があるかもしれないと、AirTagを仕掛けた書籍販売業者は404 Mediaに語りました。希少本の価値は、「AI企業が気にしないあらゆる種類の」ものから派生する可能性があります。彼らは単に、言葉の羅列としてのコンテンツを求めているだけです。 Redditユーザーの意見 Redditでは、一部の書籍ファンが、特にBBCの報道によると、これらの書籍の一部が数十年も書店の棚で埃をかぶっていたことを考えると、AIをトレーニングするために企業が希少本を破壊することが問題なのかどうかを議論しました。「あなたはあの古い紙の本を買うつもりはなかっただろう」と、あるRedditユーザーは「1700年代の難解な本が今や博物館の品物であり、私たちが知らなかった日常の出来事を明らかにするかもしれない」と嘆く投稿に応えてコメントしました。そのスレッドで、元の投稿者は、希少本をレビューすることから得られる微細な詳細や主要な歴史的洞察さえも、AIの強欲によって失われることが本当の問題だと述べました。投稿者は、「AI企業は、他の誰かが同じ作品でAIをトレーニングできるようにしたくない」ため、「スキャンした本のコンテンツを共有することはないだろう」と述べました。 「これはAI嫌いのプロパガンダのように聞こえる」と別のRedditユーザーは反論しましたが、後続のコメントで同様の懸念が共有されました。これらの作品でAIをトレーニングすることが、作品に含まれるすべての知識をオンラインでよりアクセスしやすくするという主張と対立するかもしれないとしても、コメント投稿者は、AIモデルは忘れられた作品からの「歪められ、検閲され、ペイウォールされたアイデアの断片」しか利用可能にしないだろうと示唆しました。 「たとえテクノロジーが好きでも、AIが文字通り本を食べて力を増していくという考えはかなりディストピア的だと認めざるを得ない」と、そのスレッドの別の誰かが言いました。一部の書籍販売業者は、すべてのテキストを保存する必要はないことに同意しているとBBCは報じています。しかし、スコットランドの書籍販売業者デレク・ウォーカーはBBCに対し、AI企業は、あまり惜しまれないであろう作品—例えば、技術的には希少であるかもしれないあまり知られていない学術書—と、現存する唯一の版かもしれないあまり知られていないアンティーク作品—を区別するよう努めるべきだと述べました。「もしそのようなものが、これほど長く生き残ってきたのに破壊のために購入されたとしたら、それははるかに重大な問題になるだろう」とウォーカーは言いました。 トレーニングデータを保護し、購入者としての身元を隠すサービスを利用しているAI企業にとって、大量購入について書籍販売業者と直接話し合うことにほとんど関心はないでしょう。書籍販売業者がモデルに供給する作品について意見を述べさせることは、たとえ貴重な初版がAIの進歩の名の下に破壊されたことが証明されたとしても、リスクが高いと思われる透明性のレベルを必要とするでしょう。 アシュリー・ベランガー シニアポリシーレポーター アシュリー・ベランガーは、Ars Technicaのシニアポリシーレポーターで、新しいポリシーとテクノロジーの社会的影響を追跡することに専念しています。彼女はシカゴを拠点とするジャーナリストで、20年の経験があります。 109 コメント