HN 日本語サマリー

← 一覧へ戻る
科学・技術

PDFの偽造は驚くほど稀である (2022年)

PDF Forgeries Are Surprisingly Rare (2022) (gwern.net)

15 pointsby 131712 コメント

要約

この記事は、オンライン上でPDF文書の改ざんや偽造が驚くほど少ない現状について論じています。画像や動画、Word文書などが容易に改変されるのに対し、PDFは編集が一般的でなく「書き捨て」フォーマットとして扱われるため、偽造が困難であると指摘しています。このため、PDFは比較的信頼性が高く、情報源の検証が容易であるという結論に至っています。

全文翻訳

オンライン上で詐欺の一種として目立つのが、改ざんされたり偽造されたりしたPDF文書の少なさです。人々は詐欺やプロパガンダのために悪意のある動画、写真、チャットログ、Microsoft Word文書を常に作成していますが、既存のPDFを編集することはありません。時折、私がGwern.netでホストしている論文について、「それは正規のジャーナルサイトのものではない!査読もされていない!ただのランダムなアホの個人サイトだ!信じられない!」と異議を唱える人がいます。 PDFが他の場所にも存在する(「ファイル」という概念を理解していないのだろうか?多くの若者はそれに苦労しているようだ。あるいは、著作権法を極端に遵守しようとして、PDFをコピーすることすら想像できないのだろうか?)という考えに困惑する aside として、これが実にうまく機能していることは興味深いです。オンラインには、しばしばPDF形式で、無能、詐欺、悪意が蔓延していますが、それは新しいPDFに限られます。私は、実際のPDFを編集してGoogle Scholarなどにアップロードして行われた詐欺を一つも思いつくことができませんし、誤記によって損をした経験もありません。 論文のタイトルを検索し、ダウンロードすれば、ほぼ100%の確率で期待通りのものを入手できると信頼できます。主な注意点としては、最終版ではなく、著者のドラフトやプレプリントをダウンロードしている可能性があることです(特に経済学では、論文が多くのプレプリントを経て、結果を大きく変えることがあり、最終的な出版にたどり着くまで10年かかることもあります)。そして、「トランプが2020年の米国大統領選挙に勝利した」と主張するような悪意のある内容を謳うPDFを見つけた場合、それは常に「新しい」PDFであり、公表されていない「ホワイトペーパー」などであることを率直に示しており、公表された論文であると偽ることはありません。あるいは、偽造または編集された文書であった場合、それは通常、Microsoft Wordなどのワードプロセッサからエクスポートされたものであることが明らかでした(例:時代錯誤なCalibriフォントの使用によって暴露された偽造)。 一方、例えばFacebook上の画像に対して、もしあなたがそれほどまでに認識論的に不注意であれば、フォトショップで加工されたり、実際とは異なるものだと主張されたり、「ディープフェイク」されたりした嘘の画像のフォルダでいっぱいになるでしょう。PDFの偽造は、それが非常に簡単にできるのに驚くほど稀です。有用な研究論文を見つけ、多くのPDFユーティリティのいずれかで編集し、どこかにアップロードし、人々がそれをコピーするのを待ちます(彼らはそうします)。そして、あなたのものを取り下げます。すると、あなたへのリンクなしで、完璧な犯罪として、権威ある査読付き研究論文がインターネット上に流通することになります。(あるいはもっと良いのは、Libgen/Sci-Hubに直接アップロードして、他の皆に再配布させることです。) 元の論文をチェックする人がどれほど少ないか、そしてWakefieldの自閉症/ワクチン研究のような撤回された研究やOperation Denver文書のような露骨なプロパガンダが、認識論的に怠惰な人々の間で無期限に流通することを考えると、それほど露骨でない偽造は、誰かが気づく前に長期間にわたって広く流通することができます。(PDFがまれに改ざんされる場合、それはすぐに技術的な泥沼と「彼が言った」「彼女が言った」という状況になり、実行するよりも証明するのに何桁も余分な労力が必要になります。Craig Wright事件で専門家が飛び越えなければならなかったハードル、あるいは単に家主が契約書を編集した場合(契約書はデジタル文書タイムスタンプサービスを通じて行われたものでした!)を考えてみてください。) そして、それを実行する熱狂的な人々や狂信者、悪意のある人々がいないわけではありません。歴史的に、写字生は常に文書を改ざんしていました(「孔子によって書かれた」とか「全く関係ないが、今、ユダヤ人のヨセフスである私が、イエス・キリストがいかに素晴らしかったかを語ろう」…)。 なぜあなたは私のウェブサイトのようなランダムなアホのウェブサイトからPDFをダウンロードできるのでしょうか?PDF用のPhotoshopがないからでしょうか?arXivのような場所はTeXソースを提供していますが、それはほとんどの潜在的な偽造者、狂信者、詐欺師にとって、まだ暗黒の技術です。PDFの編集が必ずしも難しいわけではありませんが、ほとんどの人にとってPDFの編集は通常のワークフローの一部ではありません。幼い子供でさえソーシャルメディアのために写真を編集しますが、大企業やデザイナー以外では、PDFは厳密には「書き捨て」フォーマットです。あなたの文書システムはソース文書をPDFにコンパイルし、あなたはPDFを編集することはなく、ソース文書のみを編集します。(これはプログラムのコンパイル済みバイナリにいくらか似ています。PDFは、印刷された文書がどのように見えるかに焦点を当てており、元のテキスト、ましてや構造を含んでいないことさえあります。生のバイナリコンピュータコードの理解と変更を専門とするハッカーがいるのと同様に、PDFの編集を専門とする人々もいますが、多くはいません。) これは、悪意のある人々を他のアプローチに追い込むには十分です。結局のところ、写真編集がうまくいったなら、なぜずっと難しいPDFの編集をわざわざするのでしょうか?ジョークにあるように、PDFは(ロシアの?)クマから逃げ回る必要はありません、ただ他のフォーマットより速く走ればいいのです。 [ブログインデックスに戻る] 類似リンク [トピック別の類似リンク]