科学・技術
Pseudpocalypse
Pseudpocalypse (dynomight.net)
要約
インターネット上に異なる名前で大量のテキストを投稿すると、そのテキスト自体を使って投稿者のアイデンティティをリンクできるという仮説が提示されています。これは、書き込みに残される統計的な「指紋」によって可能になると考えられており、将来的には匿名でのブログ執筆が困難になる「シュードポカリプス」と呼ばれる状況が到来する可能性が論じられています。
全文翻訳
dynomight · 2026年7月 · 数学に関する執筆活動
ある仮説を提示します。インターネット上に異なる名前でかなりの量のテキストを投稿した場合、そのテキストのみを使用して、それらのアイデンティティをリンクできるというものです。これは(私が推測するに)あなたが書くすべてのものに残される統計的な「指紋」のために可能です。誰かが書いたばかりの新しいテキストを貼り付けることができるウェブサイトを想像してみてください。そのウェブサイトは、その書き手が過去にどのような名前で公開したすべてのテキストへのリンクを提供します。それは完璧ではありませんが、かなり良いものです。私の知る限り、そのようなウェブサイトは存在しません—少なくとも公開インターネット上には。しかし、私はそれが可能であり、すぐに容易になると疑っています。これは、仮名のブログ執筆にいくらかの困難をもたらすでしょう。
注: このエッセイのほとんどは2025年半ばに書かれましたが、その後1年間、私があなたたちの誰も読まないであろう定理の記述をいじくり回すという愚かなことをしました。1 その間に、LLMはテキストから著者を推測するのがはるかに上手になりました。(この投稿の下書きの最初の1000語を与えられたら、Claude 4.8はそれが私であることを知っています。)それでも、私たちはまだ始まったばかりだと思います。私は、ますます少量のテキストから、ますますマイナーな作家が特定されるようになると予想しています。たとえ人々が異なるレジスターで書いたり、無関係な主題について書いたりしても、この作業は行われると予想しています。そして、私が仮名で書いたすべてのものが、まもなく私の本名とリンクされるようになると予想しています。2
より強力な仮説は、私たちが一種の汎用的なシュードポカリプスに向かっているということです。おそらく、将来、あなたが本質的にあらゆる高帯域幅チャネルを通じて世界とやり取りする場合、あなたは自分自身を特定することになります。たとえば、公共の場でマスクを着用し、声帯振動のみをサブボーカル化してボイスチェンジャーに入れるとします。それは問題ありません、あなたはあなたの体の形、歩き方、または化学的署名を使用して特定されるでしょう。あるいは、あなたの車があちこちで追跡されるのが好きではないとしましょう。だから、あなたは電話を持ち歩くのをやめ、法律家を説得してナンバープレートを禁止させるとします。問題ありません、あなたの車はまだ小さな傷やエンジンからのユニークなピンギング音を使用して追跡されるでしょう。あるいは、インターネット上で追跡されるのが好きではないとしましょう。だから、あなたはブラウザプロファイルをロックダウンし、Moneroのみで購入し、3つのVPNのチェーンを介して接続するとします。それはOKです。あなたはまだページをスクロールするときに指を動かす方法で特定されるでしょう。私たちは皆ユニークすぎ、情報理論的な限界が私たちを襲っています。
ビットの開始
最初の原則から始めましょう。出生時に、誰もがランダムなバイナリストリングを割り当てられると想像してください。インターネットに何かを投稿するたびに、その文字列で署名する必要があります。文字列が非常に短い場合、たとえば0110のような場合、他の多くの人があなたと同じ文字列を持つことになります。しかし、文字列が非常に長い場合、あなたの文字列はほぼ確実にユニークであり、すべての仮名をリンクすることは簡単でしょう。遷移点はどこですか?著者が現在生きていて、アングロ圏のどこかに住んでいることだけを知っている場合、それは約29ビットです。なぜなら、K桁の場合、2ᴷの可能なバイナリストリングがあり、K = 28.86の場合、2ᴷ ≈ 490,000,000は現在生きているアングロ圏の住民の数です。文字列が29ビット未満の場合、誰かがあなたと文字列を共有する可能性があります。29ビットより多い場合、あなたの文字列はほぼユニークです。
私たちはまだ(?)不変の政府発行の文字列で書いたものに署名する必要はありません。しかし、あなたが書く方法は、あなたのトーン、個性、言葉の選択などを通じて、あなたに関する多くの手がかりを提供します。理論的には、十分に書いた人のアイデンティティをリンクすることは可能であると私は考えています。再び、誰もが出生時にランダムなバイナリストリングを割り当てられると想像してください。しかし、あなたが書いたものにあなたの文字列で署名する必要がある代わりに、あなたが単語を書くたびに、あなたの文字列のランダムなビットが明らかにされ、あなたのメッセージに署名として追加される可能性があります。たとえば、ビット[129]=1という署名が追加され、位置129のあなたの文字列の値が1であることを示すとします。あなたの文字列を、あなたのすべての執筆スタイルの癖を表していると考えてください。ビットが明らかにされることは、あなたが好みを明らかにする何かを書くときを表すと考えてください。たとえば、ビット18は、あなたが句読点のないダッシュ—このように—またはスペースなし—このように—で書くことを好むかどうかを示すかもしれません。あなたがエミダッシュを使用する場合、そのビットが明らかにされます。
だから、あなたが仮名Aでたくさん書いたと想像してください。十分な量なので、完全なビット文字列が明らかにされました。おそらくそれは次のようになります:
仮名A: 110000001111001101110000100001 010100100101011110111001101000 100111110010101001101010111010
次に、仮名Bで書き始めるとします。最初は、どのビットも知られていません:
仮名B: ?????????????????????????????? ?????????????????????????????? ??????????????????????????????
しかし、ゆっくりと、あなたはいくつかのビットを漏らし始めます:
仮名B: ?????00???1????1????????1??0?? ?????01??1?????????11????01??? ???1??????1???10??????????????
そして最終的には、あなたは多くのビットを漏らすでしょう:
仮名B: ???0?00?1?11??110??1????10?0?? ?10?001?0101?11???11100?101??? ???11?1??010??10?1?01??011????
ここで、「攻撃者」の視点から、AとBが同じ人物であるかどうかを知りたいと考えてみましょう。彼らは上記のビットのみを見ており、他の人に関する情報は何も持っていないと仮定します。すると、攻撃者が知っていることは次のようになります:
AとBはK個の重複するビットを明らかにしました。それらはすべて一致しています。異なる人々は、任意の明らかにされたビットで一致する50%の確率を持っています。異なる人々ではない人々は、任意の明らかにされたビットで一致する100%の確率を持っています。他の人々は490,000,000人います。
直感的には、Kが5であれば、すべてのビットが一致するという事実はそれほど証明しないでしょう。なぜなら、4900万人の人々がいれば、偶然にこれらのビットで一致する多くの人々がいるからです。しかし、Kが70であれば、たとえそのような巨大なプールから始まっても、それらすべてに一致する2人の異なる人々がいる可能性は非常に低いでしょう。
N人の他の人々がランダムなビットを持っている場合、そしてあなたがあなたのビットからK個を選ぶ場合、それらすべてに一致する誰かが存在する確率は1 - (1-2⁻ᴷ)ᴺです。Nが490,000,000の場合、それは次のようになります:
見てください、29が再び現れました。(数学は素晴らしいと思いませんか?)一般に、遷移は約2ᴷ ≈ Nとなるビット数Kの周りで起こります。つまり、K = log₂(N)です。仮名Bで29ビットより大幅に少ないビットを明らかにすると、それらすべてに一致する他の誰かが存在する可能性はほぼ保証されます。しかし、29ビットより大幅に多いビットを明らかにすると、それらすべてに一致する他の誰かが存在する可能性はほとんどありません。
したがって、攻撃者は本質的にAとBが同じ人物であることを知っています。そして私は再び強調します:彼らは、他の4900万人の人々から何も見る必要なしにそれを知っています。
もちろん、私たちは文字通り、書くときに不変の特徴文字列のビットを漏らすわけではありません。しかし、モデルをより現実的にすることができます。そして、同じ問題が残ります。テキストが書き手に関するノイズの多い情報しか提供しないことを反映したい場合、ビットが明らかにされる前にビットにノイズを追加できます。一部の執筆スタイルが他のスタイルよりも一般的であることを反映したい場合、ビット文字列の分布を非一様にする可能性があります。特定の癖が他の癖よりも明白であることを反映したい場合、異なるビットに明らかにされる確率を異ならせることができます。これらすべてが数学をより複雑にします。しかし、基本的な結論は変わりません:あなたの執筆スタイルに少なくとも29ビットの情報が含まれており、十分な量の執筆を行えば、終わりです。
それが、シュードポカリプスが可能であるという私の議論です。しかし、私はそれが起こりうるという主張だけをしたいわけではありません。それはすぐに起こる可能性が高く、明らかにされるテキストの量はそれほど多くないと思います。その議論をするために、具体的にする必要があります:人々はどのような特徴を持っており、それが彼らの執筆に反映されていますか?それらの特徴はどれくらいのビットの情報を含んでいますか?それらのビットは、書かれたテキストからどれくらいの精度で推測できますか?
注:これが巨大な情報理論の講義にならないように、私は主に「ビット」のような言葉を使用します。