HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

高次元統計学でビールを勝ち取る方法

How to win a beer with high-dimensional statistics (jamiesimon.io)

81 pointsby jamie-simon11 コメント

要約

本記事では、LLMの単語埋め込みが円環状の構造を持つという研究結果に対し、偶然によっても同様の幾何学的パターンが生成されうることを示しています。筆者は、統計的な制約が不十分な場合、低次元PCA空間でのパターン探索が誤解を招く可能性を指摘し、自動特徴抽出アルゴリズムやスケーラブルな解釈可能性の研究に示唆を与えています。

全文翻訳

長年のラボメイトで、今は学生/友人でもあるDhruva Karkadaが最近、データ統計に関する素晴らしい論文を書きました。その論文は、私が今まで見た中でも最も美しい科学的図の一つを含んでいたため、Twitterで当然のようにバイラルになりました。 例えば、語彙集 $\mathcal{V}$ に存在する単語の集まりがあるとします。ここでは、各単語を $d$ 次元ベクトルにマッピングするモデル $f: \mathcal{V} \rightarrow \mathbb{R}^d$ を研究しています。年の12ヶ月を $\{v_i\}_{i=1}^{12} = \{\texttt{January}, \texttt{February}, \ldots\}$ とし、対応する12個の埋め込みベクトル $\mathbf{w}_i = f(v_i)$ を計算し、2つのものを計算します。一つは、$\{ \mathbf{w}_i \}$ の上位2つのPCA方向への射影(左列)、もう一つは、$M_{ij} = \mathbf{w}_i^\top \mathbf{w}_j$ となるグラム行列 $\mathbf{M} \in \mathbb{R}^{12 \times 12}$ です(右列)。 この図の行を上から下に読むと、2、LLM埋め込みは円に射影され(Engels et al (2024) も同様の結果を確認)、グラム行列は近似的に巡回行列になることがわかります。これらの発見は、原始的なword2vec埋め込みでもかなり良く近似されます。そして、巡回グラム行列の解析理論は、非常に説得力のある一致を示します。これは、データ統計学を表現幾何学と結びつける、非常に単純な数学的理論であるため、大きな意味を持ちます。 針を探す この結果を何度も見て、しばらく見つめた後、私はこの美しい結果に穴を見つけたい気分になり、Dhruvaに、同じように円と巡回行列を形成する、一見無関係に見える他の単語のコレクションを見つけられると賭けました。彼(そして私が話したほとんどの他の人々)は、円が明らかに単語間の特別な関係から来ていると考えていたので、これはクレイジーだと思いました。 賭けの条件を決めました。私が選んだ10個のランダムに見える単語が、上記のプロットのようにword2vec埋め込みをプロットしたときに、明確で説得力のある円を形成しなければなりませんでした。なぜこれが可能だと思ったのか?さて、25000語の語彙集から選べます。これは、$inom{25000}{10} \approx 3 \times 10^{37}$ 個のセットを選択できることを意味します。ボードにダーツをその回数投げれば、少なくとも一度は確実に円ができるだろうと考えました。情報理論的に言えば、$\log_2 N \approx 124$ ビットの情報があり、その分解能でまともな10点円を作ることができるはずです。問題は、どのようにしてその干し草の山から10個の良い単語のセットを見つけるかということです。 私がそれをどのように行ったか:ランダムなセットのPCAプロットを見たところ、ランダムな選択でまともな円が得られる確率は $3^{-10}$ くらいだろうと推測しました。ランダム推測でも可能かもしれないと思いました。「円に見える」という目的関数を書き、数万個のランダムなセットを描画し、最良のものを選びました。それは際どいものでしたが、Dhruvaを完全に打ち負かすほどではありませんでした。 それを反復検索にアップグレードしました。各ステップで、最悪の点をドロップし、語彙集から最良の代替を選択します。これはかなりうまくいきました。また、目的を「PCAプロットで円に見える」から「ターゲットの巡回グラム行列に一致する」に変更しました。これは非常にうまく機能しました。埋め込みサイズ $d = 10000$ がこれに全く関与しなかったことに注意してください。これらすべては、コーディングエージェントを使って午後かけて行われました。 私が得た結果はこれです:これは円形です。ランダムに見える他の単語のセットを見つけて、円を形成させることができます!これに何か実際の意味があるのでしょうか?これは、「一人の人間がどうしてそんなに間違っていられるのか?」といった未解決の疑問を提起しますが、私はそれに答える資格がありません。しかし真面目な話:明らかに、偽の幾何学的パターンを見つけることができます。これは、表現幾何学の我々の理解を変えるべきでしょうか?まずいくつかの注意点を挙げます。 私の偽円セットのグラム行列は確かに美しく巡回的ですが、(正弦波状の)オフ対角成分の振幅は、月のものよりも小さいです。月のグラム行列に合わせることは、2倍の差でもできませんでした。これは10個のセットでは非常にうまく機能しますが、例えば50個のセットでは機能しないと思います(ただし、一生懸命試したわけではありません)。したがって、例えば1700年から2020年までのすべての年に関するDhruvaの他の幾何学的発見は、このように偽装することはできませんでした。 それにもかかわらず、それは、ある種の追跡マッチングスタイルの検索を特定の低次元PCA化された幾何学に対して行うと、ターゲットに十分な統計的制約がない限り、あなたを欺くことを示しています。これは、スケーラブルな解釈可能性のような研究課題に影響を与える、特定の自動特徴抽出アルゴリズムを排除します。 この説明が冗長に聞こえるなら、それは私の仕事が紛らわしいからです。↩ 注:物語の便宜上、行の順序を逆にしましたが、それは重要ではありません。↩