HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

TokenTown: LLMがどのように機能するかを視覚的に理解する方法

TokenTown: A visual way to understand how LLMs work (laurentiugabriel.github.io)

28 pointsby laurentiurad2 コメント

要約

TokenTownは、Transformer言語モデルの各ステージを都市の地区として視覚化したインタラクティブなウェブアプリケーションです。ユーザーは、トークン化、埋め込み、アテンションメカニズム、KVキャッシュ、そして最終的なトークン生成に至るまでのLLMの内部処理を、都市の景観とコンボイの移動を通して直感的に理解できます。このツールは、モデルの重みはランダムですが、処理メカニズムは実際の計算に基づいています。

全文翻訳

Passprefill Layer0 / 6 KV cache0 tokens Generated0 + − ⤢ × これは何ですか TokenTownは、アイソメトリックな都市で、各地区がTransformer言語モデルの1つのステージを表しています。コンボイが道路に沿って隠れ状態を運びます。それはドックでトークンに分割され、鋳造所でベクトル化され、位置情報が付与され、レイアリング(アテンション、残差、フィードフォワード、残差)をレイヤーごとに1回ずつ周回し、スタジアムで確率分布に変換され、サンプラーが1つのトークンを選択します。そのトークンがフィードバックハイウェイを逆方向に駆動し、都市全体が再び実行されます。 どれくらいリアルか ブラウザ上で実際に計算され、ライブで実行されます:トークナイザーの分割;埋め込みルックアップ;正弦波位置エンコーディング;LayerNorm;実際の成長するKVキャッシュに対するマルチヘッドスケーリングドット積アテンション(因果マスキング付き);残差加算;GELUフィードフォワード;そして温度/トップpサンプリング。トラックのバーは実際のベクトルです。倉庫の上のビームは実際のソフトマックスウェイトです。Prefillは実際にすべてのプロンプトトークンを一度に処理しますが、decodeは実際に1つだけを処理します。 スケールダウン:数千ではなく12次元、数十ではなく2つのアテンションヘッド、80ではなく2〜12のレイヤー、そして10万語ではなく数百語の語彙。 意図的に偽造:重みはランダムであり、ここでトレーニングされたものはありません。そのため、ランダムな重みを持つモデルはノイズを発するでしょう。出力を読みやすくするために、最終的なロジットは、実際の隠れ状態の投影と、小さな固定コーパスから構築されたバイグラム事前分布をブレンドします。アテンションスコアもシャープ化され、小さな最初のトークン(「シンク」)と最近性バイアスが付与されているため、マップはトレーニング済みモデルが実際に生成するパターンに見えます。 この都市が書くテキストを風景として扱い、メカニズムをレッスンとして扱ってください。 ペース配分 コンボイが地区に初めて到達したとき、その地区の説明を読むのに十分な時間停止します。説明する内容によって9秒から26秒かかります。パネルテキストの下の進行状況バーは、停止がどれくらい残っているかを示します。すべての地区が説明されると、都市は読み取り可能なペースではなく、視聴可能なペースで実行され、繰り返しレイヤーは同じ道路で異なる重みであるため、早送りされます。 スペースキーは任意の停止を無期限に保持し、Sは1ステージずつ進み、Speedスライダーはすべて(読み取り停止を含む)0.4倍から8倍までスケーリングします。リセット(⟲)はスローツアーを最初からやり直します。実行は、すでに読んだものを保持します。 コントロール スペースキー:再生/一時停止・S:1ステージ進む・R:リセットしてツアーをやり直す・F:カメラを追従する・L:ラベル ドラッグしてパン、スクロールしてズーム、地区をクリックして説明を表示します。ビューはコンボイに近くから始まり、それに沿って移動します。左側の⤢ボタン(またはマップのダブルクリック)で都市全体にズームアウトし、Followをオフにすると自由に探索できます。 PGSimCity(都市型のPostgreSQLモデル)のアイデアに触発されました。すべてのコード、アート、コピーはオリジナルです。