AI・機械学習
LLMスタックを頭で理解する
Holding the LLM Stack in Your Head (thegustafson.com)
要約
このシリーズは、大規模言語モデル(LLM)の基盤となる数学的・計算論的要素から、Transformer、推論アルゴリズム、トレーニング、評価、エージェントループに至るまで、LLMスタック全体を包括的に解説します。各アークは特定のトピックに焦点を当て、読者がLLMの仕組みを深く理解できるよう、段階的に知識を提供します。
全文翻訳
10のアークすべて展開する
アーク01数学的・計算論的要件8投稿
01ベクトル、行列、およびそれらが存在する空間アクティベーションのリストとしてのベクトル、線形写像としての行列乗算、およびなぜすべてのニューラルネットワーク操作が行列乗算に帰着するのか。
02ノルム、内積、および類似性コサイン類似性、L2距離、および射影がどのように機能するか、そしてなぜそれらが注意スコアから埋め込み検索まであらゆる場所に出現するのか。
03分布、ソフトマックス、および単語の連鎖律ソフトマックス、カテゴリ分布、ベイズの定理、および確率の連鎖律 — 言語モデリングを明確な数学的問題にする4つのツール。
04クロスエントロピー、KLダイバージェンス、および損失関数が測定するものなぜクロスエントロピーが標準的なLM損失なのか、それが2つの分布について実際に何を測定するのか、そしてそれがパープレキシティとどのように関連するのか。
05勾配と機械が学習する方法勾配とは何か、なぜそれが上向きを指すのか、バックプロパゲーションが連鎖律を介してそれを効率的に計算する方法、そしてSGDがそれを使って何をするのか。
06オプティマイザー:モーメンタム、Adam、および学習率スケジューリングなぜバニラSGDは遅すぎるのか、Adamがパラメータごとにどのように適応するのか、そしてウォームアップとコサイン減衰がトレーニングダイナミクスをどのように形成するのか。
07GPU、浮動小数点、および精度が重要な理由IEEE 754、fp32/fp16/bfloat16の違い、混合精度トレーニングが機能する理由、およびGPU並列処理の基本。
08統計的NLPの短い前史ルールベースシステムから統計的MTおよび対数線形モデルを経てニューラルアプローチに至るまでの流れ。後続のすべてに歴史的文脈を提供する。
アーク02Transformer以前の言語モデリング7投稿
アーク03トークン化と入力パイプライン7投稿
アーク04Transformerの基本原理から9投稿
アーク05デコーディングと実際の推論アルゴリズム9投稿
アーク06推論エンジンとサービングシステム9投稿
アーク07トレーニングとトレーニング後10投稿
アーク08評価と科学的規律7投稿
アーク09検索、メモリ、およびコンテキストエンジニアリング9投稿
アーク10ツール、プロトコル、およびエージェントループ9投稿
どこから始めればよいかわからない場合
もし注意機構を理解したいなら
Transformerレイヤーがどのように機能するかを、形状を唱えるだけでなく、本当に理解するための最小限のパス。
1ベクトル、行列、およびそれらが存在する空間
2注意機構:Q、K、Vの基本原理から
3マルチヘッドアテンションと表現サブスペース
もし推論が遅い理由に関心があるなら
1行あたりの新しい行という洞察から始め、次にKVキャッシュとそれに基づいて構築されたシステムを追跡してください。
1プリフィル対デコード:推論の2つのフェーズ
2新しいトークンが1つの新しい行を意味する理由
3KVキャッシュの基本原理から
4PagedAttention:KVキャッシュの仮想メモリ
もしRAGで構築しているなら
エンジニアリングの決定が実際に意味をなすのに十分な検索理論。
1埋め込みのスクラッチ:Word2VecからE5まで
2チャンキング戦略
3リランカーとクロスエンコーダー
4RAGアーキテクチャのエンドツーエンド
もしエージェントを構築しているなら
ループ、プロトコル、トランスクリプトフォーマット、そしてモデルが実際に何を見るのか。
1エージェントの短い歴史:ReActから2026年まで
2関数呼び出しとしての構造化生成
3エージェントループ:モデル、ランタイム、ツール、再開
4MCP:ツールの統合のためのクロスシステム標準
このシリーズは完全な初稿です。校正、修正、そして時折の書き直しを行います。もし間違いを見つけたら、連絡先はこちらです。