HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Foundation Model Engineering: From Theory to Production

Foundation Model Engineering: From Theory to Production (sungeuns.github.io)

27 pointsby sungeuns3 コメント

要約

本書は、現代の基盤モデルがどのように機能するか、そのスタックがなぜそのように進化してきたのか、そしてそれらのアイデアが実際のシステムに遭遇したときにどのようなエンジニアリング上のトレードオフが生じるかを理解したい読者向けの技術的な教科書です。AIエンジニアや研究志向の読者が、表面的なAPI利用を超えて、アーキテクチャ、トレーニングパイプライン、推論システム、検索スタック、評価ループ、エージェントワークフローのより深いメンタルモデルを構築することを目指しています。歴史的な流れ、数学的なアイデア、システム制約が、アテンション、MoE、RLHF、マルチモーダル、ロングコンテキストサービング、RAG、エージェントといったトピックを一つのエンジニアリングの物語に結びつけて説明します。

全文翻訳

最終更新日: 2026-08-16 Foundation Model Engineering は、現代の基盤モデルが実際にどのように機能するか、なぜスタックがそのように進化してきたのか、そしてそれらのアイデアが実際のシステムに遭遇したときにどのようなエンジニアリング上のトレードオフが現れるのかを理解したい読者向けの技術的な教科書です。 このプロジェクトは、主にAIエンジニアや研究志向の読者を対象としており、表面的なAPI利用を超えて、アーキテクチャ、トレーニングパイプライン、推論システム、検索スタック、評価ループ、エージェントワークフローのより深いメンタルモデルを構築したいと考えています。 目標は、散在したヒントや孤立した定義を提供することではありません。目標は、アテンション、MoE、RLHF、マルチモーダル、ロングコンテキストサービング、RAG、エージェントといったトピックを、一つのエンジニアリングの物語に結びつける歴史的な流れ、数学的なアイデア、システム制約を説明することです。 なぜ読むのか なぜこの分野がRNNからTransformerへと移行したのか、なぜ一部のモデルは密で他は疎なのか、なぜ推論システムがKVキャッシュやバッチ処理にこれほどこだわるのか、あるいはなぜ評価とアライメントが単なる研究トピックではなく製品の問題なのか疑問に思ったことがあるなら、この本はそれらの点を結びつけるのに役立つはずです。 各トピックを孤立したトレンドとして扱うのではなく、モデリングのアイデア、システムの制約、製品要件が互いにどのように影響し合うかを示そうとしています。 その成果は、単なる用語の暗記ではありません。より優れたエンジニアリング判断です。 対象読者 AIエンジニア LLMシステム、推論スタック、RAGシステム、またはエージェント製品を構築または評価している読者。 研究志向の読者 現在のアーキテクチャやシステムのトレンドを含む、基盤モデルのランドスケープについて、広範かつ技術的に根拠のある理解を得たい読者。 期待できること 厳密な概念説明、概念中心のPyTorch例、理解を深めるための短いクイズ、そして直接操作することで理解しやすいトピックのためのインタラクティブなビジュアライザーが見つかるでしょう。 この資料は、単に用語を暗記するだけでなく、品質、メモリ、スループット、レイテンシ、スケーリング、アライメントのトレードオフについて推論するのに役立つように設計されています。 これは軽量な初心者向け入門書ではありません。AIの最初の概要やプロンプトエンジニアリングのみのガイドを探しているなら、この本は必要以上に濃密に感じられるでしょう。意図的に深さを求める読者のために書かれています。 生きたドキュメント AIは非常に急速に変化するため、新しい論文、システム、製品が登場するにつれて、このようなプロジェクトの詳細の一部は改訂が必要になる場合があります。 古いセクション、不 awkward な説明、タイプミス、またはより良い参照を見つけた場合は、いつでも貢献を歓迎します。 正確さ、教育法、例、ローカライズ、または全体的な明瞭さを改善するプルリクエストを歓迎します。 目標は、これを凍結されたスナップショットではなく、有用な長期リソースとして維持することです。 目次 1. 知能の進化 1.1 シンボリズム vs コネクショニズム 1.2 表現力の重要性 1.3 ディープラーニングパラダイム 1.4 ビターレッスン 2. シーケンスモデリング時代 2.1 マルコフ連鎖からRNNへ 2.2 勾配消失/爆発 2.3 アテンションの夜明け 2.4 NLPのためのCNN 3. Transformerの詳細 3.1 自己アテンションの数学 3.2 マルチヘッドアテンション(MHA) 3.3 位置エンコーディング戦略 3.4 レイヤー正規化と残差 3.5 複雑性分析 4. LLMアーキテクチャとパラダイム 4.1 エンコーダーのみ(BERTスタイル) 4.2 デコーダーのみ(GPTスタイル) 4.3 エンコーダー・デコーダー(T5/BART) 4.4 ハイブリッド&プレフィックスLM 4.5 様々なLLMアーキテクチャと最新トレンド 5. Mixture of Experts(MoE)のスケーリング 5.1 疎モデル vs 密モデル 5.2 ルーティングアルゴリズム 5.3 エキスパート並列処理 5.4 崩壊とロードバランシング 5.5 ケーススタディ 6. Foundation Modelの事前学習 6.1 大規模データエンジニアリング 6.2 トークン化科学 6.3 大規模トレーニングの安定性 6.4 インフラストラクチャ 6.5 事前学習のための合成データ 7. トレーニング最適化とシステム 7.1 データ並列処理(DP/DDP) 7.2 ZeRO(Zero Redundancy Optimizer) 7.3 モデル並列処理とパイプライン並列処理 7.4 Flash Attention 1, 2, 3 8. スケーリング則と計算最適性 8.1 パワーロー 8.2 Chinchilla最適性 8.3 過学習 vs 最適学習 8.4 転移学習と一般化 8.5 継続的な事前学習とドメイン適応 9. 事後学習:SFTとインストラクションチューニング 9.1 SFTの基礎 9.2 データセットの質 vs 量 9.3 パラメータ効率の良いファインチューニング(PEFT) 9.4 SFTとしてのプロンプトエンジニアリング 9.5 合成インストラクションと自己インストラクト 10. アライメント:RLHFと直接選好 10.1 人間フィードバックループ 10.2 PPO(Proximal Policy Optimization) 10.3 DPO(Direct Preference Optimization) 10.4 KTO & IPO 10.5 アライメント税 11. マルチモーダル学習 11.1 ビジョン・言語ブリッジ 11.2 音声・スピーチ統合 11.3 統一マルチモーダル(Any-to-Any) 11.4 画像拡散モデル 11.5 動画生成の基礎 11.6 商用動画モデルと将来の方向性 12. LLM推論最適化 12.1 KVキャッシュ管理 12.2 PagedAttention(vLLM) 12.3 連続バッチ処理 12.4 推測的デコーディング 12.5 ロングコンテキストサービング 12.6 サービングポリシー、SLO、フォールバック 13. モデル圧縮と量子化 13.1 PTQ vs QAT 13.2 量子化手法 13.3 重み疎化 13.4 知識蒸留 13.5 高度な量子化 14. RAG(Retrieval Augmented Generation) 14.1 語彙検索から意味検索へ 14.2 ベクトルインデックスとDBソリューション 14.3 高度な検索とリランキング 14.4 RAGオーケストレーション 14.5 GraphRAGとオントロジー 14.6 RAGの失敗モードと運用設計 15. 推論と検索時スケーリング 15.1 Chain of Thought(CoT) 15.2 Tree/Graph of Thoughts 15.3 検索時計算 15.4 検証者と報酬モデル 16. エージェントAIとツール 16.1 関数呼び出しとツール利用 16.2 自律エージェント 16.3 自己改善エージェント 16.4 マルチエージェント協調 16.5 エージェントの長期記憶 16.6 エージェントの信頼性、回復、ガードレール 17. AI評価とベンチマーク 17.1 学術ベンチマーク 17.2 LLM-as-a-Judge 17.3 Eloレーティングとリーダーボード 17.4 汚染問題 17.5 本番環境での評価とリリースゲート 17.6 商用モデルベンチマーク 18. AI安全性とアライメント研究 18.1 レッドチーミング 18.2 ジェイルブレイクと防御 18.3 ハルシネーション検出 18.4 スケーラブルな監視 19. LLMの解釈可能性と科学 19.1 機械的解釈可能性 19.2 Logit Lensとアテンション可視化 19.3 プローブ分類器 19.4 疎オートエンコーダー(SAE) 20. 次世代:SSM以降 20.1 状態空間モデル(SSM) 20.2 Mamba & S6 20.3 線形アテンション 20.4 プログラムとしてのニューラルネットワーク 20.5 マルチトークン予測 20.6 拡散ベースLLM 20.7 AGIとワールドモデルへの道