HN 日本語サマリー

← 一覧へ戻る
プログラミング

Fleet: マルチダイGPU向けメガカーネルのための階層的タスクベース抽象化

Fleet: Hierarchical Task-Based Abstraction for Megakernels on Multi-Die GPUs (arxiv.org)

8 pointsby matt_d1 コメント

要約

現代のGPUはマルチチップレット設計を採用していますが、既存のプログラミングモデル(CUDA/HIP)はチップレットレベルの局所性や同期を表現できないフラットな実行階層を提供しています。このミスマッチは、LLM推論のようなメモリバウンドなワークロードで冗長なメモリトラフィックとキャッシュ利用率の低下を引き起こします。本論文では、計算をメモリスコープにマッピングするマルチレベルタスクモデル「Fleet」を提案します。Fleetは、ワークとデータをチップレットにバインドし、その共有L2キャッシュを介した協調を可能にする「チップレットタスク」という新しい抽象化を導入します。これにより、チップレットレベルの局所性を活用し、メモリトラフィックを削減してパフォーマンスを向上させます。

全文翻訳

コンピュータサイエンス > ハードウェアアーキテクチャ arXiv:2604.15379 (cs) [2026年4月15日提出] タイトル: Fleet: マルチダイGPU向けメガカーネルのための階層的タスクベース抽象化 著者: Sangeeta Chowdhary, Ryan Swann, Sean Siddens, Muhammad Osama, Stephen Neuendorffer, Alexandru Dutu, Karthik Sangaiah, Sandeepa Bhuyan, Samuel Bayliss, Ganesh Dasika Sangeeta Chowdharyら9名の著者による論文「Fleet: Hierarchical Task-based Abstraction for Megakernels on Multi-Die GPUs」のPDFを表示する PDFを表示する HTML (実験的) 抽象: 現代のGPUは複数のプライベートキャッシュ階層を持つチップレットベースの設計を採用していますが、現在のプログラミングモデル(CUDA/HIP)は、チップレットレベルの局所性や同期を表現できないフラットな実行階層を公開しています。このミスマッチは、LLM推論のようなメモリバウンドなワークロードにおいて、冗長なメモリトラフィックとキャッシュ利用率の低下を引き起こします。私たちは、計算をメモリスコープにマッピングするマルチレベルタスクモデルであるFleetを提案します。Fleetは、ワークとデータをチップレットにバインドし、その共有L2キャッシュを介した協調を可能にする新しい抽象化であるChiplet-tasksを導入します。Wavefrontレベル、CUレベル、デバイスレベルのタスクは既存の抽象化と一致しますが、Chiplet-tasksはこれまで対処されてこなかった階層レベルを公開します。Fleetは、チップレットごとのスケジューリングを備えた永続的なカーネルランタイムとして実装されており、チップレット内のワーカーが協調的なキャッシュ再利用を実行できるようにします。Qwen3-8Bを搭載したAMD Instinct MI350で、Fleetは永続的なカーネル実行とチップレットごとのスケジューリングにより、バッチサイズ1〜8でvLLMよりも1.3〜1.5倍低いデコードレイテンシを達成します。バッチサイズが大きい場合、協調的な重みタイリングはL2ヒット率を向上させ(バッチサイズ32で12%から54%、バッチサイズ64で39%から61%)、HBMトラフィックを最大37%削減し、チップレットを意識しないメガカーネルベースラインと比較して1.27〜1.30倍のスピードアップを実現します。主題: ハードウェアアーキテクチャ (cs.AR) 引用: arXiv:2604.15379 [cs.AR] (またはこのバージョンの場合は arXiv:2604.15379v1 [cs.AR]) https://doi.org/10.48550/arXiv.2604.15379 フォーカスをさらに学習 arXiv発行のDOI (DataCite経由) 提出履歴 Sangeeta Chowdhary [メールを表示] [v1] 水曜日、2026年4月15日 21:49:03 UTC (68 KB) 全文リンク: 論文へのアクセス: Sangeeta Chowdharyら9名の著者による論文「Fleet: Hierarchical Task-based Abstraction for Megakernels on Multi-Die GPUs」のPDFを表示する PDFを表示する HTML (実験的) TeXソース ライセンスを表示 現在のブラウジングコンテキスト: cs.AR < 前 | 次 > 新規 | 最近 | 2026-04 のブラウジングに変更: cs 参考文献と引用 NASA ADS Google Scholar Semantic Scholar エクスポート BibTeX引用 ロード中... BibTeX形式の引用 × ロード中... 提供元データ: ブックマーク 参考文献ツール 参考文献・引用ツール 参考文献エクスプローラー 参考文献エクスプローラーを切り替える (エクスプローラーとは?) 関連論文 切り替える 関連論文 (関連論文とは?) Litmaps 切り替える Litmaps (Litmapsとは?) scite.ai 切り替える sciteスマート引用 (スマート引用とは?) コード、データ、メディア この記事に関連するコード、データ、メディア alphaXiv 切り替える alphaXiv (alphaXivとは?) コードへのリンク ペーパー用CatalyzeXコードファインダー (CatalyzeXとは?) DagsHub 切り替える DagsHub (DagsHubとは?) GotitPub 切り替える Gotit.pub (GotitPubとは?) Huggingface 切り替える Hugging Face (Hugging Faceとは?) ScienceCast 切り替える ScienceCast (ScienceCastとは?) デモ Replicate 切り替える Replicate (Replicateとは?) Spaces 切り替える Hugging Face Spaces (Spacesとは?) Spaces 切り替える TXYZ.AI (TXYZ.AIとは?) 関連論文 レコメンダーと検索ツール 影響力のある花へのリンク 影響力のある花 (影響力のある花とは?) COREレコメンダーを切り替える COREレコメンダー (COREレコメンダーとは?) 作者 会場 機関 トピック arXivLabsについて arXivLabs: コミュニティ協力者との実験的なプロジェクト arXivLabsは、協力者がarXivの新しい機能をウェブサイト上で直接開発・共有できるフレームワークです。arXivLabsと協力する個人および組織は、オープンさ、コミュニティ、卓越性、ユーザーデータプライバシーという私たちの価値観を受け入れ、支持しています。arXivはこれらの価値観にコミットしており、それらを遵守するパートナーのみと協力します。arXivコミュニティに価値をもたらすプロジェクトのアイデアがありますか?arXivLabsの詳細をご覧ください。この論文の著者のうち、推薦者は誰ですか?| MathJaxを無効にする (MathJaxとは?)