HN 日本語サマリー

← 一覧へ戻る
インフラ・DevOps

8基のRTX PRO 6000を実用的に稼働させるためのガイド

A practical guide to running 8x RTX PRO 6000's (gpupartner.com)

17 pointsby Retell1529 コメント

要約

この記事は、8基のNVIDIA RTX PRO 6000 GPUを搭載したシステムで、高並列推論、モデルフリート、70Bモデルのファインチューニングといったワークロードを効率的に実行するための実践的なガイドです。PCIe Gen 5の制約を考慮しつつ、NVLinkのような高価なインターコネクトに頼らずとも、単一ノードで多数のモデルを同時に処理したり、大規模モデルのファインチューニングを行ったりする戦略が紹介されています。

全文翻訳

8基のRTX PRO 6000を実用的に稼働させるためのガイド 8基のRTX PRO 6000で並列処理を最大化:高同時実行推論、モデルフリート、70Bファインチューニング。 ジェリー・ジェームズ著 · 2026年8月30日 AMD EPYC 9555(64コア、128スレッド、Zen 5)とペアになった8基のNVIDIA RTX PRO 6000 Blackwellシステムを入手したとき、最初に尋ねた質問は単純でした。「これで何が実行できるのか?」 合計768GBのGDDR7 VRAMが利用可能であるため、Llama-3.1 405BやDeepSeek-R1 671Bのようなより大きなモデルを8枚のカードすべてにシャードできるかテストするのが最初の衝動でした。しかし、それはこの構成の、より高価なNVIDIAのデータセンターラインナップの兄弟機に適した仕事のように思えます。 その認識から、アーキテクチャを再考することになりました。 PCIeを介した深いモデル並列処理を強制するのではなく、NVIDIAのHGX B200/B300のような高価なシステムのわずかなコストで、パフォーマンスをそれほど犠牲にせずに処理できるワークロードを探求する方が理にかなっています。 TLDR: 8基のPCIe GPUに400B以上の巨大モデルを分割すると、レイテンシが大きくなるため、そのようなワークロードは除外されます。それはNVIDIAの巨大なサーバーラインナップの最高峰に任せましょう。このプラットフォームの強みは、より強力な競合製品に追いつく高密度並列実行です。 単一GPUサービング(TP=1)はコンピュートを最大化します:独立した単一GPUインスタンスを実行すると、カード間のバストラフィックが排除され、より効率的なコンピュート利用と最小限のトークン間レイテンシが実現されます。 前例のないKVキャッシュ密度:Qwen3.8-27B(FP8)のような中規模の密なモデルは、カードあたり約60GBの利用可能なVRAMをKVキャッシュに残し、カードあたり最大115万アクティブトークン(4kコンテキストでノードあたり約920万トークン)をサポートします。 マルチテナントモデルフリート:1つのノードで、24〜32の専門的な8Bマイクロサービスエンドポイント(または最大8つの専用32Bエンドポイント)、または8つの並列1080pビデオ拡散クリップを同時に処理できます。 オンプレミス70B以上のファインチューニング:768GB VRAM全体にモデル状態をシャードし、AdamWオプティマイザのモーメントをEPYC 9555のホストDDR5メモリにオフロードすることで、マルチノードクラウドクラスターなしでネイティブな70Bファインチューニングが可能になります。 1. インターコネクトの制約:PCIe Gen 5 vs. NVLink インターコネクト帯域幅とコレクティブレイテンシは、ワークロードがモデル並列処理または独立した同時実行によって効率的にスケーリングするかどうかを決定します。 インターコネクト | 単方向 | 双方向 | 相対的 | AllReduceレイテンシ | 価格 PCIe Gen 5 x16 | 64 GB/s | 128 GB/s | 1x (ベースライン) | 12-25 μs | $$ NVLink 4 (Hopper) | 450 GB/s | 900 GB/s | ~7x | 1.5-3.0 μs | $$$ NVLink 5 (Blackwell) | 900 GB/s | 1,800 GB/s | ~14x | 1.0-2.0 μs | $$$$ PCIe Gen 5 x16 単方向: 64 GB/s 双方向: 128 GB/s 相対的: 1x (ベースライン) AllReduceレイテンシ: 12-25 μs 価格: $$ NVLink 4 (Hopper) 単方向: 450 GB/s 双方向: 900 GB/s 相対的: ~7x AllReduceレイテンシ: 1.5-3.0 μs 価格: $$$ NVLink 5 (Blackwell) 単方向: 900 GB/s 双方向: 1,800 GB/s 相対的: ~14x AllReduceレイテンシ: 1.0-2.0 μs 価格: $$$$ PCIe 5.0を選択することには明らかに限界がありますが、NVLinkの利点と機能は、異常に高い価格タグも伴います。 これは、数百ギガバイト、あるいはテラバイトに及ぶ最先端モデルのトレーニングやサービングを行う際には避けられません。しかし、Blackwell GPUを昔ながらのPCIeスロットに接続すれば、はるかに低価格で、同時エージェントワークロードやその他の多くの処理をこなすことができます。 テンソル並列処理の様子:1つのモデルがGPUにシャードされ、インターコネクトを介して再結合されます。アニメーション:NVIDIA。 2. 推奨される並列処理戦略 では、このサーバーで400B以上の巨大なモノリシックモデルをシャードしない場合、他に何ができるのでしょうか?もちろん、非常に高い同時実行性のニーズに対応したり、さらに多くのことができます。 A. 単一GPUサービングの分離(TP=1、DP=8) 各RTX PRO 6000の96GB GDDR7容量は、Qwen3.8-27Bのような密な中規模アーキテクチャをマルチGPUシャードなしで単一カードに収容できます。これは、モデルと精度によって結果が変わることを意味します。 モデル | 重み | KV精度 | 利用可能VRAM | KV/トークン | 同時実行(4k) | 長コンテキスト Qwen3.8-27B | FP8 (~27 GB) | FP8 | ~59.4 GB | 32 KB | ~287 / カード (2,296 ノード) | 6-7x 256k または 13-14x 128k ストリーム Qwen3.8-27B | BF16 (~54 GB) | FP8 | ~32.4 GB | 32 KB | ~156 / カード (1,248 ノード) | 3-4x 256k または 7x 128k ストリーム Qwen3.8-27B | BF16 (~54 GB) | BF16 | ~32.4 GB | 64 KB | ~97 / カード (776 ノード) | 3-4x 128k ロスレスストリーム Llama-3.3 70B | FP8 (~70 GB) | FP8 | ~16.4 GB | 160 KB | ~25 / カード (200 ノード) | 1x 64k ストリーム Qwen3.8-27B | 重み: FP8 (~27 GB) | KV精度: FP8 | 利用可能VRAM: ~59.4 GB | KV/トークン: 32 KB | 同時実行(4k): ~287 / カード (2,296 ノード) | 長コンテキスト: 6-7x 256k または 13-14x 128k ストリーム Qwen3.8-27B | 重み: BF16 (~54 GB) | KV精度: FP8 | 利用可能VRAM: ~32.4 GB | KV/トークン: 32 KB | 同時実行(4k): ~156 / カード (1,248 ノード) | 長コンテキスト: 3-4x 256k または 7x 128k ストリーム Qwen3.8-27B | 重み: BF16 (~54 GB) | KV精度: BF16 | 利用可能VRAM: ~32.4 GB | KV/トークン: 64 KB | 同時実行(4k): ~97 / カード (776 ノード) | 長コンテキスト: 3-4x 128k ロスレスストリーム Llama-3.3 70B | 重み: FP8 (~70 GB) | KV精度: FP8 | 利用可能VRAM: ~16.4 GB | KV/トークン: 160 KB | 同時実行(4k): ~25 / カード (200 ノード) | 長コンテキスト: 1x 64k ストリーム B. マルチモデルマイクロサービスフリート(8B-32B) エンタープライズ推論ルーティングでは、各96GBカードは複数の小規模モデル(例:Llama-3.1 8B、Mistral Small、Qwen3 32B)またはディープコンティニュアスバッチ処理ワーカーをホストできます。この種の戦略では、数値は次のように分解されます。 フリート構成 | GPUあたりの割り当て | KVプール | KV/トークン | 同時実行(4k) | エンドポイント エンタープライズフィット | 専用8Bインスタンス | 1x 8Bモデル (~8 GB, FP8) | ~78.4 GB | 64 KB | 306 / カード (2,448 ノード) | 8つの専用モデル 高スループット単一タスクAPI | 3x 8Bモデルスタッキング | 3x 8Bモデル (~24 GB, FP8) | ~62.4 GB | 64 KB | 244 / カード (1,952 ノード) | 24の異なるエンドポイント(32Bモデル4つで最大32) マルチテナントマイクロサービスメッシュ | 中規模32Bモデル | 1x 32Bモデル (~32 GB, FP8) | ~54.4 GB | 128 KB | 106 / カード (848 ノード) | 8つの専門モデル 高度なコーディングと推論 専用8Bインスタンス | GPUあたりの割り当て: 1x 8Bモデル (~8 GB, FP8) | KVプール: ~78.4 GB | KV/トークン: 64 KB | 同時実行(4k): 306 / カード (2,448 ノード) | エンドポイント: 8つの専用モデル エンタープライズフィット | 高スループット単一タスクAPI | GPUあたりの割り当て: 3x 8Bモデル (~24 GB, FP8) | KVプール: ~62.4 GB | KV/トークン: 64 KB | 同時実行(4k): 244 / カード (1,952 ノード) | エンドポイント: 24の異なるエンドポイント(32Bモデル4つで最大32) エンタープライズフィット | マルチテナントマイクロサービスメッシュ | GPUあたりの割り当て: 1x 32Bモデル (~32 GB, FP8) | KVプール: ~54.4 GB | KV/トークン: 128 KB | 同時実行(4k): 106 / カード (848 ノード) | エンドポイント: 8つの専門モデル エンタープライズフィット | 高度なコーディングと推論 C. オーバーラップ通信によるシャードファインチューニング パラメータチューニング中、PyTorch FSDPやDeepSpeed ZeRO-3のようなフレームワークは、PCIe勾配のオールギャザーとリデューススキャッターをバックワードパスコンピュートとオーバーラップさせます。768GBの集約プール全体に状態をシャードすることで、70B以上のアーキテクチャのファインチューニングをサポートします。しかし、完全な70B AdamWファインチューニングには、CPUオフロード(12x 96GB DIMM経由で少なくとも1.15TBのホストRAMを必要とする約840GBのオプティマイザ状態)が必須です。GPUあたり64GB/sで転送する場合、集約された512GB/sのPCIe要求は、EPYC 9555の576-614GB/sのDDR5バスの約83-89%で動作するため、ホストメモリ帯域幅がPCIeと並んでボトルネックとなります。 チューニング方法 | VRAM/カード | ホストRAMの役割 | 同期ボトルネック | バッチサイズ | アンロック フル70Bファインチューニング | ~35 GB (シャード重み + グラデーション) | >= 1.15 TB (12x 96GB; ~840 GB AdamWオフロード) | カードあたり64 GB/s PCIe Gen 5 (512 GB/s 集約がホストDDR5と共ボトルネック) | マイクロバッチ 2-4 (8k コンテキスト) | 単一ノードでの70B以上のアーキテクチャに対する完全なパラメータ更新 ハイパースループットQLoRA | ~35 GB (DP下でレプリケートされた4ビットベース) | データセットステージングとキャッシング | 最小限のPCIeオーバーヘッド(アダプター勾配のみ交換) | グローバルバッチ 128-256 | グラデーションチェックポインティングペナルティなしでの迅速なドメイン適応 オンノードRLHF/DPOC | 768 GBプール内に共配置 | ローカルシステム調整 | マルチノードネットワークストールなし | アクター(vLLMロールアウト)+ クリティック/報酬モデルを1台のマシンに共ホスト | 完全な70Bファインチューニング フル70Bファインチューニング | VRAM/カード: ~35 GB (シャード重み + グラデーション) | ホストRAMの役割: >= 1.15 TB (12x 96GB; ~840 GB AdamWオフロード) | 同期ボトルネック: カードあたり64 GB/s PCIe Gen 5 (512 GB/s 集約がホストDDR5と共ボトルネック) | バッチサイズ: マイクロバッチ 2-4 (8k コンテキスト) | アンロック: 単一ノードでの70B以上のアーキテクチャに対する完全なパラメータ更新