HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

1M/B/Tトークンに必要なGPUの数は?

How many GPUs is 1M/B/T tokens? (cedana.com)

5 pointsby kmavm0 コメント

要約

この記事は、AIモデルが100万、10億、1兆といった大量のトークンを処理するために必要なGPUリソースを計算するツールと、その計算方法について解説しています。Llama 3.3 70Bモデルで1ヶ月に1兆トークンを処理するには約367基のH100 GPUが必要であるという具体的な例を示し、計算の前提条件や感度分析についても詳述しています。

全文翻訳

トークン量 百万 10億 1兆 クワドリリオン 処理時間 1日 1ヶ月(30日) 1年(365日) モデル Llama 3.1 8B Llama 3.3 70B gpt-oss 120B (5.1B アクティブ) DeepSeek V4 Flash (13B アクティブ) MiniMax M3 428B DeepSeek R1 / V3 (37B アクティブ) GLM-5.3 (40B アクティブ) DeepSeek V4 Pro (49B アクティブ) カスタムモデル:: 70b 合計 / 70b アクティブ / 70 gb 重み / ref h100 / 中程度の信頼度 GPUタイプ モデルの参照GPU A100 V100 H100 B200 ヘッドライン、計算、感度図のGPUを設定します。すべてのGPUタイプはチャートに残ります。 トークンミックス すべての出力トークン(上限) チャット: 入力3対出力1 RAGまたはエージェント: 入力10対出力1 入力トークンは出力トークンよりもGPU時間が少なくて済みます。 平均利用率 50% インストール容量で割った平均負荷。トラフィックのピークと余剰容量により、100%未満になります。 高度な仮定 仮定 低 ベース 高 H100 tok/s B200 ÷ H100 A100 ÷ H100 V100 ÷ H100 入力コスト 最初の行は、参照タイプのGPU1基あたりの秒間出力トークン数(フルロード時)です。入力コストは、入力トークン1個あたりのGPU時間を出力トークン1個あたりの時間で割ったものです。 マルチGPU効率 参照GPUがモデルコピーを1つ保持し、他のGPUタイプが保持しない場合に適用されます。 デフォルトに戻す »» GPU数 367 H100 GPU / ベース 211 低 853 高 468x H100 ノード 1ヶ月(30日)で1兆トークンをLlama 3.3 70Bで処理するには、約367基のH100 GPUが必要です。信頼度は中程度です。 1 10 100 1k 10k シングルGPU A100 GPU、中程度の信頼度 815 436 1,966 102 V100 GPU、低信頼度、モデルコピーあたり3基 2,547 1,338 7,122 319 H100 GPU、中程度の信頼度 367 211 853 46 B200 GPU、中程度の信頼度 92 47 252 12 8 GPU搭載ノード 8x H100 ノード ノード、中程度の信頼度 46 27 107 78 8x B200 ノード ノード、中程度の信頼度 12 6 32 3 ベース推定値 妥当な範囲 ログスケール。 行を選択すると、その計算が表示されます。 モデルコピーは3基のV100 GPUを必要とします(77 GB対32 GB)。V100の結果は理論的なものとして扱ってください。 » 計算 計算機がH100の数を算出する方法 各ステップで1つの数量が変更されます。左から右に読みます。 01 開始 1兆 トークン(1ヶ月、30日) 02 ÷ 2,592,000 秒 385,802 トークン/秒(平均) 03 × 0.475 トークンミックスのため 183,256 出力換算トークン/秒 04 ÷ 50% 利用率 366,512 インストール容量あたりのトークン/秒 05 ÷ 1,000 tok/s 各H100あたり 367 H100 GPU gpus = tokens ÷ seconds × [output share + input share × input cost] ÷ utilization ÷ tok/s for each gpu » 感度 どの仮定がH100の結果を最も大きく動かすか 各バーは、1つの仮定が最良ケースから最悪ケースに移行したときのGPU数を示しています。他の仮定はベース値のままです。最も長いバーは、最初に測定すべき仮定です。 H100はこのモデルの速度 測定の不確実性 244 (1,500 tok/s) 814 (450 tok/s) 平均利用率 あなたの運用上の選択 229 (80%) 611 (30%) 入力トークンのコスト 測定の不確実性 251 (出力の0.1) 482 (出力の0.5) 測定の不確実性 あなたの運用上の選択 垂直線: ベース、丸め前の367 H100 GPU » GPUごとの詳細 GPU tok/s per GPU GPUあたりのトークン数(1日) コピーあたりのGPU数 低 ベース 高 8 GPUノード A100 450 0.93M 40.9 368 1,966 102 V100 144 3.10M 13.1 1,338 2,547 7,122 319 H100 1,000 9.05M 90.9 121 367 853 46 B200 4,000 36.79M 363.7 47 92 252 12 » モデルプリセットと証拠 参照速度は、GPU1基あたりの秒間トークン数で、低、ベース、高の値があります。「測定値」は、緩やかなターゲットと厳格なターゲットの両方のレイテンシで公開ベンチマークから得られています。「推定値」には直接的なベンチマークはありません。 モデル 合計 / アクティブ 重み 参照速度 B200 ÷ H100 基準 ソース Llama 3.1 8B 8B / 8B 8 GB H100: 3,000, 6,000, 12,500 2.3, 4, 6 推定。高値の測定ポイントが1つあり。 morph » Llama 3.3 70B 70B / 70B 70 GB H100: 450, 1,000, 1,500 2.3, 4, 6 H100とB200で測定。 inferencex » cerebrium » gpt-oss 120B 117B / 5.1B 65 GB H100: 740, 1,400, 2,600 6, 9, 12 H100とB200で測定。重みサイズは未検証。 inferencex » DeepSeek V4 Flash 284B / 13B 160 GB B200: 1,500, 4,000, 9,000 5, 9, 14 推定。ベンチマークは見つからず。アクティブパラメータからV4 Proとgpt-ossをスケーリング。 datacamp » MiniMax M3 428B 428B / n/a 428 GB H100: 157, 240, 537 3.5, 4.5, 5.3 H100とB200で測定。重みサイズは8ビットを想定。 inferencex » DeepSeek R1 / V3 671B / 37B 671 GB H100: 23, 75, 266 12, 16, 21 H100とB200で測定。重みサイズは8ビットを想定。 inferencex » GLM-5.3 753B / 40B 755 GB B200: 1,400, 3,000, 7,000 4, 8, 16 B200のみで測定。情報源は一致せず: GLM-5 at FP4は1,417から2,935、GLM-5.3は4,329から10,243。H100比は推定。 inferencex 5.3 » inferencex 5 fp4 » size » DeepSeek V4 Pro 1600B / 49B 865 GB B200: 468, 1,000, 2,800 6, 14, 21 B200のみで測定。H100比はDeepSeek R1から推定。 inferencex » size » » その他の仮定 仮定 値 基準 ソース A100 ÷ H100 0.35, 0.45, 0.60 H100は70BモデルでA100の1.8倍から2.9倍で測定 hyperstack » perplexity » V100 ÷ H100 0.10, 0.18, 0.25 仕様のみ: 125対312 TFLOPS、900対2,039 GB/s。LLMサービングベンチマークなし。 spheron » 入力コスト 0.1, 0.3, 0.5 4x H100(結果0.33)での128:128および2024:128実行から導出 e2e networks » GPUメモリ 32, 80, 80, 180 GB V100, A100, H100, B200。フィットチェックは重みサイズに10%を追加。 inferencex » 値は2026年10月2日に読み取られました。 » このモデルの限界 結果は計画上の推定値です。測定されたプリセットについては、各方向で2倍のエラーを予想してください。推定されたプリセットについては、それ以上のエラーを予想してください。購入前に、ご自身のハードウェアでモデルを測定してください。 速度はレイテンシターゲットによって変化します。各プリセットの低値と高値は、厳格なレイテンシターゲットと緩やかなレイテンシターゲットから来ています。 大規模なMixture-of-Expertsモデルでは、B200のH100に対するリードは4倍から21倍です。FP4サポートとメモリサイズが原因です。この比率はモデル固有です。 大規模モデルのA100およびV100の結果は理論的なものです。モデルコピー1つは、1つのノードに含まれるGPUよりも多くのGPUを必要とします。 V100の値には測定されたLLMサービングデータがありません。ハードウェア仕様に基づいています。 範囲は、ログ空間での二乗和平方根として独立したエラーを組み合わせています。統計的な信頼区間ではありません。 計算機には、プロンプトキャッシュ、スペキュラティブデコーディング、推論トークンオーバーヘッド、障害、またはリージョン重複は含まれていません。