AI・機械学習
1M/B/Tトークンに必要なGPUの数は?
How many GPUs is 1M/B/T tokens? (cedana.com)
要約
この記事は、AIモデルが100万、10億、1兆といった大量のトークンを処理するために必要なGPUリソースを計算するツールと、その計算方法について解説しています。Llama 3.3 70Bモデルで1ヶ月に1兆トークンを処理するには約367基のH100 GPUが必要であるという具体的な例を示し、計算の前提条件や感度分析についても詳述しています。
全文翻訳
トークン量
百万
10億
1兆
クワドリリオン
処理時間
1日
1ヶ月(30日)
1年(365日)
モデル
Llama 3.1 8B
Llama 3.3 70B
gpt-oss 120B (5.1B アクティブ)
DeepSeek V4 Flash (13B アクティブ)
MiniMax M3 428B
DeepSeek R1 / V3 (37B アクティブ)
GLM-5.3 (40B アクティブ)
DeepSeek V4 Pro (49B アクティブ)
カスタムモデル:: 70b 合計 / 70b アクティブ / 70 gb 重み / ref h100 / 中程度の信頼度
GPUタイプ
モデルの参照GPU
A100
V100
H100
B200
ヘッドライン、計算、感度図のGPUを設定します。すべてのGPUタイプはチャートに残ります。
トークンミックス
すべての出力トークン(上限)
チャット: 入力3対出力1
RAGまたはエージェント: 入力10対出力1
入力トークンは出力トークンよりもGPU時間が少なくて済みます。
平均利用率 50%
インストール容量で割った平均負荷。トラフィックのピークと余剰容量により、100%未満になります。
高度な仮定
仮定
低
ベース
高
H100 tok/s
B200 ÷ H100
A100 ÷ H100
V100 ÷ H100
入力コスト
最初の行は、参照タイプのGPU1基あたりの秒間出力トークン数(フルロード時)です。入力コストは、入力トークン1個あたりのGPU時間を出力トークン1個あたりの時間で割ったものです。
マルチGPU効率
参照GPUがモデルコピーを1つ保持し、他のGPUタイプが保持しない場合に適用されます。
デフォルトに戻す »»
GPU数
367 H100 GPU / ベース
211 低
853 高
468x H100 ノード
1ヶ月(30日)で1兆トークンをLlama 3.3 70Bで処理するには、約367基のH100 GPUが必要です。信頼度は中程度です。
1
10
100
1k
10k
シングルGPU
A100
GPU、中程度の信頼度
815
436
1,966
102
V100
GPU、低信頼度、モデルコピーあたり3基
2,547
1,338
7,122
319
H100
GPU、中程度の信頼度
367
211
853
46
B200
GPU、中程度の信頼度
92
47
252
12
8 GPU搭載ノード
8x H100 ノード
ノード、中程度の信頼度
46
27
107
78
8x B200 ノード
ノード、中程度の信頼度
12
6
32
3
ベース推定値
妥当な範囲
ログスケール。
行を選択すると、その計算が表示されます。
モデルコピーは3基のV100 GPUを必要とします(77 GB対32 GB)。V100の結果は理論的なものとして扱ってください。
» 計算
計算機がH100の数を算出する方法
各ステップで1つの数量が変更されます。左から右に読みます。
01
開始
1兆
トークン(1ヶ月、30日)
02
÷ 2,592,000 秒
385,802
トークン/秒(平均)
03
× 0.475 トークンミックスのため
183,256
出力換算トークン/秒
04
÷ 50% 利用率
366,512
インストール容量あたりのトークン/秒
05
÷ 1,000 tok/s 各H100あたり
367
H100 GPU
gpus = tokens ÷ seconds × [output share + input share × input cost] ÷ utilization ÷ tok/s for each gpu
» 感度
どの仮定がH100の結果を最も大きく動かすか
各バーは、1つの仮定が最良ケースから最悪ケースに移行したときのGPU数を示しています。他の仮定はベース値のままです。最も長いバーは、最初に測定すべき仮定です。
H100はこのモデルの速度
測定の不確実性
244 (1,500 tok/s)
814 (450 tok/s)
平均利用率
あなたの運用上の選択
229 (80%)
611 (30%)
入力トークンのコスト
測定の不確実性
251 (出力の0.1)
482 (出力の0.5)
測定の不確実性
あなたの運用上の選択
垂直線: ベース、丸め前の367 H100 GPU
» GPUごとの詳細
GPU
tok/s per GPU
GPUあたりのトークン数(1日)
コピーあたりのGPU数
低
ベース
高
8 GPUノード
A100
450
0.93M
40.9
368
1,966
102
V100
144
3.10M
13.1
1,338
2,547
7,122
319
H100
1,000
9.05M
90.9
121
367
853
46
B200
4,000
36.79M
363.7
47
92
252
12
» モデルプリセットと証拠
参照速度は、GPU1基あたりの秒間トークン数で、低、ベース、高の値があります。「測定値」は、緩やかなターゲットと厳格なターゲットの両方のレイテンシで公開ベンチマークから得られています。「推定値」には直接的なベンチマークはありません。
モデル
合計 / アクティブ
重み
参照速度
B200 ÷ H100
基準
ソース
Llama 3.1 8B
8B / 8B
8 GB
H100: 3,000, 6,000, 12,500
2.3, 4, 6
推定。高値の測定ポイントが1つあり。
morph »
Llama 3.3 70B
70B / 70B
70 GB
H100: 450, 1,000, 1,500
2.3, 4, 6
H100とB200で測定。
inferencex »
cerebrium »
gpt-oss 120B
117B / 5.1B
65 GB
H100: 740, 1,400, 2,600
6, 9, 12
H100とB200で測定。重みサイズは未検証。
inferencex »
DeepSeek V4 Flash
284B / 13B
160 GB
B200: 1,500, 4,000, 9,000
5, 9, 14
推定。ベンチマークは見つからず。アクティブパラメータからV4 Proとgpt-ossをスケーリング。
datacamp »
MiniMax M3 428B
428B / n/a
428 GB
H100: 157, 240, 537
3.5, 4.5, 5.3
H100とB200で測定。重みサイズは8ビットを想定。
inferencex »
DeepSeek R1 / V3
671B / 37B
671 GB
H100: 23, 75, 266
12, 16, 21
H100とB200で測定。重みサイズは8ビットを想定。
inferencex »
GLM-5.3
753B / 40B
755 GB
B200: 1,400, 3,000, 7,000
4, 8, 16
B200のみで測定。情報源は一致せず: GLM-5 at FP4は1,417から2,935、GLM-5.3は4,329から10,243。H100比は推定。
inferencex 5.3 »
inferencex 5 fp4 »
size »
DeepSeek V4 Pro
1600B / 49B
865 GB
B200: 468, 1,000, 2,800
6, 14, 21
B200のみで測定。H100比はDeepSeek R1から推定。
inferencex »
size »
» その他の仮定
仮定
値
基準
ソース
A100 ÷ H100
0.35, 0.45, 0.60
H100は70BモデルでA100の1.8倍から2.9倍で測定
hyperstack »
perplexity »
V100 ÷ H100
0.10, 0.18, 0.25
仕様のみ: 125対312 TFLOPS、900対2,039 GB/s。LLMサービングベンチマークなし。
spheron »
入力コスト
0.1, 0.3, 0.5
4x H100(結果0.33)での128:128および2024:128実行から導出
e2e networks »
GPUメモリ
32, 80, 80, 180 GB
V100, A100, H100, B200。フィットチェックは重みサイズに10%を追加。
inferencex »
値は2026年10月2日に読み取られました。
» このモデルの限界
結果は計画上の推定値です。測定されたプリセットについては、各方向で2倍のエラーを予想してください。推定されたプリセットについては、それ以上のエラーを予想してください。購入前に、ご自身のハードウェアでモデルを測定してください。
速度はレイテンシターゲットによって変化します。各プリセットの低値と高値は、厳格なレイテンシターゲットと緩やかなレイテンシターゲットから来ています。
大規模なMixture-of-Expertsモデルでは、B200のH100に対するリードは4倍から21倍です。FP4サポートとメモリサイズが原因です。この比率はモデル固有です。
大規模モデルのA100およびV100の結果は理論的なものです。モデルコピー1つは、1つのノードに含まれるGPUよりも多くのGPUを必要とします。
V100の値には測定されたLLMサービングデータがありません。ハードウェア仕様に基づいています。
範囲は、ログ空間での二乗和平方根として独立したエラーを組み合わせています。統計的な信頼区間ではありません。
計算機には、プロンプトキャッシュ、スペキュラティブデコーディング、推論トークンオーバーヘッド、障害、またはリージョン重複は含まれていません。