AI・機械学習
AIが毎秒100万トークンで動作したら?
What if AI worked at 1.000.000 tokens per seconds? (echohive.ai)
要約
この記事は、AIモデルが毎秒100万トークンという驚異的な速度で動作した場合の思考実験を提示しています。これは現在のモデルの測定値ではなく、コンテキスト容量、入力処理、集計スループット、単一エージェント出力という4つの側面から「100万トークン/秒」の意味を掘り下げています。高速な生成能力が、テストや検証といった後続のプロセスにおけるボトルネックを浮き彫りにし、最終的には「判断」の価値が高まることを示唆しています。
全文翻訳
▶想像上の未来を推進する6:56 · サウンドオン · 英語字幕あり
毎秒100万トークン
ナレーションと音楽付きのオリジナルアニメーション映画。
再生するには画像をクリックしてください。
これは思考実験であり、現在のモデルの測定値ではありません。
以下の読み取り版には、2つのインタラクティブな計算機が追加されています。
読んで探求する方が良いですか? ↓
01 / 数字の意味
「毎秒100万」は4つの意味を持ち得ます。
コンテキスト容量
どれだけ収まるか
モデルが1回の要求で保持できるテキストの量(応答を含む)。速度ではなくサイズです。
入力処理
どれだけ速く読み取るか
プロンプトトークンは、大部分が並列で処理できます。巨大な入力にはまだ時間がかかり、入力レートは出力レートとは異なります。
集計スループット
システムがどれだけ提供するか
10,000ストリーム × 100トークン/秒 = 合計1,000,000トークン/秒。
単純計算:個々のストリームがいつ終了するかについては何も述べていません。
単一エージェント出力・私たちのダイヤル
1人のエージェントがどれだけ速く書くか
1人のエージェントが毎秒100万トークンを書く。
標準的な生成では、各トークンは前のトークンに依存します。
例えば、AnthropicのClaude Opus 5.5の概要には、1Mトークンのコンテキストウィンドウ、リクエストあたりの出力キャップははるかに小さく、「中程度」の比較レイテンシーがリストされています。
メモリサイズは書き込み速度ではなく、100万トークンの応答が1回の要求に収まることを意味しません。
エンジニアリングは、限界内で役立ちます。
サービスは、2023年のvLLM論文で説明されているように、多くのリクエストをバッチ処理することで大きな合計に達し、投機的デコーディングは一度に複数のドラフトトークンを受け入れることができます。
どちらも、ステップ2がステップ1の結果を必要とする実際の連鎖を取り除くものではありません。
トークンはテキストの断片であり、しばしば単語の一部であるため、トークン数は単語数ではありません。
試してみる/想像上のダイヤル
ダイヤルを回します。
ワークロードを選択し、想像上の速度を100から1,000,000トークン/秒にスライドさせます。
1,000の物語の結末
40のアプリドラフト
10,000の批評された候補
10,000のリハーサル
1人のエージェントの想像上の速度
1,000,000トークン/秒
100
1K
10K
100K
1M
出力トークン
1,000,000
1,000の物語の結末 × 1,000トークンずつ
書き込みのみ
1秒
毎秒1,000,000トークンで
書き込み時間
1秒
1分
1時間
1日
毎秒1,000,000トークンで、1,000の物語の結末(1,000,000出力トークン)は、書き込みに約1秒かかります。
両端のすべての4つの予算 + 書き込みのみの時間(例示的な速度であり、測定値ではありません)。
ワークロード
出力トークン
100トークン/秒
1,000,000トークン/秒
1,000の物語の結末 × 1,000
1,000,000
2時間46分40秒
1秒
40のアプリドラフト × 20,000
800,000
2時間13分20秒
0.8秒
10,000の批評された候補 × 300
3,000,000
8時間20分
3秒
10,000のリハーサル × 1,000
10,000,000
27時間46分40秒
10秒
想像上の比較であり、モデルの測定値ではありません。
時間は生成された出力のみをカウントします:読み取り、ランキング、ツール呼び出し、権限、テスト、デプロイ、人、または実験は含まれません。
予算は書き込みの割り当てであり、完成した製品ではありません。
並列ストリームは、これらの独立したジョブも加速できます。しかし、各ドラフトは独自のストリームで時間を要します:集計スループットが完了時間を一致させるわけではありません。
02 / 4つの思考実験
安価なドラフトは難しい部分を動かします。
各予算は書き込み出力のみをカウントします。どれも完成した製品、検証された発見、または実際の成果ではありません。
可能な結末のマップ
1,000 × 1,000 = 1,000,000トークン・書き込み1秒
物語の結末を求め、千通り(希望に満ちた、暗い、奇妙な)を得る。
誰も千通りを読むことはないので、有用なバージョンはそれらを探索するためにマッピングし、あなたが好きな2つをブレンドします。
まだ希少:味。
どの結末があなたのものであるかは、あなただけが知っています。
近所のツールライブラリのためのソフトウェア
40 × 20,000 = 800,000トークン・書き込み0.8秒
共有ツールの貸し出しアプリを説明すると、あなたが文を終える前に40のドラフトが存在します。
画面は、はしごを借りることから修理日のサインアップまで適応する可能性があります。
テストは依然として独自のクロックで実行され、7日間の返却期限をチェックするものがなければ、40すべてが合格する可能性がありますが、はしごを70日間貸し出します。
まだ希少:明確な仕様、そして「機能する」ことのテスト。
1万のアイデアから10の実際の実験
10,000 × 300 = 3,000,000トークン・書き込み3秒
より良い触媒を探していますか?
エージェントは1万の候補を提案し、批評することができます。
その後、すべてがベンチで待機します:反応は数時間、培養は数日、フィールドトライアルは1シーズンかかるかもしれません。
1つのモデルからのアイデアも、同じ盲点を持つ可能性があります。
まだ希少:物理的な証拠、そしてどの10の実験が実験室時間を獲得するかの選択。
難しい会話のリハーサル
10,000 × 1,000 = 10,000,000トークン・書き込み10秒
家主とリースについて話す前に、エージェントは会話を1万通り演じることができます:頑固な家主、寛大な家主、疲れているあなた。
練習と盲点のフライトシミュレーターのように使用してください。
間違った人物の1万回の練習は、自信のある間違いであり、予言ではありません。
まだ希少:実際の人物への忠実さ、そしてあなた自身の練習。
03 / シリアルボトルネック
毎秒10,000倍の書き込み速度は、毎秒10,000倍の作業速度ではありません。
40のアプリドラフトを取り上げます:800,000出力トークン。
例示的な毎秒100トークンと想像上の100万トークンを比較し、書き込み後に1つの固定チェック(テスト実行など)を追加します。
チェックなし
1分間のテスト実行
15分間のレビュー
1日
書き込み後の固定チェック
60秒
01分
1時間
1日
例示的な100トークン/秒
2時間14分20秒
書き込み 99.3% ・ チェック 0.7%
想像上の1,000,000トークン/秒
60.8秒
書き込み 1.3% ・ チェック 98.7%
書き込み
固定チェック
各バーは、その合計がどこに行くかを示しています。
書き込み速度向上
10,000倍
1,000,000 ÷ 100トークン/秒
エンドツーエンド速度向上
132.57倍
8,060 ÷ 60.8秒
60秒のチェックを伴う場合、バッチは100トークン/秒で2時間14分20秒、1,000,000トークン/秒で60.8秒かかります。
これはエンドツーエンドで132.57倍高速であり、チェックは高速な合計の98.7%を占めます。
同じ800,000トークンで、4つのチェック時間+
合計時間 = 書き込み + 1回の固定チェック、バッチごとに1回カウント(ドラフトごとではない)、書き込み終了後。
並列テスト、コスト、エネルギー、またはドラフト品質をシミュレートしません。
1分間のチェックでは、ジョブは8,060から60.8秒に低下します:10,000倍ではなく、約132.57倍高速です。
ゼロでは完全な10,000倍が返され、1日ではその増加はほぼ消滅します。
あなたがスピードアップしないものはすべて、残りの時間のほぼすべてになります。これはアムダールの法則の論理です。
実際の要求にはさらに多くのステップがあります:OpenAIのレイテンシーガイドは、非常に大きなプロンプト、ツール呼び出し、ネットワークトリップも遅延を追加すると指摘しています。
04 / 何が貴重になるか
生成が安価になると、判断が貴重になります。
多くのドラフト、1つの狭いゲート
概念図。左側にある広大なドラフトカードのグリッドが狭いゲートに向かって流れていく。1枚のカードが通過し、選択されたとマークされる。
これは議論を例示しており、データではありません。
概念図、データではない:生成は選択肢を広げ、判断は通過するものを決定します。
上記のすべての実験は同じ場所に終わります。
まだ希少なのは、さまざまな帽子をかぶった判断です:
味
どの選択肢があなたのものであるか。
仕様とテスト
「機能する」とはどういう意味か。
練習
スピードはそれをあなたに教えてくれません。
物理的証拠
世界は自身のペースで答えます。
忠実さ
シミュレーションは、そのモデルが良いほど良い。
コストとエネルギー
これらは実行する価値があるのか?
高速であることは安価であることを意味しません:すべてのトークンは、誰かが支払って動かすハードウェアで実行されます。
より多くの選択肢が良いものを保証するわけでもありません。
1つのモデルと1セットの仮定からのドラフトは相関しているか、すべて間違っている可能性があります。
ボリュームは出力を測定しますが、理解を測定するわけではありません。
05 / 今週使用する
さらに要求する前に、どのように選択するかを決定してください。
想像上のダイヤルは必要ありません。
次にAIエージェントに作業を依頼するときは:
「完了」が何を意味するかを書き留めてください。
「ローンを処理する」ではなく、「はしごは7日以内に返却される」のような、テスト可能な1つの文を設定基準としてください。
読み取る前に基準を設定してください。