AI・機械学習
トークンはメーターにかけるには安すぎる
Tokens Too Cheap to Meter (jyn.dev)
要約
AIモデルの利用コストは、年々数桁ずつ低下しており、その勢いは衰える兆候を見せていません。今後1~2年で、LLMは製品としてだけでなく、インフラストラクチャとしてコンピューティングのあらゆる部分に統合される可能性が高いです。また、3~6年後には、現在の最先端品質のLLMが一般的なハードウェア上でローカル実行できるようになると予想されます。間もなく、AI利用の制限要因は、トークン数ではなく、品質とアクセスになるでしょう。
全文翻訳
目次
これは本当に起こっているのか?
すべてのAIに影響する改善
ホスト型AIに影響する改善
ローカルAIに影響する改善
特殊なユースケースに影響する改善
まとめ
これからどうなるか?
トークンはツール呼び出しよりも安くなる
供給側のジェボンズのパラドックス
投資家はどうやって元を取るのか?
需要側のジェボンズのパラドックス
オプション性
要約
機械学習知能を利用するコストは、年間数桁ずつ低下しており、その勢いは衰える兆候を見せていません。今後1~2年で、LLMは製品としてだけでなく、インフラストラクチャとしてコンピューティングのあらゆる部分に統合される可能性が高いです。今後3~6年で、現在の最先端品質のLLMが一般的なハードウェア上でローカル実行できるようになると予想されます。間もなく、AI利用の制限要因は、トークン数ではなく、品質とアクセスになるでしょう。
これは本当に起こっているのか?
並外れた主張には並外れた証拠が必要なので、私は多くの証拠を集めました。AIは、GPT-6 Astraのようなプロプライエタリ(専有)なものか、GLM-5.3-flashのようなオープンウェイトなものかのいずれかです。オープンウェイトモデルは、Z.aiのようなホスト型か、ローカル実行可能なものかのいずれかです。一般的に、ローカル実行を意図したモデルは、Muse GlimmerやQwen3 Coderのように、はるかに小さくなります。一方の改善が他方に常に影響するわけではありません。
すべてのAIに影響する改善
GPU
GPUは世代ごとに指数関数的に効率が向上しています。以下のグラフ(出典)では、X軸は時間、Y軸はGPU自体の電力効率です。Y軸の数値が大きいほど効率的です。これは対数グラフであり、グラフ上の直線は効率の指数関数的な増加を表します。この場合、対数は1.3であり、効率は約2年ごとに倍増することを意味します。これは、1960年代のムーアの法則以来見ていない効率の向上です。
モデル
モデルで特定のタスクを完了するためのコストは、時間とともに急激に低下しています。モデルは通常、トークンあたりで価格設定されます。「トークン」は単語の断片であり、単語を表すのに約1.5トークンかかります。モデルが読み取る各トークン、およびモデルが出力する各トークンに対して、「モデルプロバイダー」(例: AnthropicまたはOpenAI)は一定のお金を請求します。少なくとも最も賢い(「フロンティア」)モデルについては、トークンあたりのコストが一貫して低下しているわけではありません。しかし、タスクあたりのコストは低下しています。より小さなモデルはトークンあたりのコストが低いかもしれませんが、同じタスクに対してより多くのトークンを使用するため、より大きなモデルよりも全体的なコストが高くなる可能性があります。このセクションは、最初から最後までタスクを完了するためのコストについてです。以下のチャート(出典)は、現在のコスト/タスクの「パレートフロンティア」を示しています。パレートフロンティアは、単一のカテゴリで最良であるだけでなく、最良のトレードオフを示します。ここでは、トレードオフは次のとおりです。
Y軸: モデルの「品質」(一連のベンチマークで測定)
X軸: これらのベンチマークを完了するためのコスト
コストは対数スケールです。Y軸の値が大きく、X軸の値が小さいほど良いです。これは、2026年時点でのパレートフロンティア上の幅広いモデルを示しています。右上寄りにはClaude Fable-5.1(高価でインテリジェント)、中央左寄りにはGPT-5.6 Luna(安価でインテリジェントではない)があります。点線の下のモデルは基本的に考慮する価値がありません。
次に、2025年の初め、中間、終わりのフロンティアを示すこのチャートを見てください。
チャートは、2025年を通じてモデルがタスクあたりでより賢く、より安価になっていることを示しています。基本的にどのタスクでもY軸で水平線を描くと、2025年末のコストは開始時よりも安くなっていました。また、基本的にどのX軸のポイントでも垂直線を描くと、同じコストでより多くのことをモデルが行えるようになっています。次に、この2025年のチャートを2026年のチャートと比較してください。Y軸(インテリジェンス)はほぼ同じで、安価なエンドでの低下が少なくなっています。X軸(コスト)は2桁安くなっています。
推論エンジン
「推論エンジン」とは、トレーニング済みのモデルと入力テキストを受け取り、GPU上で実際に実行するソフトウェアパッケージです。推論エンジンは現在未熟であり、急速に改善されています。現在、どのエンジンを見るかによって、年間10%~50%の改善が見られます。推論エンジンの比較によく使われるベンチマークは2つあります。「オフライン」(大量のトークンを一度にバッチ処理する)と「サービング」(サーバーに予測不能なタイミングで入力が送信され、できるだけ早く応答を返す必要がある)です。サービングはオフライン推論よりもはるかに急速に効率化されています。以下のすべての数値は、サービングワークロードのものであり、オフラインのものではありません。
vLLM
vLLMはオープンソースの推論エンジンであり、時間とともに効率が向上しています。以下のグラフ(出典)では、Y軸はJoules/token、X軸はバッチサイズ(おおよそ:「どれだけの入力が並列処理されるか?」)、青/赤の線は異なるソフトウェアバージョンです。Y軸の数値が小さいほど効率的です。vLLM 0.11.1は2025年12月にリリースされました。これはvLLM 0.5.4(2024年9月)の1年強後です。言い換えれば、これは15ヶ月で約40%の効率向上です。複数のリリースにわたる効率のクリーンな比較はありませんが、vLLMだけでもパフォーマンスは急速に向上しており、v2からv3へのパフォーマンス向上は、エネルギー効率の改善とほぼ比例しています。
NVIDIA
これは単一のソフトウェアパッケージに限定されるものではありません。NVIDIAは、MLPerfスタックで2.0から2.1にかけて最大50%の効率向上を示しています。
Intel
これは古いベンチマークに限定されるものではありません。Intelは最近、MLPerfを6.0から6.1に改善しただけで2.4倍のスループット増加を示しました。これはスループットを示しており、効率ではないため、クリーンな比較ではありませんが、ハードウェアは固定されたままでソフトウェアが変更されているため、このかなりの部分が効率の向上に反映されている可能性が高いです。
ホスト型AIに影響する改善
Mixture-of-Experts
モデルは、初期のLLM構築方法よりも根本的に効率的なアーキテクチャを使用しています。初期のLLMは「密」モデルに基づいていました。これは、モデルのすべての部分が各入力に対して「アクティブ化」(行列乗算を実行)されることを意味します。最近のアーキテクチャは、「Mixture-of-Experts」(MoE)アーキテクチャを使用して、不要な場合に専門化された「エキスパート」レイヤーを非アクティブ化します。これにより、同じ品質の出力を得るための計算量が直接減少します。以下のグラフでは、モデルは7倍小さく(6Bから0.8Bパラメータ)なりながらも、ベンチマークで同等のパフォーマンスを達成しています(出典)。
これは、モデルの品質と比較して、コストとメモリ使用量が時間とともに減少することを示しています。もちろん、人々はこれに対して同じ品質の出力を得るために計算量を減らすのではなく、より良い出力を得るために同じ計算量を使用するため、トークン/ジュールあたりの効率はほぼ横ばいです。しかし、ジュールあたりの品質効率は急速に上昇しています。MoEはローカルマシンではそれほど役立たない傾向があることに注意してください。なぜなら、それらを使用するためにはエキスパートをメモリに保持する必要があるからです。mlx-flashのようなプロジェクトはレイヤーをオンデマンドでメモリにスワップしますが、それらは実行を可能にするだけで、高速にはしません。
ローカルAIに影響する改善
Mamba
現在、LLMをローカルで実行する際の制限の1つは、途方もない量のRAMが必要であり、それを購入できないことです。なぜなら、すべてのAI企業が先に購入してしまったからです。最近のモデルは、必要なRAMの量を5倍以上に減らしています。「従来の」モデルは「トランスフォーマー」アーキテクチャを使用しています。このアプローチでは、モデルは入力されたすべての入力を記憶します。これは、場合によっては数百キロバイトになり、各レイヤーに掛け合わされます。より最近のモデルは「Mamba」アーキテクチャを使用しており、モデルは入力のロスのある要約を記憶します。コーディングエージェントの「圧縮」に慣れているなら、Mambaはストリーミング...