AI・機械学習
2026年の推論ハードウェア革命
The Inference Hardware Revolution of 2026 (spectrum.ieee.org)
要約
2026年は、AIのトレーニングから推論へと焦点が移る「推論ハードウェア革命」の年になると予測されています。LLMの普及と高度化により、推論の需要が爆発的に増加しており、Nvidia、Amazon、Cerebras、Groqなどの企業が、この新たな需要に対応するための革新的なハードウェアソリューションを開発・展開しています。このシフトは、従来のGPU中心のアーキテクチャから、より多様で特化した推論アクセラレータへの移行を促しています。
全文翻訳
AI推論革命は今日ここにあります。今日のクエリの津波がハードウェアメーカーにピボットを強いています。TensordyneのNapierチップはAI推論を高速化するように設計されています。Tensordyne DarkBlue1約2020年以来、AIは主に、より大きく、より優れたモデルのトレーニングに焦点を当ててきました。大規模言語モデル(LLM)は、数百万パラメータから数兆パラメータへと膨張しました。これは効果的であることが証明されました。OpenAIのGPT-3の最大バージョンは、2020年にリリースされ、人気のある知識・推論ベンチマークで質問の43.9パーセントしか正しく答えられませんでした。わずか4年後、GPT-4oは同じ試験で88.7パーセントのスコアに達し、人間の専門家のスコアに実質的に匹敵しました。高度なAIラボは依然としてさらに大きなモデルをトレーニングしていますが、そのトレーニングはAI会話の背景にやや後退しています。2026年には、トレーニングされたモデルを使用してコードを生成したり、エッセイを書いたり、私たち自身のエルフの画像を生成したりする推論が前面に出てきました。「トレーニングは過去のニュースのようなものです」と、Moor Insights & StrategyのプリンシパルデータセンターアナリストであるMatt Kimball氏は述べています。「最高情報責任者(CIO)が話したいのは推論のことだけです。」NvidiaのCEOであるJensen Huang氏は、同社のGTC 2026カンファレンスで、この変化を「推論の転換点」と称賛しました。このシフトを引き起こした要因の一部は非常に単純です。LLMは有用になりつつあり、人々はそれを使用しています。それに加えて、今日市場に出回っている多くのモデルは推論モデルです。ユーザーのクエリに応答して、それらは推論を一度だけでなく複数回実行し、思考連鎖と呼ばれるプロセスで自己再プロンプトします。推論モデルはより長い出力を生成し、高い推論努力を持つモデルは、低いまたはない努力を持つモデルの最大20倍のテキストを生成できます。エージェント型AIの台頭により、推論はユーザーのクエリへのリアルタイム応答としてだけでなく、ユーザー定義の目標に向けて自律的に作業する、24時間体制で実行されるようになり、世界の推論ワークロードにさらに追加されています。AmazonのTrainiumチップは、元々AIトレーニング用に設計されていました。しかし、Amazon Web ServicesはAI推論を2つの部分に分割することを選択し、Trainiumがより計算負荷の高い部分を実行し、Cerebrasのウェーハスケールエンジンがよりメモリ集約的な部分を引き受けました。Amazonその結果、推論需要の爆発的な増加は、テクノロジー大手間の予期せぬ同盟につながりました。OpenAIとAmazonは、Amazonが独自のTrainiumチップを持っているにもかかわらず、Cerebrasが設計した大皿サイズのチップを展開しました。Nvidiaは、200億ドル相当の物議を醸した取引で、AI推論スタートアップGroqから主要な人材と知的財産を購入しました。そしてAnthropicは、LLM競合他社であるSpaceXAIに、余剰コンピュートをリースするために月額10億ドル以上を支払っています。それらは似ているように見えるかもしれませんが、AIトレーニングとAI推論は計算上異なります。テクノロジー大手からのこれらの大きな動きは、推論需要をサポートするためには、専門家が数年前に予想していたよりもはるかに異なるハードウェアの組み合わせが必要になることを示唆しています。AI推論はAIトレーニングとどのように異なりますか?トレーニングされていないLLMは、テーブル上のスクラブルタイルの山のようなものです。単一の文字の代わりに、タイルはトークンと呼ばれる単語の断片を示しています。ほぼ何でも書くために必要なすべてが存在しますが、何も意味をなしません。モデルのトレーニングは、大規模にプレイされる推測ゲームを使用して、この混乱を整理します。モデルには実際のテキストが表示され、次のトークンが隠されており、次は何が来るかを予測するように求められます。各推測の後、正しいトークンが表示され、予測と比較され、その差がモデルの精度を計算するために使用されます。ゲームは単一の文章ではなく、数十億の文章にわたってプレイされます。実際のスクラブルゲームは、チップの袋と数杯の飲み物でプレイできますが、AIトレーニングは計算集約的です。モデルは、バックプロパゲーションを通じてパラメータを更新します。これは、次の予測をより良くするために、モデルの数十億または数兆のパラメータのそれぞれがどのようにシフトすべきかを繰り返し計算するプロセスです。これが、テクノロジー大手がこれまで以上に大きなデータセンターを建設している理由です。最終的に、モデルの作成者は、さらなるトレーニングはコストに見合わないと判断し、推測ゲームは停止します。バックプロパゲーションは終了し、パラメータは凍結され、LLMは事前トレーニング済みモデルになります。ファインチューニング(より小さく、より専門化されたデータでの短いトレーニング実行)が最終的な調整を加え、モデルはデプロイされます。NvidiaのGroq 3言語処理ユニットは、オンチップSRAMメモリと計算ブロックをオンチップで必要な順序で配置することにより、データ移動を最小限に抑えます。Nvidia次に推論が来ます。これは、デプロイされたモデルを使用するプロセスであり、トレーニングが完了したモデルは、トークンと呼ばれるスクラブルタイルを意味のある順序で出力する方法を学習しました。バックプロパゲーション計算(パラメータを更新するために使用される)が排除されるため、AI推論は計算要求が少ないと考えるかもしれません。しかし、推論ハードウェア会社d-Matrixの創設者兼CTOであるSudeep Bhojaは、推論が新たな課題を追加すると説明しています。モデルは本質的に「自己回帰的」です。つまり、次の出力は前の出力に依存します。「したがって、次のトークンを生成するには、すべての重みと以前のトークンからのすべての[コンテキスト]を読み取る必要があります」とBhoja氏は説明します。コンテキストには、すべてのプロンプト、LLMのすべての応答、およびアップロードしたすべてのファイルが含まれます。それは大量のデータと大量の処理です。LLMは、プリフィルとデコードの2つのフェーズで応答を生成します。プリフィルは、モデルがプロンプトを読み取るプロセスです。すべてのトークンを一度に処理し、各トークンが他のすべてのトークンとどのように関連するかを計算します。この操作はアテンションと呼ばれ、最新のLLMの基盤となるトランスフォーマーアーキテクチャの決定的な特徴です。これにより、単語自体ではなく、単語が文、段落、およびより大きなコンテキスト内でどのように関連しているかに応答できます。ゲームに配置する前にスクラブルタイルを配置することを想像してみてください。多くのプレイヤーは、タイルを動かしてそれらがどのように接続するかを想像します。自己アテンションは同様の役割を果たしますが、物理的なタイルを動かす代わりに、各トークンは他のトークンにクエリを送信し、トークンの関連性を示すスコアを受け取ります。これらのクエリは、キーと値という2種類のベクトルをもたらします。それらは通常、KVキャッシュと呼ばれるストアに配置されます。モデルは、新しいトークンを生成するたびにこれらのベクトルを再計算することもできますが、これは厳密には必要ありません。しかし、ほぼすべてのLLMは、計算量を減らすためにKVキャッシュを使用しています。KVキャッシュはメモリに保存され、LLMが会話を理解するために戻ることができるスクラッチパッドになります。最初は小さいですが、数十ギガバイトに膨れ上がることがあります。プリフィルは、簡単に分割して並列で作業できる問題です。これが、LLMの人気が急上昇するにつれてGPUが主要なAIアクセラレータになった理由です。グラフィックスのラスタライズ(画面のすべてのピクセルの色を計算すること)も大規模に並列化されているため、GPUアーキテクチャは自然な適合でした。Cerebrasのウェーハスケールエンジンチップは、メモリと計算ユニットの両方を大皿サイズのチップ上に並べて配置することで、メモリ帯域幅を最大化します。Cerebras次にデコードが来ます。ここでは、モデルは一度に1つのトークンずつ応答を生成します。各ステップで、最新のトークンを取得し、KVキャッシュ内のすべてに対して重み付けし、その情報を使用して次のトークンを予測し、新しいトークンのキーと値をキャッシュに追加します。次に、トークンごとにシーケンスで繰り返します。ここで、モデルの自己回帰的な性質が推論速度の妨げとなります。各トークンを予測するには、メモリからモデル全体を読み取る必要があります。そのモデルは、数十から数百ギガバイトのパラメータ(モデルがトレーニングで学習したことを表す数値)で構成されています。特に、これはKVキャッシュを保存するために必要なメモリに加えてです。その結果、メモリを介したこれらのすべてのデータ移動は、推論ハードウェアが利用できる帯域幅よりも多くの帯域幅を必要とすることがよくあります。そのため、GPUの計算部分の少なくとも一部は、データが来るのを待っている間にアイドル状態になります。Rese