AI・機械学習
中国製モデルを恐れる者は誰か?
Who's Afraid of Chinese Models? (stratechery.com)
要約
この記事は、AIモデル、特に中国発のオープンウェイトモデルの経済性について論じています。研究開発費(R&D)と売上原価(COGS)を対比させ、モデル開発のR&Dは固定費である一方、推論コスト(COGS)は変動費であり収益に直結することを強調しています。トークンはコモディティではないが、それによって得られる知能はコモディティ化しつつあり、コモディティ市場のダイナミクスがAI業界にも適用されると論じています。
全文翻訳
中国製モデルを恐れる者は誰か?
月曜日、2026年7月20日
ポッドキャストを聴く
この投稿を聴く:
ログインして聴く
私がケロッグ経営大学院のSTRT-431、全ファーストイヤーMBAが受講必須だった入門クラスで語る話があります。
読み物とケーススタディに目を通しましたが、議題にテクノロジー企業が一つもなかったことに落胆しました。
私という人間なので、授業後に教授に、なぜテクノロジー企業がないのかと尋ねましたが、コースの目的は特定の産業について学ぶことではなく、むしろあらゆる産業のあらゆる企業に適用できる、広く普遍的な原則を発見することだと告げられました。
いつものように話すように、私はこれをあまり満足のいくものとは思いませんでした。
私にとって、テクノロジーの本質、特にソフトウェアと流通がゼロの限界費用(およびゼロの取引費用)を持っていたという事実は、根本的に異なるものでした。
数式にゼロを入れると、大混乱を引き起こします!
しかし、すぐにそれが私の機会であることに気づきました。
アグリゲーション理論の根底にある基本的な洞察は、ゼロの限界費用が、かつてインターネットから期待されていたものとは根本的に異なるバリューチェーンにつながるということです。
それは、需要を管理することが供給を配布することよりも重要であった世界における中央集権化と規模です。
しかし、AIの興味深い点は、それらの古い普遍的な原則が前面に出てきている度合いです。
これは、先週末、X(旧Twitter)で、Kimi K3という、能力において最先端に近づいている中国製のオープンウェイトモデルの影響についての議論が白熱したときほど明白ではありませんでした。
長々と話しましたが、要点はこうです。
限界費用は、最先端の無料モデルの短期的な影響と、業界の長期的な構造の両方の点で、再び大きな意味を持っています。
COGS 対 R&D
オープンウェイトモデルの議論を支える最も一般的な誤解の一つは、それらがより安価である、あるいは無料であるということです。
結局のところ、ウェイトをダウンロードするだけで、独自のモデルを作成するために必要な時間、費用、能力をスキップできます。
それはもちろん真実ですが、この場合の「無料」は、研究開発(R&D)に費やす必要がある金額を指します。
R&Dは、発生させる収益に関係なく、固定費用です。
100万ドルをR&Dに費やした場合、10万ドルの収益であろうと1億ドルの収益であろうと関係ありません。
あなたはまだR&Dに100万ドルを費やしたのです(もちろん、それは収益性に影響します)。
収益に関連するのは売上原価(COGS)です。
そして、COGSはAIにとって、ソフトウェアが長い間そうであったようには、現実のものです。
具体的には、モデル(KimiであろうとFableであろうと)で推論を実行するには費用がかかります。
そして、AIプロバイダーが推論に費やす金額は、少なくともほとんどのビジネスモデルでは、収益と直接相関しています。
上記の例を再利用すると、1億ドルの収益対10万ドルの収益を生成するには、おそらく1000倍のCOGSが必要になります。
具体的には、1ドルの収益を生み出すトークンを生成するのに50セントかかる場合、1億ドルの収益は5000万ドルのCOGSになります。
10万ドルの収益は、わずか5万ドルのCOGSしかかかりません。
オープンウェイトモデルに関するポイントは、それらが提供するのに無料ではないということです。
Kimi K3は、入力トークン100万あたり3ドル、出力トークン100万あたり15ドルです。
これは、Solの入力トークン100万あたり5ドル、出力トークン100万あたり30ドルよりも安いですが、それが正しい測定基準ではないかもしれません。
トークン 対 知能
NvidiaのCEOであるジェンスン・フアンは、Nvidiaが構築しているものを「トークン工場」と表現しており、Nvidiaの観点からはその表現は理にかなっています。
Nvidia GPUはモデルに依存しません。
それらはトークンを生成し、それを最も速く効率的な方法で行います。
これにより、トークン/秒、最初のトークンまでの時間、トークン/ワット、トークンコストなどの測定基準が得られます。
そして、フアンはこれらのメトリックが意思決定の基礎になると主張しています。
これは、トークンがエンドユーザーに直接配信されたAIの最初のパラダイム、ChatGPT時代には間違いなく意味のあるフレームワークでした。
しかし、AIの第二のパラダイム、推論の時代は、この測定を混乱させます。
推論は、連鎖思考トークンの爆発を伴い、異なるモデルは正しい答えに到達するために異なる量の推論トークンを必要とします。
例えば、KimiはSolよりも大幅に多くのトークンを使用すると報告されており、その価格優位性を無意味にしています。
エージェントは同様のダイナミクスを導入します。
一部のモデルは、エージェントワークフローを実行するために必要なトークン数に関して、他のモデルよりも効率的です。
これは、トークンがコモディティではないことを意味します。
コモディティの定義的な特徴は、それが代替可能であるということです。
1ガロンの石油は1ガロンの石油です。
1トンの銅は1トンの銅です。
1ブッシェルの小麦は1ブッシェルの小麦です。
しかし、あるモデルからのトークンは、別のモデルからのトークンと同じではありません。
代替可能なのは、トークンから構築されたものであり、つまり知能です。
言い換えれば、KimiとSolの両方が正しい答えを生成した場合、その答えは代替可能です。
正しい答えに到達するために生成されたトークンの違いは、COGSの違いに寄与する要因です。
知能のCOGSは、いくつかの異なる要因の関数です。
モデルフットプリント: ウェイトとランタイム状態は、各サービングレプリカをホストするために必要な高価なメモリとアクセラレータの量を決定します。
推論効率: アーキテクチャの選択(例: Mixture-of-Experts)は、生成されるトークンあたりの計算量を削減します。
メモリ効率: アーキテクチャの選択は、KVキャッシュの要件を削減し、より多くの同時リクエストとより良いGPU利用率を可能にします。
サービング効率: バッチ処理、スケジューリング、プレフィックスキャッシング、その他の推論最適化は、利用率を最大化し、リクエスト間で作業を共有します。
トークン効率: 正しい答えに到達するために必要なトークンが少ないほど、推論コストは低くなります。
これが重要な理由は、多くの経済的に有益なタスクに対する知能が実際にコモディティである状態に急速に近づいているからです。
例えば、基本的なCRUDアプリを構築する人は誰でも、おそらく複数のプロバイダーのモデルを使用してそれを実行できるでしょう。
そして、コモディティ市場では、収益性の道はより高い価格を請求することによってではありません。
(再び言いますが、あなたは複数のモデルを使用して全く同じアプリを作成できる(またはすぐに作成できるようになる)でしょう。)
しかし、それは優れたコスト構造を持つことによってです。
コモディティ市場の理解
ここでメカニズムを段階的に見ていく価値があります。
なぜなら、数ヶ月前にAmazonのDurabilityで指摘したように、コモディティ市場のダイナミクスは、テクノロジー業界の人々が一般的に慣れていないものだからです。
コモディティ市場では、誰もが同じものを販売しているため、誰もが同じ価格を請求します。
その価格は、需要と供給によって決定されます。
コモディティの需要は、価格弾性の関数です。
コモディティが安いほど、需要は増え、その逆も同様です。
コモディティの供給は、コモディティを生産する限界費用の関数です。
理解すべき重要な点は、コモディティを生産する限界費用はサプライヤーごとに異なるということです。
実際には、これは、最も悪いコスト構造を持つサプライヤーが、その限界費用でコモディティを販売することになる(生産できれば)ということです。
他のすべての人の利益は、そのコスト構造が限界サプライヤーよりも優れている度合いにかかっています。
例として:
サプライヤーAは、それぞれ10ドルで10単位のコモディティを生産できます。
サプライヤーBは、それぞれ15ドルで10単位のコモディティを生産できます。
サプライヤーCは、それぞれ20ドルで10単位のコモディティを生産できます。
20ドルで25単位のコモディティの需要があると仮定しましょう。
これは意味します:
サプライヤーAは、10単位のコモディティを20ドルで販売し、単位あたり10ドルを稼ぎます。
サプライヤーBは、10単位のコモディティを20ドルで販売し、単位あたり5ドルを稼ぎます。
サプライヤーCは、5単位のコモディティを20ドルで販売し、0ドルを稼ぎます。
これは正確ではありません。
サプライヤーCが不足分を負担する理由は、サプライヤー