AI・機械学習
AIレースは気まずい状況になった
The AI Race Just Got Awkward (insufferable.dev)
要約
最近のAI開発競争において、欧米のAIラボが中国のラボの後塵を拝している状況が描かれています。特に、中国のAI研究機関がKVキャッシュ最適化などのブレークスルーをオープンソースで公開したことで、欧米の企業はそれらを「採用」せざるを得なくなっています。この技術革新により、長文コンテキストモデルの推論コストが劇的に低下し、欧米のAI企業は利益率の改善を余儀なくされています。
全文翻訳
最近のニュースの見出しを読めば、欧米のラボが中国のラボに大勢で spawn-camp されていると思っても無理はないでしょう。ディスティレーション・ドラマ Anthropic は、中国がモデルをディスティレーションし、それ自体が人類に対する危険になっているなどという記事を毎週のように発表しています。これは、後でこれらのモデルを法的および規制的に制限するための基盤を設定するため、彼らにとって有益です。しかし、無思慮なディスティレーションの日々は終わったことは明らかです。終わっただけではありません。今度の新しいゲームは、中国のラボの進歩を採用することです。私はこれを「盗む」という Anthropic が使いがちな、より悪意に満ちた言葉ではなく、「採用」と呼んでいます。なぜなら、欧米の企業とは異なり、中国はほぼレシピを無料で提供しているからです。異なるゲーム 最新のものは、DeepSeek が世界に惜しみなく共有した KV キャッシュ最適化のブレークスルーを、謝罪もなく堂々とコピーしたものです。これは、コーディングのような長いセッションコンテキストを使用する特定のユースケースにおいて、KV キャッシュのフットプリントを DeepSeek-V1 と比較して約 437 倍も削減する、驚異的な最適化です。彼らは最初に MLA アーキテクチャをリリースし、キャッシュを約 15 倍圧縮し、その後「Compressed Sparse Attention」と「Heavily Compressed Attention」を続けました。最新の DeepSeek-V4.1-Flash は、CSA2、クロスレイヤーキャッシュ再利用、因果エンコーダー・デコーダーアーキテクチャ、FP4 キャッシュを備え、グローバル KV キャッシュをトークンあたり 890 バイトにまで削減しています。これらのことがなぜ重要なのでしょうか?なぜなら、長文コンテキストモデルを提供する場合、最大のコストの 1 つは、このキャッシュを GPU メモリに保持するために必要な VRAM だからです。以下は、このすべてがいかにクレイジーであるかを示すグラフです。
キャッシュマネーを追え 同じティアのコストを約 2 ヶ月前と比較してください。以下の価格はすべて 100 万トークンあたりです。
非常に静かな感謝の意 これらすべては、欧米の AI 企業が現在、推論マージンで非常にプラスになっていることを意味するはずです。高度な GPU へのアクセスが制限されたことで、中国のラボはパフォーマンス最適化を最優先目標にせざるを得なくなり、それが結果に表れています。なぜ彼らがこのようなブレークスルーを無料で提供するのかは分かりませんが、彼らはそうしました。そして、Anthropic と OpenAI の両方が、基本的にトップティアのモデルをリリースし、これらの最適化を使用しています。彼らはコピーされたことに少し当惑しているようです。そのため、Claude Opus 5.5 と GPT-6.1 Sol の両方で、事前の発表なしのサイレントリリースが行われました。ユーザーレビューは使用感に関して素晴らしいものであり、品質はフラッグシップモデル(Claude Fable 5.1 および GPT-6 Astra)と比較しても、それほど離れていないようです。キャッシュ読み取りコストは、採用の証拠です。それらは急落しました:Opus 5.5 は Opus 5 と比較してキャッシュ読み取り価格を 60% 削減し、GPT-6.1 Sol は 7 月下旬の GPT-5.6 Sol の価格と比較して 80% 削減しました。したがって、中国のラボは欧米の赤字ラボにライフラインを提供しましたが、その理由は全く分かりません。