AI・機械学習
Kimi K3はFableと競合可能、Kimi K3とFableの組み合わせはSoTA(State-of-the-Art)
Kimi K3 Is Competitive with Fable; Kimi K3 and Fable Is SoTA (fireworks.ai)
要約
Fireworks.aiは、同社の新しいオープンモデル「Kimi K3」が、クローズドモデル「Fable 5」と同等の性能を持ち、両者を組み合わせたルーティング戦略が最先端の性能を発揮することを発見しました。Kimi K3は、特に長時間の複雑なタスクにおいて、Fable 5単体よりも最大50倍コスト効率が高く、多くのタスクでより優れたコストパフォーマンスを発揮します。この結果は、単一モデルに依存するのではなく、タスクごとに最適なモデルを選択するルーティング戦略が、AIの利用において重要であることを示唆しています。
全文翻訳
シリーズDと年間10億ドルのARRを発表
ブログ
Kimi K3
Fable
Kimi K3はFableと競合可能。Kimi K3 + FableはSoTA。
公開日 2026/7/21
目次
測定方法
K3は良いモデルです。
2つのモデルは1つより優れています
K3はFireworksで最大50倍低コストになります。 🫳🎤
モデルを選択しないでください。ルーティングしてください。
K3はすべてのワークタイプでコスト最適化されています
単一モデルは無駄であり、もはやSoTAではありません
目次
K3は、フロンティア品質のオープンモデルでありながら、そのコストはごく一部です。さらに大きな利点は、Fableと予測可能に補完し合うため、タスクをルーティングすることで最高品質のインテリジェンスを得ることが可能になることです。
🧭 要約: Kimi K3(オープン)とFable 5(クローズド)を約1,000のエージェンティックタスクで比較した結果:
K3とFableをルーティングすることで、93%の精度を達成しました。
長時間のループでは、Fable単体よりも最大50倍のコスト効率を実現し、あらゆるユースケースで一貫して低コストでした。
測定方法
私たちは、それぞれ異なる種類の作業を対象としたベンチマークを平均し、K3とFable 5を同じハーネスで実行しました。合計で約1,030タスクを、実際のエージェントループで実行しました。
ファミリー
テスト内容
タスク
SWE
実際のコードリポジトリのバグ修正(SWE-benchスタイル)
460
ターミナル
長時間のオペレーション: セキュリティ、暗号、リバースエンジニアリング、システム管理
89
アルゴリズム
LeetCode / AtCoderスタイルの問題
100
マルチ言語
6つの言語にわたる実装
225
法律
法律エージェントベンチマーク(弁護士評価タスク)
120
結果に入る前に、まず1つの定義を説明します。オラクルルーティングとは、タスクを各モデルで実行し、最も安価で正しいオプションを選択することで、理論上の最高のパフォーマンスを測定する方法です(コスト/パフォーマンスの天井)。実際のルーターでは、複数のモデルでタスクを実行することはできません。ルーターは、コストと品質の最適なトレードオフを持つモデルを予測しますが、最終的には推測です。
この研究では、オラクルルーティングにより、K3が72〜96%のタスクで選択されることが示されました。これは、日常的なタスクと真のフロンティアワークのロングテールとの違いを学習することで、ほぼ完璧なルーターが達成可能であることを示唆しています。断定するには、さらに多くのルーティングデータと実際のパフォーマンスが必要になります。
K3は良いモデルです。
全体像を見ると、両モデルを比較して、ほぼ同等と見なすのは簡単です。例えば、SWE(ソフトウェアエンジニアリング)のヘッドラインベンチマークを見ると、K3は92.4%、Fableは92.6%です。私たちがベンチマークした5種類のタスク全体で、2つのモデルは数ポイントの差に収まる傾向があり、Fableはコーディング言語の幅広さ(マルチ言語)でわずかにリードしています。
図1・カテゴリ別のタスク解決率。全体平均ではほぼ同等。内部では得意なことが異なる。
ここで止まって「大体同じだ」と言うのは簡単です。ニュースは、タスクの種類ごとに、それぞれが明らかに優れたパフォーマンスを発揮することです。
2つのモデルは1つより優れています
単一のベンチマークの中を覗くと、トップラインの精度数以上に多くのものが見えてきます。SWEを見てみましょう。全体では2つのモデルはほぼ互角ですが、SWEを問題領域別に分割すると、各モデルが得意な領域が見えてきます。K3はシンボリック数学と開発ツールに強く、FableはWebとデータビジュアライゼーションの作業で勝利します。このパターンはマルチ言語セットでも同様で、Fableはその幅広さでJava、Python、C++をカバーし、K3はJavaScriptとRustで同等になります。
図2・SWEドメイン別のポイント差(K3マイナスFable)。ベンチマーク全体では同点ですが、ドメインごとに専門性が異なります。
ターミナルでの長期間の作業、シェルを操作し、数十回のターンを経てシステムを調査する際、K3はその真価を発揮しました。Fableが決して解決できなかったタスクのバッチをクリアしました。7zハッシュ、FEAL暗号解読、漏洩した秘密、ライブ脆弱性、暴走した非同期ジョブなどです。
図3・89のターミナルタスクのうち、K3は11の単独勝利、Fableは7で、セキュリティと暗号クラスターを完全に制覇しました。
K3はFireworksで最大50倍低コストになります。 🫳🎤
品質は全体的にほぼ同等ですが、価格は全く異なります。
図4・タスクあたりのコスト優位性。その背景には2つの要因があります。トークン価格と、どのモデルがより長く実行されるかはタスクによって異なるという事実です。
では、この巨大な価格差はどこから来るのでしょうか?トークン価格、プロンプトキャッシュ、そしてタスクあたりの労力です。例えばSWEでは、K3はFableよりもはるかに多くの作業を行います。タスクあたり約55ターンと130万トークンに対し、Fableは21ターンと13万トークンです。長時間のターミナルタスクでは逆で、Fableがスパイラルに陥り、64ターンと150万トークン(時にはタイムアウトまで)を実行します。
図5・タスクあたりのターン数(線形)とトークン数(対数)。どちらのモデルも全体的に無駄が少ないわけではありません。追加の作業はSWEではK3に、ターミナルタスクではFableにかかります。トークングラフのY軸はタスク解決率です。
プロンプトキャッシュが、その労力をK3の価格優位性に変える作業の大部分を担っています。K3が10倍のトークンを読み込んでも、キャッシュヒットがあれば、SWEの実行コストはFableよりも低くなります。トレードオフがあります。追加のターンがあるタスクは、一般的に実行あたりの壁時計時間が長くなる、つまり実行が遅くなることを意味します。2秒以内に回答が必要な場合は重要ですが、バックグラウンドで大規模にエージェントを実行している場合は、請求額が数分の一になる方がはるかに重要です。
モデルを選択しないでください。ルーティングしてください。
すべてのタスクを最も得意なモデルに送信すれば、2つのモデルの中間地点に着地するのではなく、両モデルを上回ることができます。
タスクごとのルーティングは、常に単一モデルの実行よりも優れています。
図6・タスクごとのオラクルルーティングと各モデル単体との比較。緑色のタグ = そのカテゴリで最高の単一モデルを上回ったポイント。
オラクルルーターはK3を選択し、タスクトラフィックの72〜96%を占めます。このようにルーターを設計することで、単一モデルよりも全体的な品質が高く、コストはコスト最適化モデル単体に近いものになります。
図7・オラクルルーターが各タスクを送信する場所。K3のような強力でコスト最適化されたモデルがデフォルトになり、プレミアムモデルは例外であり、ルールではありません。
K3はすべてのワークタイプでコスト最適化されています
品質とコストを1つのプロットにまとめます。青色のK3は、5つのタスクファミリーすべてで、赤色のFableよりも左側(よりコスト効率の高い側)に位置します。精度は一進一退です。マルチ言語ではFableがリードし、ターミナルと法律ではK3がリードし、その他はほぼ同等です。
図8・各ファミリーのコスト(対数スケール)と精度の比較。K3はFableの左側にあり、5つすべてでコストが低いです。垂直のギャップは、どちらのモデルがどこで優れているかを示しています。
単一モデルは無駄であり、もはやSoTAではありません
Kimi K3とFableを一緒にルーティングすることで、それぞれの最高の品質を最高の価格で引き出すことができます。
単一モデルプロバイダー、トークン最大化の時代は終わりを迎えつつあります。タスクレベルのデータは、これらのモデルが非常に異なる価格で専門化していることを示しています。最高のAIはもはや単一の研究室から生まれるのではなく、モデルの混合体です。
これが実際には何を意味するか:
オープンをデフォルトに。K3のような50倍低コストのオープンモデルは、オラクルがほとんどのトラフィックをそこに送るので、ベースケースとなるはずです。
ルーターがあなたの堀です。ルーターはワークロードに合わせて調整する必要があり、タスク/モデルの分割を継続的に学習することが、先行するための最良の機会となるでしょう。