HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Ember-1

Ember-1 (fireworks.ai)

589 pointsby gmays249 コメント

要約

Fireworks Researchは、Kimi K3の品質を維持しつつトークン数を40%削減した新しい特化型モデル「Ember-1」を発表しました。これは、不要な推論をカットし、重要な思考プロセスのみを残すように学習させたモデルです。様々なベンチマークや実際のA/Bテストで品質が維持されていることが確認されており、開発者が求める低コストで高性能なモデルの提供を目指しています。

全文翻訳

私たちの最初のカンファレンス、Forge 2026にご参加ください ブログ Ember 1 公開日 2026年9月23日 目次 Ember-1:トークン半減、回答はそのまま Fireworks ResearchがEmber-1を構築した方法 問題:思考するモデルは考えすぎる 観察からプレミアムモデルへ 特化型知能指数:Ember-1がBedside Benchでパレートフロンティアを確立 より多くの業界ベンチマークでのパレート評価 顧客検証:ライブA/Bテスト 内部検証:自社の開発者も気づかず 次は何? 目次 Ember-1:トークン半減、回答はそのまま Ember-1は、Fireworks Researchの新しい特化型モデルで、Kimi K3の品質を維持しながらトークン数を40%削減します。Kimi K3をベースに、重要な思考プロセスを維持しながら、不要な推論をカットするように学習させました。外部ベンチマーク、ライブの顧客A/Bテスト、そして自社のコーディングおよびエージェントワークロードでテストした結果、すべての設定で品質が維持されました。本日より利用可能なEmber-1は、開発者が次に求めるものに基づいて形成される、Fireworksによる特化型モデルの継続的なシリーズの始まりです。Emberは、Fireworks Trainingプラットフォームで構築できるもののほんの始まりにすぎません。 Fireworks ResearchがEmber-1を構築した方法 ユーザーからは、K3のコーディング能力をより低コストで必要としているという声を聞いていました。なぜなら、その長い推論トレースは、自動コーディングを大規模に行うには高価だったからです。K3の推論努力を低下させても、この問題は解決しませんでした。品質を落とさずにコストを削減するには、モデルはより効率的に推論することを学ぶ必要があり、そのためにはトレーニングが必要でした。 そこに到達するには、真剣な研究が必要でした。私たちのチームは50以上のトレーニング実験と200以上の評価を実施し、精度を失うことなく推論を短縮するために、新しいトレーニングアルゴリズムも開発しました。これらはすべてFireworks Serverless Trainingで行われました。GPUをプロビジョニングまたは管理する必要がなかったため、アイデアが浮かび次第すぐに実験を開始し、実行した分だけを支払い、通常よりも短い時間とコストで研究からローンチまで移行できました。 トークン削減の効果が多くのワークロードに及ぶように、幅広いタスクでトレーニングしました。顧客データは使用せず、自社のデータを使用してこのモデルをトレーニングしました。その後、Ember-1を特化型知能指数、公開ベンチマーク、およびライブのプロダクショントラフィックで評価し、品質の低下なしにトークン使用量が削減されていることを確認しました。Ember-1はFireworks独自のモデルであり、Fireworks Researchによる一連のモデルの最初のものです。 問題:思考するモデルは考えすぎる Kimi K3のような推論モデルは、生成されたトークンの大部分、時には90%以上を、回答そのものではなく内部的な推論に費やします。この思考構造は単一のリクエストでは高価ですが、マルチターンのエージェントワークロードではさらに悪化します。各ターンで、以前のすべての推論がモデルに再入力されるため、コンテキストはターンの数に応じてほぼ二次的に増加します。初期ターンの長い推論トレースは、後続の各呼び出しで再読(および再請求)されます。 その推論のすべてが実際に必要なのでしょうか?私たちの実験では、そうではないと答えました。Kimi K3が出力する推論は、タスクに必要な量よりもはるかに長く、その超過分は回答に触れることなく削除できます。これが、特化型知能から構築されたKimi K3の経済的なバージョンであるEmber-1を作成した方法です。 観察からプレミアムモデルへ K3の推論のすべてが無駄なわけではありません。その一部は自己反省です。仮説の再検討、フィードバックへの応答、または以前の決定への結果の追跡は、モデルが間違いから回復するのに役立ちます。機会は、この能力を維持しながら、不要な推論を減らし、非生産的なループから抜け出すことです。タスクと環境からのフィードバックから学ぶことで、モデルは能力を維持しながらより効率的に推論することを学ぶことができると信じています。 エージェントタスクの場合、この学習はインタラクション全体に及びます。モデルは可能なアクションを探索し、新しい観察を取り込み、進行中に推論を洗練します。フィードバックは決定をその結果に結び付け、タスク全体で有用な反省を促します。 これらの洞察を、数学、コーディング、指示追従、会話、検索、ツール使用、ソフトウェアエンジニアリングを網羅するトレーニングコレクションに組み込みました。これには、スタンドアロンの問題と、観察および結果への適応を強制するための拡張インタラクションの両方が含まれます。タスクフィードバックは、オンポリシー計画と学習をガイドし、この設定範囲全体で能力を維持することに重点を置いています。 公開ベンチマークとライブA/Bテストの結果はこの方向性を支持しています。7つのベンチマークと2つの顧客のプロダクショントラフィック全体で、K3の推論は精度を犠牲にすることなく35〜50%短縮できました。内部化された動作は、失敗した試行でのトークン使用量も抑制し、長引く非生産的な推論を減らします。 特化型知能指数:Ember-1がBedside Benchでパレートフロンティアを確立 先週、業界の専門家によって作成された実際のタスクに対して、オープン、クローズド、および特化型モデルをベンチマークするための特化型知能指数(SII)を導入しました。 DoximityのBedside BenchでEmber-1を評価しました。これは、10の専門分野にわたる500の臨床症例を網羅する、医師によって検証されたベンチマークです。 結果は? Ember-1は、GPT-5.6 Sol、GPT-6 Astra、Claude Opus 5を含むオープンおよびクローズドモデル全体で、コスト/タスクの新しいパレートフロンティアをBedside Benchで確立しました。 図1:Bedside BenchでのSIIによるパレートフロンティア 図2:Bedside Bench SIIでのスコア対期間チャート より多くの業界ベンチマークでのパレート評価 また、他の業界ベンチマークでの品質対コストのフロンティアについてもEmber-1を評価しました。Kimi K3の公開API価格(キャッシュされていない入力3ドル/Mトークン、キャッシュされた入力0.30ドル/M、出力15ドル/M)を使用してベンチマークごとのコストを計算し、3つのアーム(推論努力が低いK3、高いK3、最大K3(デフォルト)、およびEmber-1)の合格率に対してプロットしました。50以上のテストサンプルを持つすべてのベンチマークで、Ember-1はパレートフロンティア上またはその近くに位置し、K3-maxの品質をわずかなコストで実現し、K3-lowを厳密に支配しています。GPT-6 Astra、Claude Opus-5、GLM 5.3も分析しましたが、Ember-1がパレートフロンティアのリーダーであることがわかりました。 図3:オープンおよびクローズドモデルのコスト/タスクにおける5つの業界ベンチマークの平均 Ember-1と元のK3を直接比較した結果をさらに詳しく分析したところ、以下の結果が得られました。 | Industry Benchmarks | N | K3 Low | K3 High | K3 max | Ember-1 | Ember-1 vs. K3 Max | |---|---|---|---|---|---|---| | Terminal Bench 2.1 | 89 | 76.4% | 77.6% | 80.9% | 82.0% | -51.9% / -23.1 USD | | SWE-bench Verified | 500 | 80.4% | 86.0% | 93.2% | 92.2% | -15.5% / -68.1 USD | | SWE-Interact | 75 | 6.7% | 13.3% | 21.3% | 20.0% | -32.5% / -60.8 USD | | DeepSWE 1.1 | 113 | 55.8% | 62.8% | 66.4% | 75.2% | -23.7% / -126.9 USD | | τ-2 Bench Airline | 50 | 64% | 64% | 64% | 66% | -5.9% / -0.3 USD | K3を実行する最もコスト効率の高い方法は、推論を減らすのではなく、効率的に思考することを学んだモデルであるEmber-1を実行することです。 顧客検証:ライブA/Bテスト ベンチマークだけではすべてはわかりません。特化型知能指数の結果で見つけたように、より多くの実際のワークロードでモデルをテストし、プロダクショントラフィックを使用してモデルをテストしたかったのです。実際のテストは、多くの場合、モデルがプロダクショントラフィックで、ユーザーが依存する製品でどれだけうまく機能するかということです。 2つの顧客のプロダクションコーディングワークロードでライブA/Bテストを実施しました。どちらの場合も、Ember-1は印象的なトークン削減を実現し、同等の品質でタスクあたり約35%少ないトークンを使用しました。タスク完了率、成功スコア、失敗率など、ほとんどの下流製品メトリクスは、大幅に低いトークンコストで正しい方向に進み、維持または改善されました。A/Bテストの後、ある顧客は現在Ember-1をライブプロダクションで実行しており、ベースモデルを完全に置き換えるためにスケールアップする計画です。 | Score | Steps | Output Tokens | Reasoning Token reduction | Total token reduction | |---|---|---|---|---| | Kimi K3 | 0.75 | 123.8K | 49.3K | -- | | Ember-1 | 0.75 | 321.4K | 29.9K | 71.3% | 39% | 内部検証:自社の開発者も気づかず Fireworksの内部コーディング/共同作業トラフィックの大部分は、自社の推論サービスによって支えられています。カスタムの前に