AI・機械学習
Show HN: Echo – Fableレベルの結果を1/3のコストでオープンウェイトモデルを使用して実現
Show HN: Echo – Fable-level results at 1/3 the cost using open-weight models
要約
Echoは、単一のモデルに依存するのではなく、オープンウェイトモデルのプールからAIシステムを構築する実験的なプロジェクトです。各リクエストに対して、計算リソースの配分、参加するモデル、およびそれらの出力を組み合わせる方法を動的に決定します。これにより、個々のモデルよりも優れた結果を、Fableの約1/3の推論コストで達成できることが示されています。
全文翻訳
私はEcho(https://echo.tracerml.ai/)を構築してきました。これは、単一のモデルを選択してあらゆるタスクに使用するのではなく、オープンウェイトモデルのプールからAIシステムを作成する実験です。
これは単純な実験から始まりました。私はGLM-5.2、Kimi K2.7などを含むモデルのグループを取り上げ、それらを同じ評価で実行しました。そして、各問題に対して、どのモデルが有用であるか、そしてそれらの出力をどのように組み合わせるべきかを事前に知っていた場合に何が起こるかを測定しました。
その仮想的なシステムは、プール内の個々のモデルよりも大幅に優れたパフォーマンスを発揮しました。もちろん、結果を見た後にどの決定が良かったかを知ることに依存しているため、実際に展開できるものではありません。Echoは、事前にその情報なしに、その利点の一部を回復しようとする私の試みです。
各リクエストに対して、Echoは計算リソースの配分、参加すべきモデル、およびそれらの作業をどのように組み合わせるかを決定します。一部のプロンプトは比較的少ない推論しか必要としないかもしれませんが、他のプロンプトは問題の異なる部分で作業する複数のモデルから恩恵を受けます。
それを構築している間に私が驚いたことの1つは、モデルがいかに補完的であるかということです。全体的に明らかに弱いモデルでも、特定の問題や組み合わせの一部として非常に役立つことがあります。
最初の評価ミックスでは、Echoは一貫してプール内の最高の個々のモデルよりも優れたパフォーマンスを発揮しました。また、比較対象として使用した強力なシステムの1つであるFableと同等の全体的な結果を、推論コストの約3分の1で達成しました。
Echoが誤った配分または組み合わせの決定を下すケースはまだいくつかあります。現在、それらの失敗を理解するために多くの時間を費やしており、コーディングタスクやエージェントタスクで同じアプローチが通用するかどうかをテストしています。これらのタスクでは、各決定の品質を測定することがはるかに困難になります。
チャットインターフェイス(echo.tracerml.ai)とOpenAI互換API(https://echo.tracerml.ai/docs/api)を構築したので、評価セットアップの外でシステムをテストできます。
仕組みに関する短い/高レベルのビデオはこちらです:https://www.youtube.com/watch?v=lJFJSvOdXhg
評価方法、個々のモデルの結果、コスト、現在の制限については、こちらにまとめました:https://echo.tracerml.ai/eval
ぜひ試してみてください!特に、奇妙な失敗ケースに遭遇した場合や、配分が直感的でないと思われる場所があれば、ぜひお知らせください。