AI・機械学習
Show HN: 小規模モデルを半額で最先端品質で蒸留・提供
Show HN: Distill and serve small models with frontier quality for half the cost (github.com)
要約
このツールは、エージェントに特化したモデルを継続的に改善するためのオープンソースツール「world-model-optimizer (wmo)」を紹介しています。wmoは、蒸留によってモデルを小型化・高速化し、ルーティング機能でコストを半減させながら最先端品質を維持することを目指しています。デモや、より低コストで自己改善するホスト型ソリューションも提供されています。
全文翻訳
皆さん、こんにちは。私たちは、エージェントに特化したモデルを継続的に改善するためのオープンソースツール、world-model-optimizerを開発しました。本日、蒸留された小型モデルに繰り返しタスクをルーティングするためのツールである`wmo serve`をリリースします。
既にキャプチャしているエージェントのトレースは、モデルをより安価に、より速く、より良くする方法についてのシグナルを得る機会となります。私たちは継続的に改善します。
- オープンソースモデルからの蒸留による、特化モデルの継続的な改善
- 最先端モデル+カスタムモデルへのモデルルーティング
- ノイズを除去しトークンを節約するためのトークン圧縮
デモ: https://www.youtube.com/watch?v=2_m4Ze6mdko
トレースとOpenRouterキーを渡すと、wmoはローカルのOpenAI互換エンドポイントを起動し、同等の品質でより低コストでモデルを実行します。バックグラウンドでは、ルーターがどのタスクを最先端モデルにルーティングし、どのタスクをカスタムモデルにルーティングするかを決定します。新しいトレースが到着するたびに、Tinkerは継続的にトレーニングを行います。
また、自己改善機能を備えた最先端品質のエンドポイントを、40%以上低コストで利用したいだけの方向けにホスト型ソリューションも提供しています。
waitlistへの登録は https://experientiallabs.ai からどうぞ!