AI・機械学習
Show HN: 型付き決定モデルのための再現可能なベンチマーク JevBench
Show HN: JevBench, a reproducible benchmark for typed decision models (benchmarkheaven.com)
要約
JevBenchは、型付き決定モデルのパフォーマンスを評価するための新しいベンチマークツールです。このツールは、精度、レイテンシ、コストを統合的に測定し、LLMと比較して高速かつ安価でありながら同等の知能を持つJevモデルの優位性を示しています。GitHubでコードが公開されており、2つのデモも利用可能です。
全文翻訳
HNの皆さん!JevBenchを開発しました。Jevは非常に優れており、真剣なオープンソースプロジェクトと偽の類似プロジェクトが実際にどのように比較されるかを知る価値があるからです。
Jevクラスのモデルは、テキストではなく、境界のある選択肢と確率を返します。これらは、LLMよりも破壊的に高速かつ安価でありながら、対象となるテキスト入力に対して同様にインテリジェントです。
JevBenchを使用すると、精度、レイテンシ、価格をすべて同時に、重み付けされた方法で見ることができます。重み付けは設定することも可能です。
完全な実行では、534個の英語の決定を行います。v1.3スコアは、チャンス補正された知能、キャリブレーション、速度、およびコストを組み合わせています。
現在のリーダーボード:
```
#1 - Jev 74.4
#2 - SemIf 73.1
#3 - djev 73.0
#4 - Winnow-12B Q8 71.2
#5 reflex 4B 70.3.
```
MITハーネス、公開アイテム、凍結された成果物、スコアリングコード、およびタスクごとの公開結果:
https://github.com/fstandhartinger/jevbench
サインアップ不要のデモが2つあります:
https://who-is-right.app.mintapis.com
https://is-it-ai-slop.app.mintapis.com
制限事項: 英語のみ。ドイツのサーバー1台からのレイテンシ。ローカル/デモのレイテンシには、開示済みのx2調整(私のサーバーで+150ミリ秒)が適用されます。これは情報に基づいた仮定です。評価対象のプロンプトは、評価サービスに到達します。約1ポイントの差はノイズである可能性があります。
どう思いますか?