HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Ollaya – オープンソース、Jevスタイルの意思決定モデルのためのOllama

Ollaya – Ollama for open-source, Jev-style decision models (ollaya.dev)

617 pointsby Ardakilic145 コメント

要約

Ollayaは、ローカル環境で実行できるオープンソースの意思決定モデルフレームワークです。テキストやJSONに対して自然言語で質問し、ミリ秒単位で校正された回答を得ることができます。プライベートで、自身のハードウェア上で動作します。Ollamaにインスパイアされており、ローカルAPIを提供し、モデルのプルと実行が容易です。精度、キャリブレーション、実行モデルにおいてOllamaを上回る性能を示していますが、同じモデルではOllamaの方が高速な場合もあります。

全文翻訳

意思決定モデルをローカルで実行する。 テキストまたはJSONについてタイプされた質問をし、ミリ秒単位で校正された回答を得る。 プライベート、オープンソース、独自のハードウェア上で。 ダウンロード モデルをブラウズする OllamaまたはTypeSafeとは提携していない独立したオープンソースプロジェクト。 ollaya · zsh $ ollaya run winnow:e4b "Third time this year you've double-charged me. Refund it today or I'm cancelling and moving to a competitor." 回答がモデルから返された 質問 回答 確率 intent refund 0.91 is_urgent yes 0.92 frustration 2.89 / 3 very angry 0.86 refund_requested yes 0.99 churn_risk yes 0.99 $ 実際の出力:winnow:e4b は RTX 4090 上で 87 ms で 5 つの質問に回答しました。 Ollaya と Ollama Ollama に触発され、並べて測定。 Ollaya は Ollama の設計を採用しています:1つのバイナリ、プルと実行、ローカルAPI。Ollama 0.35 は現在、Nimble と Tev1 の 2 つの意思決定モデルも提供しているため、Bespoke Labs の公開ベンチマークで両方を同じ RTX 5090 上で実行しました。ベンチマークは、13 のデータセットからの 3,880 の人間によるラベル付けされた質問を、Bespoke 独自のコードでスコアリングしたものです。Ollaya は精度、キャリブレーション、および実行するモデルでリードしています。同じ Nimble 重みでは、Ollama の方が高速です。 0.773 最も正確:winnow:12b (Ollaya 上) Ollama のベスト:0.749 (Nimble) 60ms winnow:12b (質問あたり) Nimble (Ollama 上):210 ms 5.5× 低いキャリブレーションエラー、同じ Nimble ECE 0.022 (Ollaya 上)、0.122 (Ollama 上) 同じ GPU、同じ 3,880 の人間によるラベル付けされた質問 · 精度は高いほど良く、キャリブレーションエラーとレイテンシは低いほど良い Ollaya 0.8.0 Ollama 0.35.0 モデル 精度 Acc. ECE レイテンシ winnow:12b (Ollaya 上) 0.773 0.141 60 ms decider:4b (Ollaya 上) 0.756 0.043 188 ms kev:9b (Ollaya 上) 0.753 0.058 229 ms nimble (Ollama 0.35 上) 0.749 0.122 210 ms nimble:9b (Ollaya 上) 0.748 0.022 310 ms tev1:4b (Ollama 0.35 上) 0.747 0.075 406 ms winnow:e4b (Ollaya 上) 0.734 0.071 43 ms decider:2b (Ollaya 上) 0.703 0.087 98 ms tev1:0.8b (Ollama 0.35 上) 0.639 0.129 61 ms laya:multilingual (Ollaya 上) 0.579 0.155 14 ms 0.55 0.60 0.65 0.70 0.75 0.80 Ollaya Ollama 0.35 意思決定モデル Ollaya 16 ファミリ:エンコーダー(laya, nli, gliclass, von)とデコーダー(winnow, clef, kev, decider, nimble, jeb, jeeves, cygnet など) Ollama 0.35 Nimble と Tev1、デコーダーのみ 小さいエンコーダー(ミリ秒、CPUフレンドリー) Ollaya laya, nli, gliclass, von Ollama 0.35 なし 確率 Ollaya 各著者の調整済み温度でキャリブレーション済み、Modelfile で再調整可能 Ollama 0.35 生のソフトマックス;キャリブレーションされていないと文書化されている 質問あたりのオプション Ollaya TypeSafe のように最大 255 個 Ollama 0.35 最大 26 個 リクエストあたりの質問 Ollaya TypeSafe のように最大 256 個 Ollama 0.35 最大 64 個 TypeSafe エンドポイント Ollaya /v1/systemone, /v1/decisions, /v1/models Ollama 0.35 なし 言語ルーティング Ollaya laya はリクエストごとに英語または多言語を選択 Ollama 0.35 なし 重み Ollaya コミットと sha256 でピン留めされた著者のファイル Ollama 0.35 GGUF に変換され、再ホストされた Bespoke Labs の公開ベンチマーク、Ollaya 0.8.0 および Ollama 0.35.0 で一度に1つのリクエスト。精度は13のデータセット全体の平均。ECE はトップ確率のキャリブレーションエラー。レイテンシはHTTPを含む中央値リクエスト。Ollama は llama.cpp 上で Nimble を Q8_0 で実行し、Ollaya は fp32 で著者の温度を使用。 すべての結果、すべてのマシン、生データ付き 高速で正確 Jev の精度に近い、100 ms 未満。 意思決定モデルは、単一のフォワードパスで、トークンごとの生成なしで回答します。RTX 4090 では、winnow:e4b は 5 つの質問のリクエストにエンドツーエンドで 89 ms で回答し、TypeSafe のホストされた Jev の 0.738 に対して 0.722 のタイプ別決定でスコア付けされます。laya のような小さいモデルは、約 10 ms で回答し、CPU 上でうまく実行されます。 89ms winnow:e4b (Ollaya 上) RTX 4090、5 つの質問 · 0.722 精度 236–276ms TypeSafe Jev ホスト API、中央値リクエスト · 0.738 精度 精度と速度のすべてのモデル · タイプ別決定の精度は高いほど良く、レイテンシは低いほど良い Ollaya TypeSafe のホストされた Jev モデル 精度 レイテンシ TypeSafe Jev (ホスト API) 0.738 236–276 ms winnow:e4b 0.722 89 ms kev:9b 0.722 498 ms clef:flash 0.703 532 ms winnow:12b 0.702 131 ms cygnet:12b 0.683 202 ms decider:4b 0.680 520 ms jeeves:9b 0.680 838 ms kev:4b 0.669 354 ms nimble:9b 0.665 2297 ms jevk5:4b 0.625 105 ms decider:2b 0.591 190 ms nli 0.548 20 ms decider:0.8b 0.506 155 ms gliclass 0.477 15 ms kev:0.8b 0.460 128 ms von 0.447 23 ms laya:en 0.361 10 ms clm:8b (質問キャッシュ済み) 0.357 149 ms 0 0.20 0.40 0.60 0.80 精度:タイプ別決定テスト分割(400状態、2,000質問)を多数派ラベルと比較。Jev の結果は、同じ質問に対する Winnow のレポートから。laya:typed-decisions および jeb はこのデータセットでトレーニングされたため除外。レイテンシ:RTX 4090 上での中央値 5 質問リクエスト(clm は質問キャッシュ済み)。Jev の結果は、サードパーティのベンチマーク(AbdelStark/jev-benchmarks, nibzard/decision-model-benchmark)でのホスト API で、ネットワークを含むため、桁で比較してください。 ドロップイン互換 TypeSafe の API を話す。 Ollaya は TypeSafe のリクエストとレスポンスの形状で /v1/systemone および /v1/models を提供します。公式の TypeSafe Python SDK 0.7.1 は、ローカルサーバーに対して変更なしで動作します。 リクエスト # TypeSafe SDK を Ollaya にポイントする export TYPESAFE_BASE_URL=http://localhost:11435 export TYPESAFE_API_KEY=local # 任意の値を指定 export TYPESAFE_DEFAULT_MODEL=winnow:e4b # ...または互換性のあるエンドポイントを直接呼び出す curl http://localhost:11435/v1/systemone -d '{ "model": "winnow:e4b", "state": "Can I get an invoice for last month?", "questions": { "intent": { "type": "choice", "instructions": "What does the customer want?", "criteria": { "invoice": "Needs an invoice or receipt", "refund": "Wants money back", "other": "Anything else" } } } }' レスポンス { "model": "winnow:e4b", "answers": { "intent": { "type": "choice", "choice": "invoice", "confidence": 0.9801, "probabilities": { "invoice": 0.9868, "refund": 0.0026, "other": 0.0106 } } }, "usage": { "input_tokens": 120, "output_tokens": 0 } } TypeSafe 互換性ガイド オープンモデル プル可能なオープンウェイト。 必要なものを選んでください:winnow:e4b は精度と速度のバランスが最も良く、laya は最も高速で CPU 上でうまく動作します。kev と decider は 9B および 4B までスケールアップし、von は最大 8,192 トークンを読み取り、qwen3guard はテキストを安全性についてスクリーニングします。モデルページには、各モデルの精度と速度が表示されています。 winnow EldanRing による意思決定モデル。Google の Gemma 4 からファインチューニングされ、GGUF として公開されています。Winnow は、独自のプロンプトの後に回答ラベルのロジットを読み取ります。Ollaya は、NVIDIA GPU、Apple Silicon、または CPU 上で llama.cpp 上で著者のファイルを実行します。 7.5b · 12b laya Convai Innovations によるオープン意思決定モデル。タイプされた、キャリブレーションされた回答を、単一のフォワードパスで、英語と 100 以上の言語で、選択、スコア、はい/いいえの質問に対して提供します。 322m · 421m decider Mapika によるデコーダー意思決定モデル。Qwen3.5 上で実行:回答は、単一のフォワードパスで、オプション文字のロジットから読み取られます。decider:4b はタイプ別決定で 0.680、decider:2b は 0.591 をスコアします。 0.75b · 1.9b · 2.2b · 4.2b kev Jared Palmer による意思決定モデル:Qwen3.5 ベースの LoRA にポインターヘッドを追加し、各質問に対して単一のフォワードパスで、独自のスパンのすべてのオプションをスコアリングします。Kev 独自の温度でキャリブレーションされています。 0.76b · 4.2b · 7.9b nli Moritz Laurer によるゼロショット分類子:すべてのオプションが含意のためにスコアリングされる仮説になります。テストで最も正確なエンコーダーモデル。 396m · 435m gliclass Knowledgator による命令追従ゼロショット分類子:質問のすべてのオプションが 1 回のパスでスコアリングされるため、オプションの数が増えてもコストはほとんど増加しません。 439m qwen3guard Qwen チームによる安全性ガード:テキストは安全か、論争の的か、それとも安全でないか、そしてどの安全でないカテゴリか? 119 の言語で、単一のフォワードパスで、独自の組み込み質問に回答します。 0.6b decision vLLM Semantic Router の貢献者による意思決定モデル:完全にファインチューニングされた Qwen3.5 バックボーンと、各質問に対して最後のトークンで各オプションをスコアリングするエンドポイントヘッド。質問あたり単一のフォワードパス。16k トークン行。 0.75b すべてのモデルをブラウズする あなたのデータはあなたのものです デフォルトでプライベート。 チケット、メール、ユーザーメッセージは、しばしばあなたが持つ最も機密性の高いデータです。Ollaya を使用すると、それらは既に存在する場所でスコアリングされます。 ローカル CPU または NVIDIA GPU 上の ONNX Runtime で実行されます。サーバーはデフォルトで 127.0.0.1 でリッスンします。 オープンウェイト ウェイトは、著者の Hugging Face リポジトリから取得され、コミットにピン留めされ、チェックされます。