AI・機械学習
Ollaya – オープンソース、Jevスタイルの意思決定モデルのためのOllama
Ollaya – Ollama for open-source, Jev-style decision models (ollaya.dev)
要約
Ollayaは、ローカル環境で実行できるオープンソースの意思決定モデルフレームワークです。テキストやJSONに対して自然言語で質問し、ミリ秒単位で校正された回答を得ることができます。プライベートで、自身のハードウェア上で動作します。Ollamaにインスパイアされており、ローカルAPIを提供し、モデルのプルと実行が容易です。精度、キャリブレーション、実行モデルにおいてOllamaを上回る性能を示していますが、同じモデルではOllamaの方が高速な場合もあります。
全文翻訳
意思決定モデルをローカルで実行する。
テキストまたはJSONについてタイプされた質問をし、ミリ秒単位で校正された回答を得る。
プライベート、オープンソース、独自のハードウェア上で。
ダウンロード
モデルをブラウズする
OllamaまたはTypeSafeとは提携していない独立したオープンソースプロジェクト。
ollaya · zsh
$ ollaya run winnow:e4b "Third time this year you've double-charged me. Refund it today or I'm cancelling and moving to a competitor."
回答がモデルから返された
質問
回答
確率
intent
refund
0.91
is_urgent
yes
0.92
frustration
2.89 / 3 very angry
0.86
refund_requested
yes
0.99
churn_risk
yes
0.99
$ 実際の出力:winnow:e4b は RTX 4090 上で 87 ms で 5 つの質問に回答しました。
Ollaya と Ollama
Ollama に触発され、並べて測定。
Ollaya は Ollama の設計を採用しています:1つのバイナリ、プルと実行、ローカルAPI。Ollama 0.35 は現在、Nimble と Tev1 の 2 つの意思決定モデルも提供しているため、Bespoke Labs の公開ベンチマークで両方を同じ RTX 5090 上で実行しました。ベンチマークは、13 のデータセットからの 3,880 の人間によるラベル付けされた質問を、Bespoke 独自のコードでスコアリングしたものです。Ollaya は精度、キャリブレーション、および実行するモデルでリードしています。同じ Nimble 重みでは、Ollama の方が高速です。
0.773
最も正確:winnow:12b (Ollaya 上)
Ollama のベスト:0.749 (Nimble)
60ms
winnow:12b (質問あたり)
Nimble (Ollama 上):210 ms
5.5×
低いキャリブレーションエラー、同じ Nimble
ECE 0.022 (Ollaya 上)、0.122 (Ollama 上)
同じ GPU、同じ 3,880 の人間によるラベル付けされた質問 · 精度は高いほど良く、キャリブレーションエラーとレイテンシは低いほど良い
Ollaya 0.8.0
Ollama 0.35.0
モデル
精度
Acc.
ECE
レイテンシ
winnow:12b (Ollaya 上)
0.773
0.141
60 ms
decider:4b (Ollaya 上)
0.756
0.043
188 ms
kev:9b (Ollaya 上)
0.753
0.058
229 ms
nimble (Ollama 0.35 上)
0.749
0.122
210 ms
nimble:9b (Ollaya 上)
0.748
0.022
310 ms
tev1:4b (Ollama 0.35 上)
0.747
0.075
406 ms
winnow:e4b (Ollaya 上)
0.734
0.071
43 ms
decider:2b (Ollaya 上)
0.703
0.087
98 ms
tev1:0.8b (Ollama 0.35 上)
0.639
0.129
61 ms
laya:multilingual (Ollaya 上)
0.579
0.155
14 ms
0.55
0.60
0.65
0.70
0.75
0.80
Ollaya
Ollama 0.35
意思決定モデル
Ollaya
16 ファミリ:エンコーダー(laya, nli, gliclass, von)とデコーダー(winnow, clef, kev, decider, nimble, jeb, jeeves, cygnet など)
Ollama 0.35
Nimble と Tev1、デコーダーのみ
小さいエンコーダー(ミリ秒、CPUフレンドリー)
Ollaya
laya, nli, gliclass, von
Ollama 0.35
なし
確率
Ollaya
各著者の調整済み温度でキャリブレーション済み、Modelfile で再調整可能
Ollama 0.35
生のソフトマックス;キャリブレーションされていないと文書化されている
質問あたりのオプション
Ollaya
TypeSafe のように最大 255 個
Ollama 0.35
最大 26 個
リクエストあたりの質問
Ollaya
TypeSafe のように最大 256 個
Ollama 0.35
最大 64 個
TypeSafe エンドポイント
Ollaya
/v1/systemone, /v1/decisions, /v1/models
Ollama 0.35
なし
言語ルーティング
Ollaya
laya はリクエストごとに英語または多言語を選択
Ollama 0.35
なし
重み
Ollaya
コミットと sha256 でピン留めされた著者のファイル
Ollama 0.35
GGUF に変換され、再ホストされた
Bespoke Labs の公開ベンチマーク、Ollaya 0.8.0 および Ollama 0.35.0 で一度に1つのリクエスト。精度は13のデータセット全体の平均。ECE はトップ確率のキャリブレーションエラー。レイテンシはHTTPを含む中央値リクエスト。Ollama は llama.cpp 上で Nimble を Q8_0 で実行し、Ollaya は fp32 で著者の温度を使用。
すべての結果、すべてのマシン、生データ付き
高速で正確
Jev の精度に近い、100 ms 未満。
意思決定モデルは、単一のフォワードパスで、トークンごとの生成なしで回答します。RTX 4090 では、winnow:e4b は 5 つの質問のリクエストにエンドツーエンドで 89 ms で回答し、TypeSafe のホストされた Jev の 0.738 に対して 0.722 のタイプ別決定でスコア付けされます。laya のような小さいモデルは、約 10 ms で回答し、CPU 上でうまく実行されます。
89ms
winnow:e4b (Ollaya 上)
RTX 4090、5 つの質問 · 0.722 精度
236–276ms
TypeSafe Jev
ホスト API、中央値リクエスト · 0.738 精度
精度と速度のすべてのモデル · タイプ別決定の精度は高いほど良く、レイテンシは低いほど良い
Ollaya
TypeSafe のホストされた Jev
モデル
精度
レイテンシ
TypeSafe Jev (ホスト API)
0.738
236–276 ms
winnow:e4b
0.722
89 ms
kev:9b
0.722
498 ms
clef:flash
0.703
532 ms
winnow:12b
0.702
131 ms
cygnet:12b
0.683
202 ms
decider:4b
0.680
520 ms
jeeves:9b
0.680
838 ms
kev:4b
0.669
354 ms
nimble:9b
0.665
2297 ms
jevk5:4b
0.625
105 ms
decider:2b
0.591
190 ms
nli
0.548
20 ms
decider:0.8b
0.506
155 ms
gliclass
0.477
15 ms
kev:0.8b
0.460
128 ms
von
0.447
23 ms
laya:en
0.361
10 ms
clm:8b (質問キャッシュ済み)
0.357
149 ms
0
0.20
0.40
0.60
0.80
精度:タイプ別決定テスト分割(400状態、2,000質問)を多数派ラベルと比較。Jev の結果は、同じ質問に対する Winnow のレポートから。laya:typed-decisions および jeb はこのデータセットでトレーニングされたため除外。レイテンシ:RTX 4090 上での中央値 5 質問リクエスト(clm は質問キャッシュ済み)。Jev の結果は、サードパーティのベンチマーク(AbdelStark/jev-benchmarks, nibzard/decision-model-benchmark)でのホスト API で、ネットワークを含むため、桁で比較してください。
ドロップイン互換
TypeSafe の API を話す。
Ollaya は TypeSafe のリクエストとレスポンスの形状で /v1/systemone および /v1/models を提供します。公式の TypeSafe Python SDK 0.7.1 は、ローカルサーバーに対して変更なしで動作します。
リクエスト
# TypeSafe SDK を Ollaya にポイントする
export TYPESAFE_BASE_URL=http://localhost:11435
export TYPESAFE_API_KEY=local # 任意の値を指定
export TYPESAFE_DEFAULT_MODEL=winnow:e4b
# ...または互換性のあるエンドポイントを直接呼び出す
curl http://localhost:11435/v1/systemone -d '{ "model": "winnow:e4b", "state": "Can I get an invoice for last month?", "questions": { "intent": { "type": "choice", "instructions": "What does the customer want?", "criteria": { "invoice": "Needs an invoice or receipt", "refund": "Wants money back", "other": "Anything else" } } } }'
レスポンス
{
"model": "winnow:e4b",
"answers": {
"intent": {
"type": "choice",
"choice": "invoice",
"confidence": 0.9801,
"probabilities": {
"invoice": 0.9868,
"refund": 0.0026,
"other": 0.0106
}
}
},
"usage": {
"input_tokens": 120,
"output_tokens": 0
}
}
TypeSafe 互換性ガイド
オープンモデル
プル可能なオープンウェイト。
必要なものを選んでください:winnow:e4b は精度と速度のバランスが最も良く、laya は最も高速で CPU 上でうまく動作します。kev と decider は 9B および 4B までスケールアップし、von は最大 8,192 トークンを読み取り、qwen3guard はテキストを安全性についてスクリーニングします。モデルページには、各モデルの精度と速度が表示されています。
winnow
EldanRing による意思決定モデル。Google の Gemma 4 からファインチューニングされ、GGUF として公開されています。Winnow は、独自のプロンプトの後に回答ラベルのロジットを読み取ります。Ollaya は、NVIDIA GPU、Apple Silicon、または CPU 上で llama.cpp 上で著者のファイルを実行します。
7.5b · 12b
laya
Convai Innovations によるオープン意思決定モデル。タイプされた、キャリブレーションされた回答を、単一のフォワードパスで、英語と 100 以上の言語で、選択、スコア、はい/いいえの質問に対して提供します。
322m · 421m
decider
Mapika によるデコーダー意思決定モデル。Qwen3.5 上で実行:回答は、単一のフォワードパスで、オプション文字のロジットから読み取られます。decider:4b はタイプ別決定で 0.680、decider:2b は 0.591 をスコアします。
0.75b · 1.9b · 2.2b · 4.2b
kev
Jared Palmer による意思決定モデル:Qwen3.5 ベースの LoRA にポインターヘッドを追加し、各質問に対して単一のフォワードパスで、独自のスパンのすべてのオプションをスコアリングします。Kev 独自の温度でキャリブレーションされています。
0.76b · 4.2b · 7.9b
nli
Moritz Laurer によるゼロショット分類子:すべてのオプションが含意のためにスコアリングされる仮説になります。テストで最も正確なエンコーダーモデル。
396m · 435m
gliclass
Knowledgator による命令追従ゼロショット分類子:質問のすべてのオプションが 1 回のパスでスコアリングされるため、オプションの数が増えてもコストはほとんど増加しません。
439m
qwen3guard
Qwen チームによる安全性ガード:テキストは安全か、論争の的か、それとも安全でないか、そしてどの安全でないカテゴリか? 119 の言語で、単一のフォワードパスで、独自の組み込み質問に回答します。
0.6b
decision
vLLM Semantic Router の貢献者による意思決定モデル:完全にファインチューニングされた Qwen3.5 バックボーンと、各質問に対して最後のトークンで各オプションをスコアリングするエンドポイントヘッド。質問あたり単一のフォワードパス。16k トークン行。
0.75b
すべてのモデルをブラウズする
あなたのデータはあなたのものです
デフォルトでプライベート。
チケット、メール、ユーザーメッセージは、しばしばあなたが持つ最も機密性の高いデータです。Ollaya を使用すると、それらは既に存在する場所でスコアリングされます。
ローカル
CPU または NVIDIA GPU 上の ONNX Runtime で実行されます。サーバーはデフォルトで 127.0.0.1 でリッスンします。
オープンウェイト
ウェイトは、著者の Hugging Face リポジトリから取得され、コミットにピン留めされ、チェックされます。