AI・機械学習
OpenRouterを使いたいですか?
So you want to use OpenRouter? (mmoustafa.com)
要約
OpenRouterは、オープンソースモデルを介してAIアシスタントを動作させるためのプラットフォームですが、利用には多くの落とし穴があります。同じモデルでもプロバイダーによってベンチマーク結果が大きく異なり、ビジョンモデルでは一部のプロバイダーが画像認識に失敗することがあります。また、`effort`パラメータの挙動や、量子化(精度)が必ずしも品質に直結しないことも注意が必要です。OpenRouterを利用する際は、これらの点を理解し、ワークロードに合ったプロバイダーを慎重に選ぶことが重要です。
全文翻訳
一見すると簡単に見えるかもしれませんが、残念ながら問題は山積みです。私はOllyという、iMessage内で動作するAIアシスタントを、OpenRouter経由でオープンソースモデル上で実行しています。これまでにOllyは1800万件以上のメッセージを処理しており、そのうち約3分の1はOpenRouter経由のオープンモデルによるものです。このボリュームがあれば、あらゆるエッジケースに少なくとも一度は遭遇するはずです。そこで、事前に知っておきたかったことのリストをここに示します。まず、簡単な用語解説です。モデルとは重みのことです。プロバイダーとは、OpenRouterがルーティングする相手であり、モデルをGPU上で、彼らが選択した精度と独自の最適化でホストしています。彼らは独自のXML/ツールパーサーを持っており、それは独自のバグのリストも意味します。deepseek/deepseek-v4-flashをリクエストすると、約20社の、ほとんど聞いたことのない企業のうちの1社にルーティングされます。紙の上では同じモデルですが、現実世界では非常に異なるモデルです。さて、注意すべき落とし穴をいくつか紹介します。
1. 同じモデルでもベンチマーク結果が大きく異なる
OpenRouterは、同じモデルに対してプロバイダーごとのベンチマークを実行しています。GPQA DiamondとTAU-Bench Airline(ツール呼び出しタスク)です。これは、DeepSeek V4 Flash 0731の今日のボードで、全く同じ重みをサービスしている各プロバイダーのデータです。DeepSeek V4 Flash 0731、プロバイダーごとの1ドット、2026-09-07
GPQA Diamond (知識)
TAU-Bench Airline (ツール呼び出し)
DeepSeek: GPQA 90.2%, TAU 81.3% (ファーストパーティ)
NextBit: GPQA 89.9%, TAU 76.6%
Alibaba Cloud Int.: GPQA 89.4%, TAU 76.8%
SiliconFlow: GPQA 90.0%, TAU 75.4%
NovitaAI: GPQA 89.3%, TAU 76.0%
Ionstream: GPQA 87.2%, TAU 78.0%
Ionstream GMICloud: GPQA 89.0%, TAU 75.8%
Reka AI: GPQA 89.1%, TAU 75.4%
Parasail: GPQA 89.0%, TAU 75.4%
Baidu Qianfan: GPQA 89.6%, TAU 74.8%
Cloudflare: GPQA 88.4%, TAU 75.0%
CoreWeave: GPQA 87.1%, TAU 76.0%
DeepInfra: GPQA 89.2%, TAU 73.9%
StreamLake: GPQA 87.8%, TAU 74.9%
Phala: GPQA 88.2%, TAU 74.5%
Inceptron: GPQA 87.9%, TAU 74.1%
AtlasCloud: GPQA 88.3%, TAU 73.6%
Together: GPQA 86.9%, TAU 75.0%
Decart: GPQA 87.9%, TAU 73.3%
Venice: GPQA 86.8%, TAU 74.2%
AkashML: GPQA 88.5%, TAU 72.5%
Morph: GPQA 85.8%, TAU 74.9%
Wafer: GPQA 84.1%, TAU 76.0%
Wafer Ambient: GPQA 86.4%, TAU 73.5%
Relace: GPQA 87.2%, TAU 71.7%
Io Net: GPQA 84.1%, TAU 74.5%
Makora: GPQA 86.9%, TAU 71.7%
Mancer: GPQA 85.5%, TAU 70.8%
Mancer Sail Research: GPQA 70.8%, TAU 75.2%
Sail Research OpenInference: GPQA 70.5%, TAU 70.8%
OpenInference Nebius: GPQA 75.6%, TAU 65.3%
Nebius DigitalOcean: GPQA 75.3%, TAU 58.4%
DigitalOcean
OpenRouterのdeepseek/deepseek-v4-flash-0731のプロバイダーごとのボード、2026-09-07。32日間の移動平均。ドットにカーソルを合わせると名前が表示されます。
ファーストパーティのDeepSeek: GPQA 90%, TAU 81%。同じ重みを持つDigitalOcean: 75%と58%。ほとんどのホストはツール呼び出しでファーストパーティより5〜7ポイント下回り、4つは知識で大きく落ち込みます。エージェントにとってTAUは重要なスコアであり、20ポイントの変動はノイズではありません。(7月はさらに悪く、FireworksはTAUで46%を記録し、30ポイントのギャップがありました。)プロバイダーを信頼する前に、ワークロードに最も近いベンチマークのボードを確認してください。モデルを切り替えるときは再確認してください。同じプロバイダーでもGLM-5.3では全く異なる結果になりました。
2. ビジョンモデルには「盲目」なプロバイダーがいる
画像タスクで奇妙な非決定的な動作に気づいたため、2つのオープンビジョンモデル(Qwen3.5 122B、2026-07-31)と(MiniMax M3、2026-07-31)の各ホストに同じ3つの小さな画像(文字、単色、背景に単語)を入力しました。
Qwen3.5 122B, 2026-07-31
文字 K / 単色 赤 / 背景に単語「umbrella」
DeepInfra ✗ R / I と読み間違え ✗ 青と判断 ✗ 「面白い、水色」と説明
Alibaba ✓ ✓ ✓
AtlasCloud ✓ ✓ ✓
Novita ✓ ✓ ✓
SiliconFlow ✓ ✓ ✓
MiniMax M3, 2026-07-31
文字 word / 色
Venice ✗ 「画像が提供されていません」 ✗ 同様 ✗ 同様
Together ✗ 「画像が提供されていません」 ✗ 同様 ✗ 同様
その他、ファーストパーティを含む ✓ ✓ ✗ どこでも色が間違っている
各ホストの結果は2026-07-31に記録されました。MiniMaxの色認識ミスは、ファーストパーティを含むすべてのホストで発生したため、これはモデルの問題であり、プロバイダーの問題ではありません。DeepInfraのQwenエンドポイントは、KをRと読み間違え、赤を青と呼び、「umbrella」という単語を「面白い」と説明しましたが、同じ重みを持つ他の4つのホストはすべて正しく認識しました。VeniceとTogetherはMiniMaxの画像を全く認識しませんでした。モデルページでは画像入力をサポートしているとされていますが、2つのプロバイダーはサポートしておらず、さらに悪いことにすべて200 OKと偽ります。
3. `effort`パラメータは一部のプロバイダーではオプション
`reasoning.effort`はどこでも受け付けられます。それが機能するかどうかは、モデルとプロバイダーによります。DeepSeek V4 Flash 0731を提供するすべてのプロバイダーをピン留めし、同じプロンプトを低、高、最大設定で、それぞれ3回、本番環境のマシンから送信しました。以下は、その結果の`reasoning`トークン出力です。
DeepSeek V4 Flash 0731 via OpenRouter, 2026-09-07: `effort`は機能するか?
0 500 1000 1500 2000
alibaba
atlas-cloud
baseten
cloudflare
coreweave
deepinfra
digitalocean
gmicloud
mancer
morph
nextbit
novita
open-inference
parasail
phala
reka
relace
sail-research
siliconflow
streamlake
together
venice
wafer
`reasoning`トークン数/コール、同じプロンプト、プロバイダーピン留め、`effort`設定ごとに3コール。
● low ● high ● max
DeepSeek V4 Flash 0731では、ほとんどのプロバイダーが設定を尊重していますが、digitalocean、gmi-cloud、mancer、veniceを見てください。`effort`設定ごとの`reasoning`トークンをプロバイダーごとに追跡してください。
4. 量子化フィルターは品質を保証しない
OpenRouterでは、プロバイダーを宣言された精度、量子化(例: fp4ではなくfp8)でフィルタリングできます。直感としては、ビット数が少ないほどモデルは劣るということです。DeepSeekで1ヶ月間そのフィルターを使用しました。その後、プロバイダーごとのベンチマークボードを、各プロバイダーが宣言しているものと並べてみました。
DeepSeek V4 Flash 0731: GPQA Diamond by declared quantization
fp4 (5): Reka AI: 89.1%, Inceptron: 87.9%, AtlasCloud: 88.3%, Relace: 87.2%, Sail Research: 70.8%
fp8 (11): Baseten: 88.0%, NextBit: 89.9%, SiliconFlow: 90.0%, NovitaAI: 89.3%, GMICloud: 89.0%, Parasail: 89.0%, Baidu Qianfan: 89.6%, CoreWeave: 87.1%, DeepInfra: 89.2%, StreamLake: 87.8%, OpenInference: 70.5%
bf16 (1): Morph: 85.8%
unknown (10): Fireworks: 88.9%, DeepSeek: 90.2%, DeepSeek Alibaba Cloud Int.: 89.4%, Cloudflare: 88.4%, Phala: 88.2%, Together: 86.9%, Venice: 86.8%, Wafer: 84.1%, Makora: 86.9%, DigitalOcean: 75.3%
DeepSeek V4 Flash 0731: TAU-Bench Airline by declared quantization
fp4 (5): Reka AI: 75.4%, Inceptron: 74.1%, AtlasCloud: 73.6%, Relace: 71.7%, Sail Research: 75.2%
fp8 (10): NextBit: 76.6%, SiliconFlow: 75.4%, NovitaAI: 76.0%, GMICloud: 75.8%, Parasail: 75.4%, Baidu Qianfan: 74.8%, CoreWeave: 76.0%, DeepInfra: 73.9%, StreamLake: 74.9%, OpenInference: 70.8%
bf16 (1): Morph: 74.9%
unknown (9): DeepSeek: 81.3%, DeepSeek Alibaba Cloud Int.: 76.8%, Cloudflare: 75.0%, Phala: 74.5%, Together: 75.0%, Venice: 74.2%, Wafer: 76.0%, Makora: 71.7%, DigitalOcean: 58.4%
GLM 5.3 Flash: GPQA Diamond by declared quantization
fp4 (1): DeepInfra: 87.3%
fp8 (14): CoreWeave: 85.1%, Baseten: 84.3%, Z.ai: 87.0%, Parasail: 85.8%, NextBit: 85.9%, StreamLake: 88.2%, NovitaAI: 85.5%, GMICloud: 85.7%, Modal: 83.0%, SiliconFlow: 83.3%, Reka AI: 86.7%, Morph: 84.6%, io.net: 73.6%, Sail Research: 50.7%
bf16 (0):
unknown (8): DigitalOcean: 89.6%, Together: 86.4%, Makora: 78.0%, Venice: 89.0%, Fireworks: 86.1%, Friendli: 84.4%, Wafer: 90.2%, Wafer Cloudflare: 84.4%
GLM 5.3 Flash: TAU-Bench Airline by declared quantization
fp4 (1): DeepInfra: 73.3%
fp8 (9): Z.ai: 73.2%, Parasail: 74.0%, NextBit: 70.3%, StreamLake: 76.0%, NovitaAI: 77.9%, GMICloud: 75.5%, Modal: 78.6%, Reka AI: 75.0%, Morph: 74.7%
bf16 (0):
unknown (7): DigitalOcean: 73.3%, Together: 75.0%, Venice: 74.2%, Fireworks: 73.9%, Friendli: 74.8%, Wafer: 80.0%, Wafer Cloudflare: 74.6%
プロバイダーごとのドット1つ。ボードのスコアと宣言された量子化は両方ともOpenRouter、2026-09-07より。その日エンドポイントリストにないボード上のプロバイダー(DeepSeekで7、GLMで1)は除外されています。
fp4ホストはfp8パックの中間に位置します。DeepSeekでの3つの最低GPQAスコアは、fp4ホスト、fp8ホスト、および何も宣言していないホストのそれぞれ1つです。GLMの両方のベンチマークで最高のスコアを出したWaferは、何も宣言していません。
精度は品質の悪い代理であり、