HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

OpenRouterを使いたいですか?

So you want to use OpenRouter? (mmoustafa.com)

59 pointsby player852 コメント

要約

OpenRouterは、オープンソースモデルを介してAIアシスタントを動作させるためのプラットフォームですが、利用には多くの落とし穴があります。同じモデルでもプロバイダーによってベンチマーク結果が大きく異なり、ビジョンモデルでは一部のプロバイダーが画像認識に失敗することがあります。また、`effort`パラメータの挙動や、量子化(精度)が必ずしも品質に直結しないことも注意が必要です。OpenRouterを利用する際は、これらの点を理解し、ワークロードに合ったプロバイダーを慎重に選ぶことが重要です。

全文翻訳

一見すると簡単に見えるかもしれませんが、残念ながら問題は山積みです。私はOllyという、iMessage内で動作するAIアシスタントを、OpenRouter経由でオープンソースモデル上で実行しています。これまでにOllyは1800万件以上のメッセージを処理しており、そのうち約3分の1はOpenRouter経由のオープンモデルによるものです。このボリュームがあれば、あらゆるエッジケースに少なくとも一度は遭遇するはずです。そこで、事前に知っておきたかったことのリストをここに示します。まず、簡単な用語解説です。モデルとは重みのことです。プロバイダーとは、OpenRouterがルーティングする相手であり、モデルをGPU上で、彼らが選択した精度と独自の最適化でホストしています。彼らは独自のXML/ツールパーサーを持っており、それは独自のバグのリストも意味します。deepseek/deepseek-v4-flashをリクエストすると、約20社の、ほとんど聞いたことのない企業のうちの1社にルーティングされます。紙の上では同じモデルですが、現実世界では非常に異なるモデルです。さて、注意すべき落とし穴をいくつか紹介します。 1. 同じモデルでもベンチマーク結果が大きく異なる OpenRouterは、同じモデルに対してプロバイダーごとのベンチマークを実行しています。GPQA DiamondとTAU-Bench Airline(ツール呼び出しタスク)です。これは、DeepSeek V4 Flash 0731の今日のボードで、全く同じ重みをサービスしている各プロバイダーのデータです。DeepSeek V4 Flash 0731、プロバイダーごとの1ドット、2026-09-07 GPQA Diamond (知識) TAU-Bench Airline (ツール呼び出し) DeepSeek: GPQA 90.2%, TAU 81.3% (ファーストパーティ) NextBit: GPQA 89.9%, TAU 76.6% Alibaba Cloud Int.: GPQA 89.4%, TAU 76.8% SiliconFlow: GPQA 90.0%, TAU 75.4% NovitaAI: GPQA 89.3%, TAU 76.0% Ionstream: GPQA 87.2%, TAU 78.0% Ionstream GMICloud: GPQA 89.0%, TAU 75.8% Reka AI: GPQA 89.1%, TAU 75.4% Parasail: GPQA 89.0%, TAU 75.4% Baidu Qianfan: GPQA 89.6%, TAU 74.8% Cloudflare: GPQA 88.4%, TAU 75.0% CoreWeave: GPQA 87.1%, TAU 76.0% DeepInfra: GPQA 89.2%, TAU 73.9% StreamLake: GPQA 87.8%, TAU 74.9% Phala: GPQA 88.2%, TAU 74.5% Inceptron: GPQA 87.9%, TAU 74.1% AtlasCloud: GPQA 88.3%, TAU 73.6% Together: GPQA 86.9%, TAU 75.0% Decart: GPQA 87.9%, TAU 73.3% Venice: GPQA 86.8%, TAU 74.2% AkashML: GPQA 88.5%, TAU 72.5% Morph: GPQA 85.8%, TAU 74.9% Wafer: GPQA 84.1%, TAU 76.0% Wafer Ambient: GPQA 86.4%, TAU 73.5% Relace: GPQA 87.2%, TAU 71.7% Io Net: GPQA 84.1%, TAU 74.5% Makora: GPQA 86.9%, TAU 71.7% Mancer: GPQA 85.5%, TAU 70.8% Mancer Sail Research: GPQA 70.8%, TAU 75.2% Sail Research OpenInference: GPQA 70.5%, TAU 70.8% OpenInference Nebius: GPQA 75.6%, TAU 65.3% Nebius DigitalOcean: GPQA 75.3%, TAU 58.4% DigitalOcean OpenRouterのdeepseek/deepseek-v4-flash-0731のプロバイダーごとのボード、2026-09-07。32日間の移動平均。ドットにカーソルを合わせると名前が表示されます。 ファーストパーティのDeepSeek: GPQA 90%, TAU 81%。同じ重みを持つDigitalOcean: 75%と58%。ほとんどのホストはツール呼び出しでファーストパーティより5〜7ポイント下回り、4つは知識で大きく落ち込みます。エージェントにとってTAUは重要なスコアであり、20ポイントの変動はノイズではありません。(7月はさらに悪く、FireworksはTAUで46%を記録し、30ポイントのギャップがありました。)プロバイダーを信頼する前に、ワークロードに最も近いベンチマークのボードを確認してください。モデルを切り替えるときは再確認してください。同じプロバイダーでもGLM-5.3では全く異なる結果になりました。 2. ビジョンモデルには「盲目」なプロバイダーがいる 画像タスクで奇妙な非決定的な動作に気づいたため、2つのオープンビジョンモデル(Qwen3.5 122B、2026-07-31)と(MiniMax M3、2026-07-31)の各ホストに同じ3つの小さな画像(文字、単色、背景に単語)を入力しました。 Qwen3.5 122B, 2026-07-31 文字 K / 単色 赤 / 背景に単語「umbrella」 DeepInfra ✗ R / I と読み間違え ✗ 青と判断 ✗ 「面白い、水色」と説明 Alibaba ✓ ✓ ✓ AtlasCloud ✓ ✓ ✓ Novita ✓ ✓ ✓ SiliconFlow ✓ ✓ ✓ MiniMax M3, 2026-07-31 文字 word / 色 Venice ✗ 「画像が提供されていません」 ✗ 同様 ✗ 同様 Together ✗ 「画像が提供されていません」 ✗ 同様 ✗ 同様 その他、ファーストパーティを含む ✓ ✓ ✗ どこでも色が間違っている 各ホストの結果は2026-07-31に記録されました。MiniMaxの色認識ミスは、ファーストパーティを含むすべてのホストで発生したため、これはモデルの問題であり、プロバイダーの問題ではありません。DeepInfraのQwenエンドポイントは、KをRと読み間違え、赤を青と呼び、「umbrella」という単語を「面白い」と説明しましたが、同じ重みを持つ他の4つのホストはすべて正しく認識しました。VeniceとTogetherはMiniMaxの画像を全く認識しませんでした。モデルページでは画像入力をサポートしているとされていますが、2つのプロバイダーはサポートしておらず、さらに悪いことにすべて200 OKと偽ります。 3. `effort`パラメータは一部のプロバイダーではオプション `reasoning.effort`はどこでも受け付けられます。それが機能するかどうかは、モデルとプロバイダーによります。DeepSeek V4 Flash 0731を提供するすべてのプロバイダーをピン留めし、同じプロンプトを低、高、最大設定で、それぞれ3回、本番環境のマシンから送信しました。以下は、その結果の`reasoning`トークン出力です。 DeepSeek V4 Flash 0731 via OpenRouter, 2026-09-07: `effort`は機能するか? 0 500 1000 1500 2000 alibaba atlas-cloud baseten cloudflare coreweave deepinfra digitalocean gmicloud mancer morph nextbit novita open-inference parasail phala reka relace sail-research siliconflow streamlake together venice wafer `reasoning`トークン数/コール、同じプロンプト、プロバイダーピン留め、`effort`設定ごとに3コール。 ● low ● high ● max DeepSeek V4 Flash 0731では、ほとんどのプロバイダーが設定を尊重していますが、digitalocean、gmi-cloud、mancer、veniceを見てください。`effort`設定ごとの`reasoning`トークンをプロバイダーごとに追跡してください。 4. 量子化フィルターは品質を保証しない OpenRouterでは、プロバイダーを宣言された精度、量子化(例: fp4ではなくfp8)でフィルタリングできます。直感としては、ビット数が少ないほどモデルは劣るということです。DeepSeekで1ヶ月間そのフィルターを使用しました。その後、プロバイダーごとのベンチマークボードを、各プロバイダーが宣言しているものと並べてみました。 DeepSeek V4 Flash 0731: GPQA Diamond by declared quantization fp4 (5): Reka AI: 89.1%, Inceptron: 87.9%, AtlasCloud: 88.3%, Relace: 87.2%, Sail Research: 70.8% fp8 (11): Baseten: 88.0%, NextBit: 89.9%, SiliconFlow: 90.0%, NovitaAI: 89.3%, GMICloud: 89.0%, Parasail: 89.0%, Baidu Qianfan: 89.6%, CoreWeave: 87.1%, DeepInfra: 89.2%, StreamLake: 87.8%, OpenInference: 70.5% bf16 (1): Morph: 85.8% unknown (10): Fireworks: 88.9%, DeepSeek: 90.2%, DeepSeek Alibaba Cloud Int.: 89.4%, Cloudflare: 88.4%, Phala: 88.2%, Together: 86.9%, Venice: 86.8%, Wafer: 84.1%, Makora: 86.9%, DigitalOcean: 75.3% DeepSeek V4 Flash 0731: TAU-Bench Airline by declared quantization fp4 (5): Reka AI: 75.4%, Inceptron: 74.1%, AtlasCloud: 73.6%, Relace: 71.7%, Sail Research: 75.2% fp8 (10): NextBit: 76.6%, SiliconFlow: 75.4%, NovitaAI: 76.0%, GMICloud: 75.8%, Parasail: 75.4%, Baidu Qianfan: 74.8%, CoreWeave: 76.0%, DeepInfra: 73.9%, StreamLake: 74.9%, OpenInference: 70.8% bf16 (1): Morph: 74.9% unknown (9): DeepSeek: 81.3%, DeepSeek Alibaba Cloud Int.: 76.8%, Cloudflare: 75.0%, Phala: 74.5%, Together: 75.0%, Venice: 74.2%, Wafer: 76.0%, Makora: 71.7%, DigitalOcean: 58.4% GLM 5.3 Flash: GPQA Diamond by declared quantization fp4 (1): DeepInfra: 87.3% fp8 (14): CoreWeave: 85.1%, Baseten: 84.3%, Z.ai: 87.0%, Parasail: 85.8%, NextBit: 85.9%, StreamLake: 88.2%, NovitaAI: 85.5%, GMICloud: 85.7%, Modal: 83.0%, SiliconFlow: 83.3%, Reka AI: 86.7%, Morph: 84.6%, io.net: 73.6%, Sail Research: 50.7% bf16 (0): unknown (8): DigitalOcean: 89.6%, Together: 86.4%, Makora: 78.0%, Venice: 89.0%, Fireworks: 86.1%, Friendli: 84.4%, Wafer: 90.2%, Wafer Cloudflare: 84.4% GLM 5.3 Flash: TAU-Bench Airline by declared quantization fp4 (1): DeepInfra: 73.3% fp8 (9): Z.ai: 73.2%, Parasail: 74.0%, NextBit: 70.3%, StreamLake: 76.0%, NovitaAI: 77.9%, GMICloud: 75.5%, Modal: 78.6%, Reka AI: 75.0%, Morph: 74.7% bf16 (0): unknown (7): DigitalOcean: 73.3%, Together: 75.0%, Venice: 74.2%, Fireworks: 73.9%, Friendli: 74.8%, Wafer: 80.0%, Wafer Cloudflare: 74.6% プロバイダーごとのドット1つ。ボードのスコアと宣言された量子化は両方ともOpenRouter、2026-09-07より。その日エンドポイントリストにないボード上のプロバイダー(DeepSeekで7、GLMで1)は除外されています。 fp4ホストはfp8パックの中間に位置します。DeepSeekでの3つの最低GPQAスコアは、fp4ホスト、fp8ホスト、および何も宣言していないホストのそれぞれ1つです。GLMの両方のベンチマークで最高のスコアを出したWaferは、何も宣言していません。 精度は品質の悪い代理であり、