HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

GLM-5.3 (オープンウェイト) が Anthropic/OpenAI モデルをコストの1/5で上回る

GLM-5.3 (open-weight) beat Anthropic/OpenAI models – for 1/5 the cost (reinvently.co.uk)

207 pointsby ed-is-ai89 コメント

要約

Hacker Newsのリーダーボードテストでは、GLM-5.3が実際のタスクにおいてAnthropicやOpenAIのモデルをコストパフォーマンスで凌駕しました。このテストは、学術的な指標ではなく、実際のユーザーが直面するタスクに焦点を当て、28のリアルワールドタスクで評価されました。GLM-5.3は全タスクを100%クリアし、高い評価を得ましたが、応答速度(TTFT)は遅めでした。

全文翻訳

← 全ての投稿 モデルが私たちのリーダーボードを制覇するには?LLMは実際のテストでどのようにパフォーマンスを発揮したか。ここでは、学術的な指標ではなく、実際のユーザーが行う実際のタスクに焦点を当てました。評価を単純化するために、単一のタスクに焦点を当てています。エージェントフローは、最終的にはこのようなタスクの連続です。エージェントの単体テストと考えてください。テストスイート全体でもわずか30ドルで済むように、実行コストを十分に低く抑えました。各タスクと各モデルの実際の回答を見る、または2つのモデルを直接比較する → 合格率 ルブリック品質 コスト/タスク レイテンシ(TTFT) 全体スコアは、私の28のリアルワールドタスクにおける合格率です。試行回数が限られているため、ウィルソン区間が広く取られています — チャートのひげの部分です。結果の概要:選択したメトリックでソートするには、列をクリックしてください。# モデル 合格率(95% CI)▼ ルブリック /10 ▼ セキュリティ ▼ 中央値TTFT ▼ 実行コスト ▼ コスト/タスク ▼ これらの数値がどのように生成されたかについての4つの注意点1 ルブリックは、ハーネス自身のrun_rubricパスを通じて、保存された回答テキストに対して、fable-5によって遡って採点されました(2026年7月14日)— 他のすべての行と同じブラインドプロンプトと基準を使用しました。2 fable-5の9.3は自己採点です — 評価者が自身の回答を採点しています。そのソース実行の評価者バイアスマトリックスは、独立して評価するモデルに対して8.6〜8.7であるのに対し、自身を9.3と評価していることを示しています。また、これはその行で唯一、以前の実行(2026年7月5日の実行、28回の試行中11回が評価済み)からの数値です — 現在の実行の試行はまだ一度も評価されていないためです。比較のため示していますが、独立した再評価が保留されているため、同等のものではありません。3 レシピチェッカーの偽陽性。ベジタリアン向けの平日のレシピで、禁止用語チェッカーが、食材以外の言及(ラベルチェックの注意書きや「魚醤や動物由来の飾りは使用しない」といった否定的なリスト)に反応します。3つのレシピはすべて本物の肉なしレシピなので、gpt-5.5、sonnet-5、fable-5はここで合格と採点されています。タスクやチェッカーは編集されていません。4 fable-5とopus-5の回答試行のみで計算されたコスト/タスク — 拒否およびブロックされた試行は出力がほぼゼロでコスト$0であるため、それらを含めるとモデルが人工的に簡潔で安価に見えます(fable-5は1試行あたり$0.0481、opus-5は$0.0597になります)。opus-5の見出しの実行コスト$1.67は、全試行の合計です — ブロックされた試行は$0で請求されました。ボード上の他のモデルには拒否はありません。ラップ、コーナーごと # 最も最近追加されたモデルが最初に表示され、最新のテスト日が各モデルの下に示されています。ラップは固定順序の5つのコーナーで構成されています:コーディング → データ → リアルワールド → セキュリティ → ツール使用。コーナーの色は、そのカテゴリにおけるモデルの合格率です。緑は良好 — 85%以上の成功を意味します。すべてをこなせるモデルについては、すべて緑色を探してください。各リングの中央の数字は、モデルのタスクあたりのコストです。その下は、最初のトークンまでの平均時間(秒)です。セグメントにカーソルを合わせるかタップすると、そのコーナーが何をテストしているか、モデルがどのように処理したかがわかります。クリーンコーナー(>85%) ラギッド(60–85%) トラックアウト(<60%) ★私たちの選択 — オールスターチャンピオン、砂漠の島モデル 低コストワークホースの選択肢 ⚡最速応答の選択肢 カテゴリごとの正確な数値を確認してください 60%未満のセルは赤、60–85%はアンバーでフラグ付けされています — コーディング、データ、ツール使用はハーネスの床なので、レースはリアルワールドとセキュリティで決まります。モデル コーディング データ リアルワールド セキュリティ ツール使用 結果は実際に何を教えてくれるのか? 1つのモデルしか実行しない場合は、glm-5.3を実行してください glm-5.3は、コーディング、データ開発、リアルワールド、セキュリティ、タスクの5つのコーナーすべてを100%クリアしたボード上の最初のモデルです。9.3のルブリックスコア(ボードで3番目に高い)と、ラップあたり$0.28というコストでそれを補っています。唯一のコストは忍耐です — 最初のトークンまでの平均時間が16.3秒です。gpt-5.5は13.2秒でより高速な代替手段であり、セキュリティは100%同じですが、リアルワールドコーナーは89%、ラップあたりのコストは$1.43です。Fableは単一のラップを完了できませんでした fable-5は79%で共同最下位です。なぜなら、5つのタスクを実行することを拒否したからです。完了したタスクについてはうまくパフォーマンスを発揮しましたが、kimi-k3の方が良い回答を提供しているとさえ考えていました。Fableを使用する場合は、フォールバックモデルが必要になります。opus-5も同様の壁にぶつかりました — 4つの無害なコーディングデバッグ-*タスクが、トークンが生成される前にブロックされました。これはfable-5ですでにブロックされていたタスクと重複するセットです。そのため、Anthropicの分類子は、Fableだけでなく、シリーズ5全体にまたがっているようです。何が起こっているのかを実際に知るには、完全な拒否の内訳を参照してください。Lunaは最も安価なワークホースです gpt-5.6-lunaは、フルラップで$0.064、タスクあたり$0.0023、中央値TTFTは5.3秒です。これにより、高ボリューム、低リスクのバックグラウンド作業で、失敗を検出しやすく再試行しやすい場合に魅力的になります。トレードオフは大きいです。全体で79%、セキュリティで33%なので、すべての結果を検証し、信頼できないプロンプトから遠ざけてください。haiku-4-5は、タスクあたり$0.0044、全体で96%、TTFTは0.9秒の、より高パス率の代替手段です。deepseek-v4-proは、同じ96%のパス率でタスクあたり$0.0029と名目上さらに安価ですが、中央値TTFTが40.0秒(ボードで最も遅い)であるため、インタラクティブなものには適しません。バッチ処理専用オプションとして扱ってください。謎のゲストが最速の品質ラップを設定します kimi-k3は、96%の合格率でルブリックで9.5(fable-5によって独立評価)を維持していますが、opus-5の9.4も、待ち時間の3分の1で品質でそれに迫っています。問題は忍耐です。中央値TTFTは26.4秒(deepseek-v4-proの40.0秒に次いでボードで2番目に遅い)で、データ開発タスクでは75%の変動があります。これは唯一の弱いコーナーです。インタラクティブなアプリケーションには適していません。3台の車がクラッシュテストに失敗しました gpt-5.6ラインは高速ですが、安全性の問題があります。gpt-5.6-luna、gpt-5.6-terra、gpt-5.6-solは、12のジェイルブレイクセル中11でジェイルブレイクカナリア(セキュリティ合格率33〜50%)を発しました — ハーネスで保護し、これらのモデルを使用する場合は、より慎重なレッドチーミングを適用してください。Claudeトリオは6/6クリーンで、gpt-5.5も同様でした。安全フィルターは、悪いラップとまったく同じように見えることがあります。opus-5はデフォルトパネルで9.4の最高のルブリックと、リアルワールドとセキュリティの両方で100%を記録していますが、コーディングでは43%を示しています。このセルはデバッグ能力ではありません。4つの無害なコーディングデバッグ-*タスクが、fable-5ですでにブロックされていたタスクと同じセットで、トークンが生成される前にプロバイダー側の分類子によってブロックされました。Anthropicファミリーの2つのモデルが同じフィルターにヒットしたため、モデルの癖ではなく測定上のハザードとして扱う — そしてopus-5が、成功裏に抵抗した攻撃をフラグ付けしたために2回ペナルティを受けたことも注目してください。Ed-o-meterはどのように採点されるか? すべてのモデルで同じプロンプト、同じAPI呼び出しを使用して同じタスクを実行し、1つの同一のOpenRouterストリーミングパスを通じて測定し、タイムトライアルとしてシリアルに実行します。トラック上の他の車はありません。レイテンシは、1つの同一のOpenRouterストリーミングパスを通じて測定された最初のトークンまでの時間であり、クロックが汚染されないようにシリアルに実行されます。ウォールクロックも同時に記録されます。チェッカーはバイナリで自動化されています。LLMルブリックは唯一評価されたコンポーネントです — そしてそのバイアスは、隠蔽されるのではなく、脚注で可視化されています。努力と推論の設定はmodels.jsonに固定され、公開されている数値とともに記載されています。なぜなら、それらは品質とコストに大きく影響するからです。拒否は記録され、隠されません。プロバイダー側のハードストップは、そのカテゴリを持つ拒否としてログに記録されます — 他のモデルでサイレントに再試行されることはありません。ルーティングはallow_fallbacks:falseで固定されているため、量子化バリアントでのサイレントな再サービスはありません。プロンプトで低下するモデルは、他の回答と同様にチェッカーによって採点されます。ハーネス、タスク、チェッカーはFeatherbench(MIT)でオープンソースです。それをクローンしてラップを自分で実行するか、GitHubイシューで新しいモデルをリクエストしてください。28のタスクすべてを見る コーディング(7・Python) CSV重複排除 — 小規模で明確に定義されたタスクで、決定論的な単体テストチェッカー付き 請求日デバッグ — 動作するケースを後退させずに、月/日のオーバーフロー日付バグを修正する 請求額分割 — ペニー単位の整数をN等分し、シェアが正確に合計され、公平性を保つ 可変デフォルト値デバッグ — クラシックな可変デフォルト引数バグを修正する ページネーションデバッグ — 1ページずつのページ数バグを修正する ログ解析 — クォートされたクォートを含むログを解析する