AI・機械学習
Show HN: FrontierHarness Eval – 9つのハーネス、同じモデルで、パスあたりのコストが17倍変動
要約
この記事は、同じ大規模言語モデル(LLM)を使用し、9種類の異なる「ハーネス」(LLMへのインターフェースやラッパー)を評価した結果を示しています。評価では、精度、コスト、実行時間といった複数の指標で、ハーネス間に顕著な差が見られました。特に、パスあたりのコストは17倍もの開きがあり、モデルの性能を最大限に引き出すためのハーネス選択の重要性が示唆されています。
全文翻訳
Codex66.7%
Claude Code63.3%
DSH Creator63.3%
DSH PTC60.0%
DSH Standard60.0%
Pi60.0%
DSH Minimal56.7%
Kimi Code56.7%
Oh My Pi56.7%
Exo Harness53.3%
Hermes50.0%
OpenCode50.0%
OpenCode$0.0615
Pi$0.0709
Exo Harness$0.0748
DSH Creator$0.1194
DSH Standard$0.1201
DSH Minimal$0.1214
Codex$0.1243
Oh My Pi$0.1354
DSH PTC$0.1370
Hermes$0.1746
Kimi Code$0.1818
Claude Code$0.2880
Exo Harness$1.0452
Pi$2.4330
Hermes$2.9043
OpenCode$3.2443
DSH Creator$3.2849
DSH Standard$3.4589
Codex$3.4683
Kimi Code$3.6471
DSH PTC$4.5774
DSH Minimal$4.7180
Oh My Pi$4.7455
Claude Code$18.3368
Codex88.0%
Kimi Code88.0%
DSH PTC87.2%
DSH Standard86.5%
Hermes85.9%
DSH Minimal84.6%
DSH Creator84.3%
Oh My Pi82.2%
Pi79.4%
OpenCode78.4%
Exo Harness70.3%
Claude Code67.8%
DSH Minimal5m 41s
DSH Standard6m 17s
Exo Harness6m 17s
OpenCode6m 27s
Codex6m 43s
DSH Creator6m 44s
Oh My Pi6m 46s
Hermes6m 58s
Pi7m 33s
DSH PTC7m 44s
Kimi Code7m 56s
Claude Code9m 38s
Codexv0.148.0
DeepSeek Harnessv0.1.0-rc.8
Claude Codev2.1.237
Pi v0.84.2
Oh My Pi v17.4.0
Kimi Codev0.37.2
Exo Harnessv0.1.0
OpenCodev1.18.19
Hermesv0.20.4