HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Show HN: Benzi – Claude CodeとCodeGraphを凌駕するコードインテリジェンス/ハーネス

Show HN: Benzi – A Code Intillegence/Harness Beating Claude Code and CodeGraph (benzi.fly.dev)

7 pointsby tweedler2902 コメント

要約

Benziは、コードインテリジェンスとバグ修正ハーネスの新しいツールであり、Claude CodeやCodeGraphといった既存のソリューションと比較して、パフォーマンスとコスト効率の面で優位性を示しています。24のGitHubイシューを用いたバグ修正ベンチマーク、SWE-bench Verified、およびCodeGraphとの比較を通じて、Benziはより少ないリソース消費と低コストで問題を解決できることを実証しています。特に、DeepSeekモデルを利用した場合、コストは大幅に削減されます。

全文翻訳

Benzi · ベンチマーク それを測定した3つの方法。 バグ修正ベンチマーク → リンゴ対リンゴの比較: Benziハーネス対主流ハーネス、24のGitHubイシュー、10言語。 SWE-bench Verified → SWE-bench VerifiedでのBenziハーネス。500件の実際のイシューの78.2%が10セント未満の修正コストで解決されました。 CodeGraph比較 → リンゴ対リンゴの比較: Code Graphのコードインテリジェンス対BenziのAIネイティブコードインテリジェンス すべての実行を見る → すべてのタスク、すべての試行、そのまま—何も隠されていません。 Benziの詳細はこちら: benzi.fly.dev/about BenziのKPI(重要業績評価指標) — 読み取られたソース行数 バグが難しくなるにつれて、各ハーネスはより多くのソースを開きます。問題はその傾斜です。各点は1つのバグです。24個のバグは、左から右へ、簡単なものから難しいものへと並べられています。難易度は、そのバグに対するClaude Codeのターン数です—これはサードパーティの尺度であり、どのハーネスも軸上の自身の位置を設定していません。読み取られた行数は、file-read呼び出しから返されたもののみをカウントします。grepやシェル出力は検索であり、読み取りではありません。 各行の横にある数字はその傾斜です: 難易度のステップごとにそのハーネスが開く追加の行数。任意の点をホバーすると、バグとそのカウントが表示されます。 読み取られたソース行数 · 24のバグ · マークされたバグのうち最も低いもの BenziSonnet BenziDeepSeek Claude CodeSonnet DeepSeek HarnessDeepSeek mux64643831,372 commons-cli39235456771 addressable1802402001,603 jsoup6117060616 yaml-cpp120383194461 cJSON17187105854 dayjs64336307610 gson7815880516 CsvHelper42390335805 semver3534685631,857 hashie153172300458 money6815726611,892 rich2555147361,421 fmt6043152641,097 sqlglot227115800777 scrapy3861,5801,2592,127 marked9058072,1674,091 http-parser4491,2011,2702,635 zod8411,4761,9563,608 quartznet4881,7071,8974,197 sqlparser6201,0071,2252,334 nlohmann/json3799291,7645,201 ts-pattern1,1301,2321,1391,910 nats-server9892,1492,5832,385 all 249,12516,40720,70443,598 読み取られた行数は、file-read呼び出しから返されたもののみをカウントします。grepやシェル出力は検索であり、読み取りではありません。各行の緑色の数字は4つの中で最も低いものです。 同じ24個のバグを同じ順序で、読み取られた行数の代わりにウォールクロックタイムで示します。ウォールクロックタイムは生の値です—上記のテーブルとは異なり、Benziのリポジトリごとのインデックスビルドは差し引かれていないため、これらの秒数はページ上の他の場所で引用されているウォームアップ後の数値よりわずかに高くなります。各点は、そのバグに対するハーネスの最新の解決済み実行です。未解決および未完了の実行はプロットされず、省略されます。Sonnet上のBenziはhttp-parserを解決せず、DeepSeekハーネスはnats-serverを実行しなかったため、これら2つの点は存在せず、どちらもそのフィットには入りません。 そして、再び垂直軸にドルを表示します。上記のグラフと同じ実行選択で、公表されているトークンあたりのレートで価格設定されています。2つのDeepSeekシリーズは、2つのSonnetシリーズよりも1桁安価であるため、このスケールではベースラインの近くに位置します—それらの背後にあるバグごとの数値は、さらに下にあるDeepSeekテーブルにあります。軸が表示しているのは傾斜です: Claude Codeのコストは、ここにある他のどのシリーズよりも速く難易度とともに増加します。 修正あたりのコスト · リスト価格でのUSD · マークされたバグのうち最も低いもの BenziSonnet BenziDeepSeek Claude CodeSonnet DeepSeek HarnessDeepSeek mux$0.39$0.036$0.25$0.023 commons-cli$0.26$0.030$0.29$0.014 addressable$0.57$0.043$0.35$0.042 jsoup$0.23$0.025$0.30$0.051 yaml-cpp$0.25$0.068$0.37$0.024 cJSON$0.27$0.036$0.44$0.073 dayjs$0.21$0.038$0.55$0.040 gson$0.19$0.015$0.45$0.022 CsvHelper$0.25$0.038$0.58$0.042 semver$0.62$0.10$1.43$0.097 hashie$0.69$0.051$0.92$0.043 money$0.79$0.036$0.95$0.052 rich$0.33$0.11$1.30$0.053 fmt$0.54$0.14$1.12$0.071 sqlglot$0.62$0.033$1.23$0.059 scrapy$0.73$0.10$1.35$0.19 marked$1.08$0.20$3.59$0.13 http-parser—$0.36$3.44$0.23 zod$1.53$0.13$2.47$0.33 quartznet$0.95$0.23$3.99$0.31 sqlparser$0.72$0.14$3.22$0.33 nlohmann/json$1.03$0.17$3.68$0.44 ts-pattern$3.74$0.31$4.33$0.053 nats-server$1.99$0.23$2.94— all 24$17.96$2.66$39.54$2.70 公表されているトークンあたりのレートで価格設定。 各行の緑色の数字は4つの中で最も低いものです。2つのDeepSeek列が大幅に安価なのは、そのモデルのトークンあたりのコストが約20倍安いからです。空白のセルは、修正を生成しなかった2つの実行です。