AI・機械学習
Real-SWE: プライベートで実世界のエンタープライズコードベースにおけるAIモデルのベンチマーキング
Real-SWE: Benchmarking AI models on private, real-world, enterprise codebases (withspecific.com)
要約
Real-SWEは、プライベートで実世界のエンタープライズコードベースを用いて、最先端のAIモデルのコーディング能力を評価する新しいベンチマークです。このベンチマークは、実際の企業のエンジニアが直面する、ビジネス上の結果を伴う複雑なタスクを再現しており、AIエージェントが現実世界のソフトウェアエンジニアリング業務を遂行できるかを検証します。現時点では、最先端モデルでも解決率は38.8%に留まっており、実用化にはまだ課題があることが示されています。
全文翻訳
2026年9月Real-SWEの紹介プライベートで実世界のエンタープライズコードベースにおける最先端AIモデルのベンチマーキング。 ;+;+;:;+;+;.# ; ; ; . . . . ; . + ; ; . . : @;;+;+# +;+;+;+;:;+:# : : ; . ; ; ; @;+;+.+;:;+;+* ; . . : ; . . : ; @++:;:;+.;;@ ;. . . . .: . ; . . . .; @++;;;;+;:;@ ; : ; ; @;+++:@;++;:+ ; : : . :+.+;;;+:;@ ; : + . ; . . . ; ; . ; : . . . . ; . . . . .; ; . . . . .+ + . . . .; ; . . . . .; ; . : ; : ; ; ; ; : ; . ; . ; ; ; ; : ; . . % . . ; : . . . . ; ; ... . . .; +. . . . .: ;. . :.. .: : . . ::. . . ; . . . .; : *. @ ; ; +.@ . ; : +: *+ : ; :. %+; +. ; *. *# @: :.*. ; ; . . .;::@;; . . ; :#@;. ..@:. . ;.@%: .:@%:: :. . #+. :@%;. .:@*. .: @+ . #*. . ;@#.;.* . . .: .::: ..:%@@+@+#... :+:%@@+..:@@@::*.:;@@:..+@@:; *.::#@@#:..:@@#...+@#: :*:%@@+ .:.+::..*@@:@@@#;.. ::.# +@#.@ .*@: .*@%: *: :@%. ;@@: .@%. @ .;@@: .: :@#..#@*. +@#.@ .@ .*@%:. *: %+ ;@@: #; +# .;@@: .. @: .#@*. @. .. ;@ .*@%: *: @@ ;@@: %# * # .;@@: @+ .@ :*#.. @:: @. . ::;. @@ .. . @% .*@ ;@. %.@ .. .@; . @@ .. .@@. .. @:# ... . ;%# . @@ +;#: .. .@ @ . ... ... .. .. ... .. ... .. 01はじめに本日、プライベートで実世界のエンタープライズコードベースにおける最先端AIモデルを評価するベンチマーク、Real-SWEをリリースします。各タスクは、実世界の企業からライセンスされたプライベートな本番コードベースから来ています。これらは、既存の製品に伴うすべてのコンテキストと複雑さを備えた、そのエンジニアが取り組む問題です。プライベートなコードベース。エージェントは、コードやソリューションが公開インターネットで利用できない、独自のシステムをナビゲートする必要があります。ビジネス上の結果を伴う作業。請求処理の正確化、税金の計算、顧客の移行。ビジネスの運営方法に影響を与える変更であり、多くの場合、複数のサービスにまたがります。企業固有の複雑さ。すべての企業には、独自のルールとコーディング方法があります。エージェントは、それらの規約を理解し、既存のものと連携する変更を行う必要があります。コーディングエージェントは、現実世界でソフトウェアエンジニアの仕事を実際にこなすことができるでしょうか?1Fable 5.1Claude Code解決率: 38.8%2GPT-6 AstraCodex CLI解決率: 33.8%3Gemini 3.8 FlashGemini CLI解決率: 31.2%4GLM 5.3Claude Code解決率: 28.8%=5Grok 4.6Grok Build解決率: 23.8%=5Muse Spark 1.3Muse Code解決率: 23.8%7Kimi K3Kimi Code解決率: 18.8%8GPT-5.6 SolCodex CLI解決率: 16.2%#モデルハーネス解決率1Fable 5.1Claude Code38.8%2GPT-6 AstraCodex CLI33.8%3Gemini 3.8 FlashGemini CLI31.2%4GLM 5.3Claude Code28.8%=5Grok 4.6Grok Build23.8%=5Muse Spark 1.3Muse Code23.8%7Kimi K3Kimi Code18.8%8GPT-5.6 SolCodex CLI16.2%解決率はpass@1に相当し、タスクごとに独立した8回の実行の平均です。95%信頼区間を示します。専門家が作成したタスクや合成タスクはうまく設計されているかもしれませんが、実際の企業でエンジニアが行う実際のタスクのそのままの形ではありません。私たちのタスクは2つの軸で異なります。基盤となるコーディング成果物と指示の具体性です。どちらも今日の最先端モデルに挑戦する複雑さを加えています。エンタープライズエンジニアが実際に行う方法を反映するためにネイティブハーネスを使用しており、モデルを個別に評価するのではなく、モデルとハーネスの組み合わせを評価します。実際の企業のタスクには、企業固有のコンテキストが必要です正確な請求は、ビジネスルールと外部サービスに依存します請求処理を修正して、各ビジネスが正しい税金を課税し、免税顧客に課税されないようにします。完全な指示を表示する完全な指示を非表示にする▾請求処理は月曜日に再開され、このサービスが発行するすべての請求書は税抜きで発行されています。プラットフォーム上の各ビジネスは、税金の処理方法が異なります。自分で税率を維持するビジネス、税務当局プロバイダーに対して各請求書をバイヤーの宛先に基づいて価格設定したいビジネス、またはまったく徴収しないビジネスがあります。免除を受けている顧客は、ビジネスの設定方法に関わらず、何も請求されません。宛先に基づいて価格設定するには、両方の住所、価格設定された品目、およびそのビジネスが販売している製品カテゴリを、ビジネスが使用しているアカウントに応じて、サンドボックスまたは本番の税務当局に伝える必要があります。税務当局が拒否した住所は、請求書を停止せずに報告する必要があります。税率、税金、および総額は発行された請求書に記載され、請求書が決済されると、その請求書の番号の下で税務当局に販売が記録され、返品が照合されます。ヨーロッパの当事者間の請求書には、両当事者のVAT登録が表示されます。税務当局と元帳は、TAX_JAR_URL、PROD_TAX_JAR_URL、およびINFLUX_URLで利用できます。サンドボックス内のサービスTJTaxJarサンドボックスTJTaxJar本番InfluxDB元帳NestJSサービスTypeScriptReal-SWEタスク環境全体のエージェントは、コード、インフラストラクチャ、およびビジネスツールを操作します。各タスクは、ワークフローが必要とするサービスのみを公開します。AWSエミュレーターDockerKubernetesGitHubLinear MCPPostgreSQLMySQLMongoDBGeGelRedisGoPythonNode.jsVitestSlackIntercomGoogle DriveEmailClickUpコードベースの選択厳格なスクリーニングプロセスを通じてコードベースを選択し、 substantialな使用状況、強力なエンジニアリングチーム、および要求の厳しい本番ワークロードを持つ実際の企業に焦点を当てました。以下で分析されたサンプルタスクは、これらのコードベースから来ています。Luma/Partifulの競合他社で20万ユーザー以上、App Storeランキングトップ100に入る企業コンシューマーフィンテックプラットフォームで10万件以上の銀行取引明細書を処理する複雑なビジネスワークフローをサポートするエンタープライズAIセールスプラットフォームベンチマークタスクを作成するためだけに書かれたコードよりも、実際のユーザーまたはビジネスニーズを満たすために書かれたコードを優先します。本番エンジニアリングには、既存のアーキテクチャを理解し、ユーザーが依存している動作を維持し、実際の運用上の制約内で変更を加えることが必要です。短い指示でも複数のファイルにわたる変更が必要になる場合がありますタスクは必要な変更を記述し、エージェントがコードベースや周辺ツールで実装の詳細を発見できるようにします。検証者によって要求される動作は、明記されているか、合理的に発見可能である必要があります。これにより、プロンプトはわずかに指定不足になりますが、DeepSWEやTerminal Benchと同程度ですが、指示を省略しない程度には具体的です。作業は部門横断的で複雑です。単一の変更がアプリケーションの複数の部分にまたがることがあります。エージェントは、既存のビジネスロジックと企業コーディングパターンを理解しながら、周辺システムを機能させ続ける必要があります。プロンプトの長さ・中央値典型的なReal-SWEの指示は1,742文字です。FrontierCode2,056文字DeepSWE1,975文字Terminal-Bench 31,584文字FrontierSWE v2992文字Real-SWE1,742文字参照ソリューションによって編集されたファイル・中央値Real-SWEで11ファイル、FrontierCodeとDeepSWEでは6ファイル。FrontierCode6DeepSWE6Real-SWE11すべての数値は中央値です。FrontierCodeとDeepSWEはCognitionの公開比較を使用しています。FrontierCodeにはタスクの説明とコードベースのガイドラインが含まれています。Terminal-Bench 3の74タスク、FrontierSWE v2の34タスク、およびReal-SWEの8つのリポジトリベースのサンプルタスクから指示ファイルを測定しました。文字数は最も近い整数に丸められています。Terminal-Bench 3またはFrontierSWE v2の比較可能なファイル編集数は含まれていません。モデルは短いロールアウトでも失敗します。10分未満のロールアウトの71.4%が失敗し、10分以上のロールアウトの73.4%が失敗しました。複数のシステムをトリアージし、既存のビジネスロジックとコーディングパターンが混在するコードベースで要件を理解することは困難です。10分未満10分未満:98回のロールアウト中、70回(71.4%)が失敗し、28回(28.6%)が成功しました。71.4%28.6%70/98失敗10分以上10分以上:542回のロールアウト中、398回(73.4%)が失敗し、144回(26.6%)が成功しました。73.4%26.6%398/542失敗失敗成功すべてのタスクは、プライベートで実世界のコードベースから着想を得ているか、そのまま抜き出されています。これらのタイプのタスクは、次の3つの理由で非常に興味深いと考えています。プライベートコードベースのタスクは、本質的に分布外です。これらのタイプのコーディングタスクは、インターネット上のどこにも利用できず、他のAIモデルによってトレーニングされた可能性はほとんどありません。実世界のエンタープライズのトークンの99%は、最先端モデルから隠されています。これらのタスクは経済的に実行可能な作業です。ここでの各タスクには直接的な