AI・機械学習
Orca-Bench: 言語モデルエージェントはオンコール対応の準備ができているか?
Orca-Bench: How Ready Are Language Model Agents for Oncall? (arxiv.org)
要約
この論文は、オンコールインシデントの根本原因分析(RCA)に対する言語モデルエージェントの準備状況を評価するために設計されたベンチマーク「Orca-Bench」を紹介しています。実験の結果、最先端のエージェントでも、現実的なシナリオでは25.3%の精度しか達成できず、本番環境での信頼性にはまだ大きな隔たりがあることが示されました。
全文翻訳
コンピュータサイエンス > 計算と言語 arXiv:2607.28545 (cs) [2026年7月30日提出]
タイトル: ORCA-bench: 言語モデルエージェントはオンコール対応の準備ができているか?
著者: Albert Gong, Kyuseong Choi, Abhineet Agarwal, Jason Schechner, Ryan Huang, Raj Agrawal, Anish Agarwal, Raaz Dwivedi
Albert Gongら7名の著者による「ORCA-bench: 言語モデルエージェントはオンコール対応の準備ができているか?」と題された論文のPDFを表示します。
PDF HTML (実験的) を表示
概要:
大規模言語モデルはコードの記述、修正、検索を行うことができますが、オンコールの根本原因分析(RCA)には異なる能力が求められます。それは、曖昧なユーザーからの報告から始まり、インシデント発生から数時間後に、ノイズの多いメトリクス、ログ、トレース、ソースコードを横断して推論することです。私たちは、汎用コーディングエージェントを本番環境に忠実なオンコール設定に置くベンチマークであるORCA-benchを導入します。ORCA-benchは、ライブのOpenTelemetryインストルメント化されたマイクロサービスシステム(Prometheus、Jaeger、OpenSearchをGrafana経由で、および完全なソースコードアクセスを通じて6日間のメトリクス、ログ、トレースを公開)と、レポートの具体性、検出までの時間、および共存する障害シナリオを体系的に変化させる1,079件のRCAタスクをペアにします。グラウンドトゥルースの症状は専門のSREによってキュレーションされ、承認されており、LLMをジャッジとして使用した結果は人間によって独立して再採点されています(Cohen's κw=0.90)。5つの最先端エージェントを対象に、最も優れたRCA精度は、Medium-difficultyタスク(現実的な入力設定)で25.3%、Hardで10.0%でした。このギャップは、Claude Fable 5を使用しても解消されません。最も弱いモデルは、インシデントレポートの40%でありえない根本原因を幻視し、ソースコードへのアクセスを削除すると、すべてのメトリクスが悪化します。決定的に重要なのは、これらはキュレーションされた50 GB / 6日間のテストベッド上で、コードとインストルメンテーションが公開されているシステムで、タスクが個別に調査された上でのパフォーマンスであるということです。実際のプロダクションシステムは桁違いに大きく、動的で、より特異的であるため、ここで報告されているギャップは、最先端のコーディングエージェントを本番環境の信頼性管理に安全に委ねる前に必要とされるエンジニアリング投資の最小値です。公開セットをこのURLで公開します。
件名: 計算と言語 (cs.CL); 人工知能 (cs.AI); ソフトウェア工学 (cs.SE)
引用方法: arXiv:2607.28545 [cs.CL] (またはこのバージョンの場合は arXiv:2607.28545v1 [cs.CL])
https://doi.org/10.48550/arXiv.2607.28545
arXiv発行のDOI(登録待ち)によるDataCite
提出履歴
送信者: Albert Gong [メールを表示] [v1] 2026年7月30日 17:14:07 UTC (220 KB)
全文リンク:
論文にアクセス: Albert Gongら7名の著者による「ORCA-bench: 言語モデルエージェントはオンコール対応の準備ができているか?」と題された論文のPDFを表示します。PDF HTML (実験的) TeXソース ライセンスを表示
現在の閲覧コンテキスト: cs.CL < 前 | 次 > 新規 | 最近 | 2026-07
変更して閲覧:
cs cs.AI cs.SE
参考文献と引用
NASA ADS Google Scholar Semantic Scholar
BibTeX引用をエクスポート
BibTeX形式の引用 ×
読み込み中...
Data provided by:
ブックマーク
書誌ツール
書誌および引用ツール
書誌エクスプローラー トグル書誌エクスプローラー (エクスプローラーとは何ですか?)
Connected Papers トグルConnected Papers (Connected Papersとは何ですか?)
Litmaps トグルLitmaps (Litmapsとは何ですか?)
scite.ai トグルscite Smart Citations (Smart Citationsとは何ですか?)
コード、データ、メディア
この論文に関連するコード、データ、メディア
alphaXiv トグルalphaXiv (alphaXivとは何ですか?)
コードへのリンク
CatalyzeX Paper Finder (CatalyzeXとは何ですか?)
DagsHub トグルDagsHub (DagsHubとは何ですか?)
GotitPub トグルGotit.pub (Gotit.pubとは何ですか?)
Huggingface トグルHugging Face (Huggingfaceとは何ですか?)
ScienceCast トグルScienceCast (ScienceCastとは何ですか?)
デモ
デモ
Replicate トグルReplicate (Replicateとは何ですか?)
Spaces トグルHugging Face Spaces (Spacesとは何ですか?)
Spaces トグルTXYZ.AI (TXYZ.AIとは何ですか?)
関連論文
レコメンダーと検索ツール
Influence Flowerへのリンク
Influence Flower (Influence Flowersとは何ですか?)
Core recommender トグルCORE Recommender (CORE Recommenderとは何ですか?)
著者
この論文の著者は誰ですか?
会場
機関
トピック
arXivLabsについて
arXivLabs: コミュニティ協力者との実験的なプロジェクト
arXivLabsは、協力者がarXivの新しい機能を直接ウェブサイト上で開発・共有できるフレームワークです。arXivLabsと協力する個人および組織は、オープンさ、コミュニティ、卓越性、ユーザーデータプライバシーという私たちの価値観を受け入れ、遵守しています。arXivはこれらの価値観にコミットしており、それらを遵守するパートナーのみと協力します。arXivコミュニティに価値をもたらすプロジェクトのアイデアがありますか?arXivLabsの詳細をご覧ください。
この論文の著者は誰ですか?
数式表示を無効にする (MathJaxとは何ですか?)