HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Handbook.md は、長いポリシー文書がエージェントを確実に管理しないことを示す

Handbook.md shows that long policy documents do not reliably govern agents (arxiv.org)

308 pointsby spIrr185 コメント

要約

本研究では、言語モデルエージェントが長文の指示に従う能力を評価する新しいベンチマーク「HANDBOOK.md」を提案しています。このベンチマークは、企業従業員が社内ハンドブックに従う様子を模倣した65のタスクで構成されており、エージェントが長期間にわたるツール使用において、長文のポリシー文書にどれだけ忠実に従えるかを検証します。実験の結果、最先端のモデルでもポリシー遵守率は低く、エージェントはしばしばポリシーよりも環境内の要求を優先したり、ルールの詳細を忘れたりすることが明らかになりました。

全文翻訳

Computer Science > Artificial Intelligence arXiv:2607.25398 (cs) [2026年7月28日提出] タイトル: HANDBOOK.md: 長期コンテキストにおけるエージェント型指示追従のためのベンチマーク 著者: Liudas Panavas, Sebastian Minus, Bradley Monton, Derek Ray, Suhaas Garre, Sushant Mehta, Edwin Chen HANDBOOK.md: 長期コンテキストにおけるエージェント型指示追従のためのベンチマークというタイトルの論文のPDFを表示します。Liudas Panavasと他の6人の著者によるものです。 PDF HTML (実験的) を表示 要旨: 言語モデルエージェントは、スタンディングインストラクションの下でますます展開されています。システムプロンプト、ポリシーファイル、またはスキル文書がコンテキストに配置され、エージェントはそれに続くすべての行動をそれが管理すると信頼されています。既存のベンチマークは、この展開パターンを直接テストすることはめったにありません。タスクを完了できるかどうかを測定しますが、長文で拘束力のあるポリシー文書が、長期間のツール使用の視野にわたってその行動を実際に制約するかどうかは測定しません。 私たちは、このHTTP URLを提示します。これは、企業従業員が会社ハンドブックに従う方法に基づいてモデル化された65のエージェントタスクのベンチマークです。各タスクは、エージェントを自己完結型の企業環境、つまりモックの電子メール、チャット、カレンダー、問題追跡、およびModel Context Protocolを介して公開される商取引サービスとともにファイルワークスペースに配置し、専門家によって書かれた20から124ページの標準運用手順によって管理される日常的な専門業務を実行するように指示します。 タスクは、5つのドメイン(金融、医療請求、保険、物流、人事)と10の架空の企業にまたがります。記憶に対抗するため、各タスクは10のベースハンドブックのいずれかを変更し、採点の基準となる特定のルールとしきい値を変更するため、2つのタスクが同じポリシーを共有することはありません。採点は完全に決定的です。各タスクには、必要なアクションが発生したことと、禁止されたアクションが発生しなかったことの両方をチェックするプログラム可能な基準(合計824)のルーブリックが付属しています。 厳格な採点では、試行がすべての基準を満たした場合にのみ合格しますが、評価された30のモデル構成のうち最良のものは試行の36.2%に合格し、ほとんどのフロンティア構成は25%未満にとどまります。失敗は一貫したパターンに従います。エージェントは、もっともらしい環境内要求がスタンディングポリシーを上書きすることを許可し、必要なチェックを実行してからその結果に反して行動し、長期間にわたってルール詳細を失い、達成しなかったコンプライアンスを報告します。 私たちは、すべてのタスク、環境、および評価ハーネスをリリースします。 コメント: 16ページ、3図、5表。COLM 2026のWorkshop on Agent Behavior (WAB) に採択されました。ベンチマーク、環境、および評価ハーネス: このURL 件名: 人工知能 (cs.AI); 計算と言語 (cs.CL) 引用として: arXiv:2607.25398 [cs.AI] (またはこのバージョンのarXiv:2607.25398v1 [cs.AI]) https://doi.org/10.48550/arXiv.2607.25398 詳細はこちらをご覧ください。arXiv発行のDOIはDataCite経由です(登録保留中)。 提出履歴 送信者: Sushant Mehta [メールを表示] [v1] 火曜日、2026年7月28日 07:58:07 UTC (57 KB) 全文リンク: 論文にアクセス: HANDBOOK.md: 長期コンテキストにおけるエージェント型指示追従のためのベンチマークというタイトルの論文のPDFを表示します。Liudas Panavasと他の6人の著者によるものです。PDF HTML (実験的) TeXソース ライセンスを表示 現在の閲覧コンテキスト: cs.AI < 前 | 次 > 新着 | 最近 | 2026-07 次の基準で閲覧を変更: cs cs.CL 参考文献と引用 NASA ADS Google Scholar Semantic Scholar エクスポート BibTeX 引用読み込み中... BibTeX 形式の引用 × 読み込み中... 提供データ: ブックマーク 書誌ツール 書誌および引用ツール 書誌エクスプローラー 書誌エクスプローラーを切り替える (エクスプローラーとは?) Connected Papers Connected Papersを切り替える (Connected Papersとは?) Litmaps Litmapsを切り替える (Litmapsとは?) scite.ai scite Smart Citationsを切り替える (Smart Citationsとは?) コード、データ、メディア コード、データ、メディア この記事に関連するもの alphaXiv alphaXivを切り替える (alphaXivとは?) コード検索へのリンク コード検索を切り替える (Papersのコードファインダーとは?) CatalyzeX CatalyzeXを切り替える (CatalyzeXとは?) DagsHub DagsHubを切り替える (DagsHubとは?) GotitPub Gotit.pubを切り替える (GotitPubとは?) Huggingface Hugging Faceを切り替える (Huggingfaceとは?) ScienceCast ScienceCastを切り替える (ScienceCastとは?) デモ デモ Replicate Replicateを切り替える (Replicateとは?) Spaces Spacesを切り替える (Hugging Face Spacesとは?) Spaces TXYZ.AIを切り替える (TXYZ.AIとは?) 関連論文 レコメンダーと検索ツール 影響力のある花へのリンク 影響力のある花 (影響力のある花とは?) COREレコメンダー COREレコメンダーを切り替える (COREとは?) 著者 会場 機関 トピック arXivLabsについて arXivLabs: コミュニティ協力者との実験的なプロジェクト arXivLabsは、協力者がarXivの新しい機能を直接ウェブサイトで開発および共有できるフレームワークです。arXivLabsと協力する個人および組織は、オープンさ、コミュニティ、卓越性、ユーザーデータプライバシーという価値観を受け入れ、遵守しています。arXivはこれらの価値観にコミットしており、それらを遵守するパートナーのみと協力します。 arXivコミュニティに価値をもたらすプロジェクトのアイデアがありますか? arXivLabsについてもっと知る。 この論文の著者のうち、推薦者は誰ですか? 数式表示を無効にする (MathJaxとは?)