AI・機械学習
エージェント的コンテキスト管理:メモリとコストをアーキテクチャの問題として捉える
Agentic Context Management: Memory and Cost as Architecture Problems (arxiv.org)
要約
本稿では、AIエージェントが推論能力の限界ではなく、会話履歴やプロンプト、ツール定義などのコンテキスト管理の失敗によってプロダクション環境で機能不全に陥るケースが多いと指摘しています。この問題を単なるストレージ・検索の問題としてではなく、エージェントのライフサイクル全体に関わるアーキテクチャ上の課題として捉え、「エージェント的コンテキスト管理(ACM)」という新たな分野を提唱しています。
全文翻訳
プロダクション環境におけるAIエージェントの失敗は、推論能力の不足によるものよりも、むしろその推論コンテキスト(会話履歴、大規模プロンプト、大規模ツール定義、そして増大し続けるツール出力)を管理できないことに起因することが多いです。エージェントは、ターンごとに増加するトークンコストを支払いながら、蓄積される自身の履歴に溺れてしまい、会話の前後で記憶が欠落する事態を引き起こします。
既存の対応策は、これをストレージ・検索の問題として扱います。しかし、我々は、このフレームワークが狭すぎると主張します。エージェントが記憶しているものを積極的に管理することは、単なるストアではなく、ライフサイクル全体に関わる問題です。それは、何を記憶するかを決定し、それを抽出し構造化し、データ型ごとに適切なストアを選択し、プロビナンス(来歴)を維持しながら統合・忘却し、現在何が関連しているかを決定し、次に何が必要かを予測し、そして重要な情報を失うことなく予算に合わせてコンテキストを圧縮することまでを含みます。真剣なプロダクション環境では、これは単一のユーザーではなく、組織的なスコープ階層全体にわたって機能します。
我々はこの分野をエージェント的コンテキスト管理(ACM)と名付け、それを5つの基本要素:アーキテクチャリング(設計)、インジェスティング(取り込み)、スコーピング(範囲設定)、アンティシペーティング(予測)、そしてコンパクション&コンソリデーション(圧縮と統合)に分解します。
次に、経済的な側面について論じます。単純なコンテキストの蓄積は、会話長の二乗に比例してトークンコストを増加させます。粗い要約は、精度の急激な低下という代償を払って線形コストを購入しますが、検証された圧縮のみが、忠実度を維持しながら線形コストを達成します。
我々は、5つの基本要素を実現するマルチテナントサービスであるリファレンス実装、Maximem Synapについて説明します。この実装は、セクション6で詳述された設定の下で、LongMemEvalで92%、LoCoMoで93.2%のスコアを報告しています。
最後に、既存のベンチマークがまだ捉えきれていない次元、すなわちレイテンシ、トークン効率、コンテキストの劣化耐性、そしてこのカテゴリが指し示す意思決定レベルおよび組織レベルのコンテキストのフロンティアについて考察します。