AI・機械学習
エージェントにどこまで委任できるか?
How much can you delegate to agents? (newsletter.posthog.com)
要約
AIエージェントにどこまで仕事を任せられるかは、モデルの性能ではなく、タスクの性質によって決まります。タスクの「確認のしやすさ」と「間違いを元に戻すコスト」という2つの要素から、委任レベルを4段階(アシスタント、人間参加型、エージェント委任、自動運転モード)に分類し、安全かつ効率的にエージェントを活用するための指針を示しています。
全文翻訳
エージェントにどこまで委任できるか?エージェントの自律性に関するシンプルなガイドJina Yoon2026年7月27日3114シェア人々は、監督なしでより多くの仕事をエージェントに任せるようになっていますが、いつ信頼すべきかをどう判断するのでしょうか?一部の人は、その答えはモデルの出来次第、つまりモデルがより賢くなるにつれて、より多くのことを任せられるようになると考えています。しかし、モデルが賢くなったからといってエージェントを信頼するのは、より良い車になったからといってシートベルトを外すようなものです。
本当の答えはモデルとは全く関係なく、タスクに全てがかかっています。委任する時期と量を決定するためのメンタルモデルを構築し、それを適応させる必要があります。ここでは、物事を壊すことなく迅速にリリースできるように、エージェントの自律性を最大化するためのシンプルなガイドを紹介します。
自律性の限界を決める2つの要因まず、自問自答すべき2つの質問があります。
1. エージェントの作業をチェックするのは簡単か?安全に単独で実行するためには、エージェントは間違った場合に即座のフィードバックが必要です。これは、単体テストや統合テストのような決定的チェックが可能なほとんどのコードで可能です。しかし、明確さのためにパラメータ名を変更するなど、主観的なタスクは、人間の好みや判断なしでは困難です。
2. エージェントの間違いを元に戻すのは安価か?従来のソフトウェアエンジニアリングと同様に、監督なしでエージェントの実行を信頼したい場合は、最悪のシナリオに対する保証されたCtrl+Zが必要です。だからこそ、当社のPR承認エージェントであるStampHogは、拒否リストのキーワードを含むものはすべて人間にルーティングします。
これら2つの要因を組み合わせることで、あらゆるタスクに対して4つのレベルのいずれかが示されます。
レベル0:エージェントをアシスタントとして利用。チェックが難しく、元に戻すのが難しいタスク。扱いにくい、機密性の高いコードを扱う場合に必要です。
レベル1:人間参加型。チェックが難しく、元に戻すのが容易なタスク。通常、主観的な評価が必要な場合。
レベル2:エージェント委任。チェックが容易で、元に戻すのが難しいタスク。今日のほとんどの開発作業のデフォルトの上限。
レベル3:自動運転モード。チェックが容易で、元に戻すのが容易なタスク。すべてがこの方向へ加速しています。
これらの4つのレベルを非常にシンプルな決定木にマッピングでき、あらゆるタスクに適用できます。
これはエージェントに委任する量を決定するのに役立ちますが、特定のタスクでより高い自律性を可能にするようにパイプラインを設計することもできます。
レベル0:エージェントをアシスタントとして利用チェックが難しく、元に戻すコストが高い場合これはエージェントの自律性の最も低いレベルです。ChatGPTにアドバイスを求めたり、Cursorのオートコンプリートを使ったりするような、2024年の昔ながらの方法を考えてみてください。しかし、時代遅れだからといって悪いわけではありません。このモードは、機密性の高いコード領域における扱いにくい問題に対処する場合に理想的です。
例えば、昨年Dylanが当社のフィーチャーフラグエンジンを汎用プロパティターゲティングをサポートするように更新したとき、彼はPostHogのすべてのフィーチャーフラグに間接的に組み込まれていた仮定を移行する必要がありました。これは、grepでは見つけられなかったため、エージェントが決定的にチェックするのが難しいものでした。また、この更新はライブの顧客フラグ、APIレスポンスの形状、理由スコアリング関数に触れたため、広範囲に影響がありました。
ここからレベルアップする方法タスクを分解します。小さなピースにすることで、どこで委任が安全かそうでないかが明らかになります。Dylanは、リスクの高いコア移行は手作業で行い、JavaScript、PHP、Ruby、Flutter SDK全体に新しいターゲティングロジックを伝播するような、それほどクリティカルではない作業をエージェントに任せました。
レベル1:人間参加型チェックが難しく、元に戻すのが安価な場合このレベルのエージェント自律性は、主観的な評価を必要とするタスクによく見られます。なぜなら、現時点ではエージェントに好みや判断を教えるのは難しいからです。人間参加型のタスクは、コードがドラフトモードのままで、人間によって検証されるまでマージされないため、元に戻すのが安価と見なされます。元に戻すということは、別のイテレーションを開始することを意味します。
Thomasによるこのコード可読性リファクタリングは、ほとんど手作業で行われましたが、エージェントが評価方法を知らないであろう良い例です。それは、人間が理解しやすくするための数行(コメントの追加、アクションのグループ化、文字列を列挙型に置き換えるなど)であり、破壊的な変更は導入しませんでした。
ここからレベルアップする方法LLMをジャッジとして使用する。これが、ほとんどの人がエージェントコードレビューシステムを構築する方法です。モデルが改善し続けるにつれて、人間の判断を必要とするタスクの多くはLLMでチェックできるようになります。スコープが限定され、測定可能な目標を定義する。成功指標や契約は、主観的な評価の代理として機能します。例えば、システムにランディングページコピーを実験させ、バリアントが3%のコンバージョンに達するまで続けるように指示できます。カスタムスキルを記述する。これは、エージェントがより少ない指示で、信頼性高くあなたの基準、慣習、好みに合った作業を生成するのに役立ちます。例えば、多くの開発者は、チーム固有の標準に従うためにカスタムコードレビューのスキルを記述しています。
レベル2:エージェント委任チェックが容易で、元に戻すのが難しい場合これは今日のほとんどの開発タスクのレベルです。エージェントは決定的にテスト可能なコードを記述しますが、最終的なマージは最終的な安全チェックによってゲートされます。
RobbieがSQLパーサーをRustでゼロから書き直したとき、彼は機械的なオラクルが作業をチェックしてくれたので、コードをほとんど読みませんでした。しかし、パーサーはPostHogのすべてのクエリに影響するため、エージェントの作業は複数の安全チェックによってゲートされていました。本番環境でのシャドーモード、その後ステージングされたカットオーバーです。
ここからレベルアップする方法コードでポリシーとガードレールを強制する。ほとんどの人は、レベル2のタスクを人間(つまり自分自身)の後ろにゲートすることをデフォルトにしていますが、この習慣はあなた自身をボトルネックにします。代わりに、デフォルトでドライランを実行する、資格情報をスコープする、変更をフィーチャーフラグの後ろに置くなどのポリシーを使用して、ガードレールの多くをパイプラインに直接エンコードします。
レベル3:自動運転モードチェックが容易で、元に戻すのが容易な場合このカテゴリにはまだタスクは多くありません。依存関係の更新、リンターの修正、既存コードへのテストカバレッジの追加など、比較的小さなものだけです。しかし、特に長期実行エージェント、目標駆動型ループ、より複雑なオーケストレーションにより、このカテゴリは急速に成長しています。
PostHogでは、ビルダーにとって自動運転モードを現実のものにすることに全力を注いでいます。例えば先月、Scoutsをローンチしました。これはスケジュールで実行され、製品データからのシグナルを調査し、それに基づいてPRをドラフトするエージェントです。
ここからレベルアップする方法ドメイン固有のモデルをトレーニングする。次の波のツールの多くは、今日LLMにとって難しい検証タスクを改善することになるでしょう。1つの明白な道は、特定のドメインで「良い」とは何かを知っている目的特化型モデルであり、だからこそ私たちはPostHogで独自のAIモデルをトレーニングしています。専門家レベルのコンテキストバンクを構築する。エージェントの自律性の欠如は、しばしばコンテキストの不足にすぎません。PostHog Wizardのコンテキストレイヤーのエンジニアリングから直接学んだように、構造化され最新の知識でこのギャップを埋めることは、信頼性の高いエージェントにとって最もレバレッジの高い構築物の一つです。スカウトのための明確なシグナルを設計する。長期実行エージェントのボトルネックは、実行する価値のある仕事があるときにそれを知っているかどうか、そして有効なシグナルとランダムなノイズを区別する方法になります。
Jina Yoonによる言葉。彼女はレベル0でこれらのニュースレターを書いています。
このようなコンテンツをもっと見るには購読してください。あるいは、しなくても構いません。あなたは完全に自律的です。
購読する🕵️ あなたのエージェントに私たちに話させましょうテクニカルカスタマーサクセスマネージャー - アメリカ大陸テクニカルカスタマーサクセスマネージャー - EMEA BDRチームリード収益オペレーションマネージャー(セールス中心)🔺 レベルアップのその他の方法エージェント自律性レベル – Addy OsmaniPostHogの再配置 – Charles CookCerebrasがエンタープライズナレッジベースを構築した方法 – Isaac Tai, Daniel Kim, Mike Gaoコンテキストウェアハウスとは? – Lizzie Epton Claude 5モデルのためのコンテキストエンジニアリングの新ルール – Thariq Shihipar1注:規模はエージェントの自律性レベルを決定する要因ではありません。人々はしばしば2つを混同しますが、マルチエージェントオーケストレーションは自律性を緊急のものにします。しかし、タスクレベルで自律性を正しく行えば、規模は自然に解決します。
3114シェア前へ