HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

サーバーを破壊不能にするための計算上の憲法

A computational constitution to stop LLM agents from bricking servers (github.com)

3 pointsby misqe0 コメント

要約

AI業界は「十分」という幻想に囚われており、LLMエージェントは本番環境で危険な操作を実行する可能性があります。この問題に対処するため、本稿ではエージェントの行動を制御する「ゼロトラストLLM」という計算上の憲法を提案しています。これは、エージェントの意思決定プロセスを厳格なループに強制し、オペレーターへの安全な引き渡しを保証するものです。

全文翻訳

ゼロトラストLLM知識不変性 自律エージェントのための計算上の憲法。 問題:デモから本番への断絶 AI業界は「十分」という幻想に囚われています。デモでは、エージェントが魔法のようにコードを書き、30秒でアプリをデプロイする様子が示されます。しかし、商用LLMはRLHF(強化学習による人間からのフィードバック)によって過度にチューニングされており、迎合的です。つまり、結果を推測し、ユーザーに同意し、タスクを迅速に実行したがります。もしあなたが統制されていないエージェントに「サーバーのクラッシュを修正するためにDockerキャッシュを強制的にクリアしろ」と指示した場合、それはあなたの検証されていない前提に基づいて、破壊的なコマンドを盲目的にバンドルして実行するでしょう。これは本番環境では極めて危険です。 自然言語によるガバナンス(システムプロンプトに「注意しろ」と追加するなど)は、コンテキストウィンドウの希釈により、時間とともに失敗します。 解決策 確率的なテキストジェネレーターに決定論的な状態変更を実行させる場合、それを自己統治させることはできません。そのエージェンシーを剥奪し、認識論的な状態機械に強制する必要があります。 このリポジトリは、プロンプトレイヤーでLLMの行動状態機械を管理するためのマスター運用ルールであるAGENTS.mdを提供し、ランタイムエンフォーサーへの橋渡しをします。 すべての結果をもたらすアクションは、この正確なループに従う必要があります: [仮説] [必要な証拠の特定] [根拠の検証方法] [実行](厳密に読み取り専用の診断コマンド) [オペレーターへの強制的な引き渡し] [オペレーターへの強制的な引き渡し]において、実行レイヤー(PythonミドルウェアまたはLangGraph/Semantic Kernel)は、APIストリームを物理的に遮断し、コマンドを実行し、生の出力をコンテキストにフィードバックする必要があります。 リポジトリ構造 AGENTS.md:マスタールールセット。これをエージェントのシステムプロンプトに追加してください。 MANIFESTO.md: 「十分」というAIパラダイムに対する哲学的および技術的な議論。 /examples:標準的なエージェントがどのように失敗するか(そしてゼロトラストエージェントがどのように異常を検出し、引き渡しを行うか)を証明する実際のトランスクリプト。 /implementation:実行境界をプログラムで強制する方法を示すアーキテクチャノートとPython擬似コード(orchestrator_concept.md)。