AI・機械学習
サーバーを破壊不能にするための計算上の憲法
A computational constitution to stop LLM agents from bricking servers (github.com)
要約
AI業界は「十分」という幻想に囚われており、LLMエージェントは本番環境で危険な操作を実行する可能性があります。この問題に対処するため、本稿ではエージェントの行動を制御する「ゼロトラストLLM」という計算上の憲法を提案しています。これは、エージェントの意思決定プロセスを厳格なループに強制し、オペレーターへの安全な引き渡しを保証するものです。
全文翻訳
ゼロトラストLLM知識不変性 自律エージェントのための計算上の憲法。
問題:デモから本番への断絶
AI業界は「十分」という幻想に囚われています。デモでは、エージェントが魔法のようにコードを書き、30秒でアプリをデプロイする様子が示されます。しかし、商用LLMはRLHF(強化学習による人間からのフィードバック)によって過度にチューニングされており、迎合的です。つまり、結果を推測し、ユーザーに同意し、タスクを迅速に実行したがります。もしあなたが統制されていないエージェントに「サーバーのクラッシュを修正するためにDockerキャッシュを強制的にクリアしろ」と指示した場合、それはあなたの検証されていない前提に基づいて、破壊的なコマンドを盲目的にバンドルして実行するでしょう。これは本番環境では極めて危険です。
自然言語によるガバナンス(システムプロンプトに「注意しろ」と追加するなど)は、コンテキストウィンドウの希釈により、時間とともに失敗します。
解決策
確率的なテキストジェネレーターに決定論的な状態変更を実行させる場合、それを自己統治させることはできません。そのエージェンシーを剥奪し、認識論的な状態機械に強制する必要があります。
このリポジトリは、プロンプトレイヤーでLLMの行動状態機械を管理するためのマスター運用ルールであるAGENTS.mdを提供し、ランタイムエンフォーサーへの橋渡しをします。
すべての結果をもたらすアクションは、この正確なループに従う必要があります:
[仮説] [必要な証拠の特定] [根拠の検証方法] [実行](厳密に読み取り専用の診断コマンド) [オペレーターへの強制的な引き渡し]
[オペレーターへの強制的な引き渡し]において、実行レイヤー(PythonミドルウェアまたはLangGraph/Semantic Kernel)は、APIストリームを物理的に遮断し、コマンドを実行し、生の出力をコンテキストにフィードバックする必要があります。
リポジトリ構造
AGENTS.md:マスタールールセット。これをエージェントのシステムプロンプトに追加してください。
MANIFESTO.md: 「十分」というAIパラダイムに対する哲学的および技術的な議論。
/examples:標準的なエージェントがどのように失敗するか(そしてゼロトラストエージェントがどのように異常を検出し、引き渡しを行うか)を証明する実際のトランスクリプト。
/implementation:実行境界をプログラムで強制する方法を示すアーキテクチャノートとPython擬似コード(orchestrator_concept.md)。