HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Show HN: ReasonGate - LLMプロンプトインジェクションをブロックする説明可能なゲート

Show HN: ReasonGate- An explainable gate that blocks LLM prompt injection (github.com)

6 pointsby Cagritemel2 コメント

要約

ReasonGateは、LLMアプリケーション向けのセキュリティゲートで、プロンプトインジェクション攻撃を検知・ブロックします。このシステムは、攻撃をブロックするだけでなく、その決定に至った理由を説明可能にすることで、セキュリティチームや監査担当者への説明責任を果たします。ルールベース、機械学習、コンテキストスキャンなど多層的な防御機構を備えています。

全文翻訳

ReasonGate LLMアプリケーションのための説明可能なセキュリティゲートです。すべての決定には監査可能な理由が伴います。 単に悪い文字列をフラグ付けするだけでなく、実際の侵害を防ぐ様子をご覧ください。 銀行のサポート担当者は、ツール(send_email、transfer_funds)を持ち、顧客レコードに隠された指示(RAG / エージェントに対する主要な攻撃である間接的なインジェクション)が渡されます。 同じ攻撃、1つの変数:シールド。 シールド レコード 結果 OFF 汚染された🔴 顧客レコードが攻撃者にメールで送信され、$84,200が送金されます(実際の副作用、ディスクに書き込まれる)。 ON 汚染された🟢 ブロックされた 同じ入力。モデルが呼び出される前にインジェクションが捕捉されます。副作用ゼロ。 ON クリーン🟢 許可された エージェントは通常通り応答します(ダミーのブロックリストではありません)。 証拠はエージェントの言葉ではなく、発生しなかった副作用です。 自分で実行してください(決定論的、APIキー不要)。これはスクリーンショットではなく、CIで強制される不変条件です。 python -m examples.stakes_demo.run # examples/stakes_demo/ を参照 ▶ ライブデモを試す — プロンプトを貼り付け、理由と監査可能なレコードとともにブロックされる様子を確認します。 直接的な攻撃や、隠された、ゼロ幅で難読化された攻撃をブロックする様子をご覧ください — ゼロ依存コアで実行され、APIキー不要、データはサーバーから離れません。 プロンプトインジェクションは、言語モデルが同じチャネルを通じて指示とデータを読み取り、それらを確実に区別できないという構造的な理由から、OWASP LLM Top 10の最上位項目です。モデル内でそれを修正することはできません。その前にゲートを配置します。 ほとんどのゲートはブラックボックスです — 信頼度スコアとyes/no。これは、セキュリティチーム、監査担当者、または規制当局に決定を防御する必要がある人にとっては十分ではありません。 ReasonGateは攻撃をブロックし、どのシグナルが発火したか、何に一致したか、そしてそれが類似する既知の攻撃を示します。 説明できないブロックは、出荷できないブロックです。 ReasonGateはモデルに依存しません。任意のプロンプト -> str関数(OpenAI、Anthropic、ローカルモデル、独自のRAGパイプライン)をラップし、3つのサーフェスを検査します:ユーザープロンプト、取得されたコンテキスト、およびモデルの出力。 pip install reasongate コア(ルール、正規化、間接インジェクションおよび漏洩検出器)は、依存関係のない純粋なPythonです。 アーキテクチャ:オープンコア + エンタープライズアドオン オープンコアはルールのみで自己完結型です。安定したDetectorインターフェースとプラグインシーム(reasongate.registry、エントリーポイントグループ reasongate.detectors / reasongate.provenance)を公開します。 別個のreasongate-enterpriseアドオンをインストールすると、埋め込みベースのML検出器と、コアが必要とするプロビナンス検出器が自動的に有効になります。コードの変更は不要で、各決定のShieldResult.layersはどのレイヤーが実行されたかを示します([