AI・機械学習
Show HN: エージェントが意思決定に影響を与える過程を追跡するための再生可能なA2A陪審
Show HN: A replayable A2A jury for tracing how agents influence decisions (github.com)
要約
このProtoLinkのデモは、架空の賠償責任審問に自律エージェントを配置し、そのコミュニケーションを観察可能にします。エージェントは異なる役割、インセンティブ、専門知識を持ち、陪審員は誰に話しかけ、何を聞くかを選択します。このシステムは、AIエージェント間の相互作用が意思決定にどのように影響するかを追跡・分析するためのプラットフォームを提供し、その結果は再生可能でインタラクティブなレポートとして出力されます。
全文翻訳
AI賠償責任審問
AIエージェントは、より良い答え、あるいはより悪い答えにたどり着けるのか?このProtoLinkのショーケースは、架空の賠償責任審問に自律エージェントを配置し、そのコミュニケーションを観察可能にします。
事件は記憶に残るものですが、製品ではありません。製品は相互作用です:異なる役割、インセンティブ、職業、コミュニケーション習慣を持つエージェント;直接的なProtoLinkエージェント間タスク;誰に話しかけ、何を聞くかを選択する陪審員;すべての公開メッセージの後に再生可能な意見の変化;ソロ、独立、フォアマン主導、直接メッシュの比較;同じアプリケーションプロトコルを使用したプロバイダー/モデルの実験。
デフォルトの実行は決定的でオフラインです。JSON結果、ProtoLinkトレース、公開トランスクリプト、スタンドアロンのインタラクティブHTMLレポートを生成します。
この例のすべてとすべての人々は架空のものです。これはソフトウェア実験であり、法的分析、法的助言、または検証済みの安全評価ではありません。
事件:C-91インシデント
雨の降る夜21時47分、自律走行ロボタクシーが一時的な横断歩道内で31歳の自転車に乗ったリナ・オルテガさんを轢き殺しました。車は衝突のわずか0.35秒前に緊急ブレーキを開始しました。36時間前、それはOrchid 4.8ソフトウェアリリースを受け取っていました。
架空の審問は次のように問いかけます:Aster Vale Mobilityは、リナ・オルテガさんの死を引き起こした自律走行車両システムの刑事過失による展開の罪に問われるか?
証拠は相互作用する障害の問題を作成します:
ID 証拠
E1 カメラ分類が自転車とレーン矢印板を誤認しました;レーダーは動きを検出しましたが、ブレーキは抑制されました。
E2 あるエンジニアは、20件中3件の遅延ブレーキシミュレーション後にリリースをブロックしましたが、その後のキャリブレーションでは20件中20件の再実行がパスしました。
E3 事故車は安全レポートがC-90を検証している間にキャリブレーションC-91を実行しました;CIボットが署名資格情報を共有しました。
E4 契約業者が矢印板を移動させ、都市地図を更新しなかったため、約1.1秒の有用な観測時間が失われました。
E5 規制当局が承認した設計では、カメラ分類が25 km/hを超えるレーダーのみのブレーキを無効にすることが許可されていました。
E6 セルラー障害は、現場近くで2回の以前の障害があったにもかかわらず、リモートオペレーターのセーフガードを無効にしました。
E7 再構築によると、キャリブレーションと道路レイアウトの両方が、安全停止率を大きく変化させました。
二項請求は、因果関係の物語よりも意図的に狭くなっています。無罪の評決は、何も問題がなかったことを意味するのではなく、有罪の評決は、Aster Valeだけが貢献者であったことを意味するわけではありません。
エージェント
アクターの宣言はrun.pyで意図的に明示されています。ProtoLinkの構成を隠すファクトリーはありません。
審問アクター
エージェント 年齢 性別 キャラクターとインセンティブ
裁判官 Imani Quill 58 女性 中立 審問長;因果関係の寄与と法的責任を分離する
Amara Bell 41 女性 リナの家族の弁護士;説明責任を曖昧にするために複雑さが利用されることに抵抗する
Rowan Hale 47 男性 Aster Vale安全担当役員;外部の障害が予見不可能な組み合わせを生み出したと主張する
Dr. Nia Sol 36 女性 知覚エンジニア;キャリブレーションとリリースパイプラインについて正確
Elias Trent 56 男性 安全規制当局者;率直だが制度的に防御的
Dana Pierce 50 女性 明示的な金銭的利害関係を持つ保険金請求ディレクター
Dr. Amina Kade 44 女性 相互作用する原因を再構築する独立した事故調査員
陪審
陪審員 年齢 性別 人間の視点
Evelyn Brooks 62 女性 元衝突捜査官
Malik Thompson 43 男性 市民権弁護士
Dr. Anika Rao 38 女性 ヒューマンファクター心理学者
Ruben Park 35 男性 サイト信頼性エンジニア
Sofia Bell 46 女性 調査報道記者兼フォアパーソン
Casey Morgan (ソロのみ) 40 女性 市民一般論者
これらのプロンプトは人間を描写しており、シードされた数値ではありません。「あなたは61/100から始まります」とは言わず、ルーティング列挙型(reinforce_allyなど)を公開しません。参照専用のフィクスチャ係数は、すべての人間向けプロンプトの外に残ります。年齢と性別は架空のプロンプトメタデータであり、数値的な事前情報ではありません。プロバイダー比較全体で固定するか、意図的にローテーションして、人口統計の変化がモデル効果と誤解されないようにします。
エージェント作成のコミュニケーション
ワールドエンジンは、制限されたターンをスケジュールし、トポロジーを強制します。陪審員が何を言うか、またはメッシュ陪審員が誰にアプローチするかは選択しません。
審議のターンでは、陪審員は観察可能な公開アクションを返します:
{ "move": "ask_question", "target_id": "juror_ruben", "message": "共有CIトークンは、会社に責任をより多く負わせるのか、それとも帰属をより困難にするだけなのか?", "evidence_ids": ["E3"], "public_intent": "リリース自動化が組織的制御を変更するかどうかを明確にする。" }
アプリケーションはターゲットを現在のトポロジーに対して検証し、その後、話者はProtoLink経由で選択されたエージェントに直接メッセージを送信します。受信者は、更新された公開レジスタ、カテゴリ別投票、簡潔な理由、および公開返信を返します。ピアメッセージは、他の陪審員のプライベートな確率、信頼度、または投票を自動的に公開しません。エージェントは、公開メッセージに含めることを選択したものだけを公開します。
4つの意思決定条件
ソロ
1人の市民一般論者が公開記録を受け取り、同僚なしで決定します。これは直感的な製品ベースラインであり、クリーンなコミュニケーション処理ではありません:パネルサイズ、ペルソナ構成、推論予算も変更されます。
独立
同じ5人の陪審員が同じ公開審問記録を聞き、ピアメッセージなしで投票します。これは、専門化と多様性を、審議なしで捉えます。
スター
陪審員はフォアパーソンSofia Bellを通じて公開メッセージを送信します。フォアパーソンは情報ハブであり、潜在的なボトルネックです。
メッシュ
すべての陪審員は、許可されたターゲットとして他のすべての陪審員とのターンを受け取ります。エージェントは受信者、移動、メッセージ、および公開意図を作成します。
主なコミュニケーション比較は、保存された制御フィンガープリントと公開記録ハッシュが一致する場合の、独立対スターまたはメッシュです。
デフォルトのリプレイが表示するもの
オフラインシード-7フィクスチャは、コミュニケーション処理を1回の迅速な実行で可視化するように設計されています:
条件 | ピアメッセージ | 評決 | 票数 | 平均有罪レジスタ
---|---|---|---|---
solo | 0 | 有罪 | 1–0 | 78.59
independent | 0 | 無罪 | 2–3 | 77.56
star | 5 | 無罪 | 2–3 | 80.21
mesh | 5 | 有罪 | 3–2 | 80.54
独立およびメッシュパネルは同じ公開記録を受け取ります。メッシュでは、フォアパーソンSofia Bellが、検証されていないC-91キャリブレーションと衝突現場マップの相互作用について、ヒューマンファクター心理学者のDr. Anika Raoに異議を唱えることを選択します。Anikaの公開有罪レジスタは77.90から81.41に移動し、彼女のカテゴリ別投票は無罪から有罪に変更されます。その後のメッセージはその立場を強化しますが、最初の直接のやり取りが観察可能な台帳で多数派を変えるイベントです。
スターのトポロジーも平均有罪レジスタを上昇させますが、メッセージをフォアパーソンに集中させ、2対3の評決を変更しません。
したがって、デモのポイントは「メッセージが多いほど良い」ということではありません。誰が誰に話しかけられるかが、どの仮定が公開されるかを変更します。
これらは決定的なフィクスチャ結果の例であり、メッシュコミュニケーションが一般的に精度を向上させるという証拠ではありません。ライブモデルの比較には、繰り返しペア実行とメッセージのアブレーションが必要です。
クイックスタート
リポジトリのルートから実行します:
python examples/ai_courtroom/run.py
デフォルトコマンドは、決定的参照プロバイダーを使用し、ネットワークアクセスや認証なしで4つの条件すべてを実行します。
1つの条件を実行します:
python examples/ai_courtroom/run.py \
--provider reference \
--condition mesh \
--seed 17
正確な出力場所は最後に表示されます。それを選択するには:
python examples/ai_courtroom/run.py \
--condition all \
--seed 17 \
--output-dir examples/ai_courtroom/output/c-91-incident-seed-17
出力ディレクトリが再利用される場合、例の既知の生成ファイルのみが置き換えられます。
traces.jsonlは、新しい結果の隣に古い実行が蓄積することは許可されていません。
実行の監視
ランナーは作業が進行するにつれて報告するため、ライブモデルは停止しているように見えません:オフライン参照プロバイダーはコンパクトなフェーズとステップの更新を使用します;ライブプロバイダーは各A2A交換とその経過時間を示します。