AI・機械学習
LLMジャッジは「存在」を検証し、「不在」を検証しない:AI臨床記録における省略盲とそれを回復するもの
LLM Judges Verify Presence, Not Absence: Omission Blindness in AI Clinical Notes (arxiv.org)
要約
本研究では、AIによる臨床記録作成における主要なエラーである「情報の省略」をLLM(大規模言語モデル)ジャッジが検出できるかを検証しました。標準的なLLMジャッジは、記録された情報(存在)の検証には優れていますが、記録されなかった情報(不在)の検出は苦手であることが明らかになりました。この問題を解決するため、記録された事実をリストアップし、それぞれを検証する新しいタスク構造を提案し、その有効性を示しました。
全文翻訳
アンビエントAI(常時稼働型AI)は臨床記録を作成しますが、公開されている監査では、その主なエラーは省略であることが判明しています。これは、診察で確立された情報が記録されないというものです。標準的なチェックはLLMジャッジです。これは、2番目のモデルが記録をトランスクリプトと比較して問題をフラグ付けするものです。私たちは、ジャッジが省略を検出できるかを問います。公開コーパスは、その答えを提供できません。なぜなら、それらの臨床医の参照記録とトランスクリプトは、実質的に矛盾しているからです。私たちのベンチマークは、監査された事実シートからの単一エラーの記録ペア500件で構成されています。そのうち298件は、名前が付けられた事実が確かに存在せず、202件は追加または変更されたコントロールです。8つのジャッジデザイン全体で、ペアの識別(欠陥のある記録がクリーンなツインよりも下にある、コイン投げの0.5)は、追加または変更されたコンテンツでは0.79〜0.94、省略では0.50〜0.63です。単一の記録では、どのデザインも完全な記録よりも信頼性が高く省略をフラグ付けしません。単語の変更、投票、GEPAプロンプトの最適化は、実用的な検出を作成せずに動作点を移動させます。タスクの再構築がそれを回復させます。トランスクリプトが確立する事実をリストアップし、次に各事実について記録をチェックします。2つの方法が独立してそれに到達し、トレードオフを行います。1つはファクトごとのパイプライン、もう1つは1回の呼び出しで同じことを行うGEPAで進化させたプロンプトです。パイプラインのフラグは、欠落している事実とその重大度を2.7%の誤検知で示します。単一の呼び出しは、6.2%の誤検知で、より多く(24.6%に対して36.9%、p=0.002)を検出し、記録あたりのコストは10分の1です。医師の著者が70項目を検証し、2つのルートが意見を異にする場合、10件中10件でパイプラインを支持しました(p=0.002)。著者ではない2人目の臨床医が、重大度ルーブリックをブラインドで評価し、1つのグレード内で一致しました。コンパニオン調査からの実際のベンダー記録では、ベンチマークしきい値は転送されませんが、再調整された単一呼び出しは、誤検知率の半分で8つのうち最高のものよりも多く検出します。事実が他の場所で再言及されている省略は、両方のルートを打ち負かします。私たちはベンチマーク、プロンプト、およびジャッジメントをリリースします。