AI・機械学習
あなたのモデルはすでに答えを知っている:ベンチマークの回答がLLMに漏洩する方法
Your model already knows the answer: how benchmark answers leak into LLMs (elman.ai)
要約
AIモデルの評価において、実世界の問題に対する既知の答えを使ったベンチマークは、モデルの推論能力を測るのに理想的ですが、同時に「汚染」の問題を抱えています。モデルが学習データで既に質問やその答えに触れている場合、高いスコアは推論によるものか、単なる記憶によるものか区別がつきません。この記事では、この「汚染」が入力漏洩、ベンチマーク漏洩、結果漏洩の3つの経路で発生するメカニズムを解説し、特に実世界の結果に基づくベンチマークにおける結果漏洩の深刻さと、それを防ぐためのアプローチについて論じています。
全文翻訳
エッセイ · 2026年7月30日
あなたのモデルはすでに答えを知っている
Francesco Moramarco · Co-founder, Elman
AIモデルの最良のテストは、既知の答えを持つ実世界の問題です。それは最も簡単なテストでもあります。AIモデルはインターネットの大部分を読み込んでいるため、あなたが質問するずっと前に、質問、答え、またはその両方に遭遇している可能性があります。その場合、高いスコアは2つの非常に異なるものを隠しています:答えに推論でたどり着いたモデルと、すでに読んだ何かを繰り返しているモデルです。
それらを区別することは汚染の問題であり、分野が依存しているベンチマークの驚くほど多くの部分の下にあります。
モデルが臨床で薬が成功するかどうかをどの程度確実に予測できるかをテストしたいと想像してください。数年待って新しい試験を行う代わりに、すでに終了した試験でテストします。後期段階の試験に到達した薬プログラムを採用し、それぞれが成功したかどうかを隠し、モデルに予測させます。
紙の上では、クリーンなテストのように見え、高速で、実際の成果で採点されますが、そうではありません。テストする価値のある試験は有名なものが多く、その結果はモデルがトレーニングした教科書、レビュー、ニュース、特許全体に繰り返し現れます。モデルが薬が成功すると言ったとき、スコアは推論でそこに至ったモデルと、名前を認識して何が起こったかを思い出したモデルを区別できません。
臨床試験は私たちの分野ですが、この罠は一般的です。それは、金融、法律、予測、または結果がすでに公開されている他の場所で、解決されたイベントから構築された任意のベンチマークに適用されます。
これらのベンチマークは、実際の成果が専門家が発明できるものよりも優れたテストケースであるため、良い理由で公開履歴から構築されています。それは、単に質問作成者が尋ねようと思ったことだけでなく、真の生物学と薬が失敗する実際の方法を反映しています。それらの成果は、私たちが採点したいゴールドスタンダードであり、公開されていることがまさにそれらが漏洩する理由です。
では、どうすればよいでしょうか?
答えがモデルに入る3つの方法
答えは3つの経路でモデルに到達する可能性があります。この分割は、問題を整理するための私たち自身の方法であり、命名された分類法ではありませんが、各経路には確立された基盤があります。
図1. 3つの漏洩、並んで表示。
各パネルで、赤いマークはモデルが予測すべき答えです。
入力漏洩は、テスト時に、ケースのためにモデルが読むドキュメント内でモデルに到達します。
ベンチマーク漏洩は、あなた自身のテストファイルがトレーニングデータに引き込まれることです。
結果漏洩は、トレーニング中に論文、ニュース、特許から学習した公開された結果です。
ルートが異なるだけで、すべて同じ答えです。
入力漏洩は、テスト時に、ケースのためにモデルが読むドキュメントを通じて発生します。あなたがそれらのドキュメントをフィードするか、モデルが検索ツールでそれらをフェッチするかに関わらずです。
決定日以降に書かれた任意のドキュメントは、モデルが予測すべきまさにその結果を発表する可能性があり、それは未来を読むことと同じくらい良いです(Kaufman et al., 2012)。
ベンチマーク漏洩は、モデルがあなたのベンチマークの後にリリースされ、モデルがベンチマークセット自体でトレーニングされ、質問と回答の両方を記憶している場合に発生します。
これは、ベンチマークが時間の経過とともに劣化する最も一般的な方法です。
Balloccuらは、リリースから1年以内にGPT-3.5およびGPT-4に400万以上のテストサンプルが漏洩したことを追跡しました(Balloccu et al., 2024)。他の研究者が小学校の数学の問題セットをゼロから書き直したところ、いくつかのモデルファミリーは新しいバージョンで著しく低いスコアを記録しました(GSM1k, Zhang et al., 2024)。
結果漏洩は、結果自体が公開の事実であり、モデルがそれをトレーニングしている場合に発生します。完了した試験、規制当局の承認、または成功した薬は、数千の論文や申請書に繰り返し登場し、モデルは、あなたの特定のベンチマークに一切接触することなく、事前トレーニング中またはその後のファインチューニング中にそれを吸収します。
モデルは、戦争が終わった年のような、他の広く報告されている事実を保持するのと同じ方法で結果を保持するようになります。
その結果、モデルが特定のファイルを見たことがなくても、モデルがそのファイルで質問を提示したことを知っていても、モデルは依然としてこのよく知られた薬が成功したことを知っているでしょう。ベンチマークを秘密にしておくことも役立ちません。なぜなら、答えはそもそもあなたのファイルに含まれていなかったからです。それはすでにモデルの世界に関する一般的な知識の一部でした。
新鮮な結果を待つことは、結果が10年先になるまで機能します。
あらゆる種類の漏洩を防ぐ最もクリーンな方法は、もはや履歴でテストすることをやめ、まだ発生していないイベントでのみモデルを採点することです。そうすれば、漏洩する答えは単純に存在しなくなります。
ライブベンチマークは固定スケジュールで質問を更新します(LiveBench, White et al., 2024)。予測ベンチマーク(ForecastBench)は、テスト時にまだ解決されていないイベントでモデルを採点します(ForecastBench, Karger et al., 2024)。
CT Openは、結果が公開される前に臨床試験でモデルを採点するライブプラットフォームです。各チャレンジが開く前に予測が入力され、専門家の注釈に対して検証された自動パイプラインが各結果の最も早い公開された言及を検索するため、予測が行われたときに答えが見つからなかった場合にのみトライアルがカウントされます(Wang et al., 2026; ct-open.net)。
トライアル結果は年間を通じて発表され、CT Openは年4回採点します。
私たちが気にかけている決定はより遅いものです。10億ドルの費用がかかるコミットメントは、それを決定する読み出しの約10年前に下されるため、その決定をライブベンチマークに委ねると、最初のスコアは2036年に到着します。
したがって、私たちは歴史、そしてそれに伴う結果漏洩に立ち往生しています。
そうすると、知っておく価値のある8つの方法が残ります。それぞれが漏洩を防止または検出します。
しかし、より重要な分割は、8つの方法のうちどれが3つの漏洩のうちどれに対処するかです。
分野の仕事のほとんどはベンチマーク漏洩を対象としていますが、実世界の結果から構築されたベンチマークの場合、最も重要な方法は結果漏洩に対処する3つです。
図2. 8つの方法がそれぞれどのように機能するか、それが取り組む漏洩別にグループ化されています。
2つの防止方法は漏洩が発生する前に停止し、6つの検出方法は発生後にそれを捕捉します。
解決された結果のベンチマークの場合、下段の3つの結果漏洩方法が最も重要です。
漏洩に取り組む漏洩別にグループ化された8つの方法
入力漏洩:ソースでシャットダウンする。
1. 日付制限付きツールは、モデルに、決定日以降に公開されたものを拒否する検索・取得ツールを提供します。例えば、日付制限付きのウェブ検索です。
予測システムはすでにこのように機能しており、質問の決定日より前に公開されたニュースに取得を制限しています(Halawi et al., 2024)。
これは入力漏洩を閉じる唯一の手段であり、ソースで機能するため、後で検出するものは何も残りません。
それはソースの日付の良さと同じくらい良いので、実際にはオープンウェブよりも信頼できる公開日を持つ学術ソースに依存します。
ベンチマーク漏洩:モデルがあなたのファイルを見たかどうか。
2. 新しいまたはプライベートなテストセットは、クリーンな方法です。モデルがトレーニングされていないケースでテストするか、セットを公開しないでおくと、誰もトレーニングできなくなります。
多くの新しいベンチマークはまさにこのルートを取っており、各モデルのトレーニングカットオフ後にリリースされた新しい問題を作成するため、テストセットはトレーニングされていない可能性があります(LiveCodeBench, Jain et al., 2024)。
この漏洩に対する他の3つの方法は、事後に検出を試みます。
それらは分野で最も発達した部分を構成しますが、公開された結果のベンチマークにとっては、8つのうち最も有用ではありません。なぜなら、モデルは、あなたが質問を提示した特定のファイルに一度もアクセスすることなく、結果を完全に知ることができるからです。
3. メンバーシップ推論は、モデルが特定のテキストを見たかどうかを尋ねます。モデルはトレーニングされたテキストに対して異常に流暢であるため、各単語に対する自信度(シーケンス内の各トークンの対数確率)をチェックします(Min-K%, Shi et al., 2023)。
私たちにとってそれは