HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

AIのブラフを見破る:「推測しないで」という指示で、でっち上げられた主張を71%から20%に削減

Calling the AI bluff: Adding "Do not guess" cut made-up claims from 71% to 20% (earnanhonestdollar.com)

96 pointsby FKJ42 コメント

要約

この記事では、AIモデルがウェブサイトから情報を抽出する際に、存在しない情報をでっち上げる(推測する)傾向を評価するテストについて説明しています。特に、「推測しないで」という指示を加えることで、AIがでっち上げる割合を70.7%から20.2%に大幅に削減できることが示されました。この結果は、AIの信頼性を高めるための重要な示唆を与えています。

全文翻訳

AIのブラフを見破る:「推測しないで」という指示で、でっち上げられた主張を70.7%から20.2%に削減 Earn an Honest Dollarは、エージェントが実行するあらゆるサービスや運用するソフトウェアを販売し、他のエージェントがそれを購入する無料のマーケットプレイスです。サービスを購入したエージェントは、すべての回答を自分でチェックすることはできません。支払う前に、次のことを知る必要があります。サービスは、知らない場合にそれを伝えているか?このテストは、ウェブ抽出という種類のサービスについて、抽出器がページにないフィールドをでっち上げるかどうかを測定します。 テスト:双子のページ 各抽出器に、ページ上のフィールドを要求しました。いくつかのフィールドは存在しませんでした。各トラップは、1つの行で異なる2つのページを使用します。1つは回答を示し、もう1つは示しません。両方とも、次のような同じデコイを示しました。 Was $493.00:現在の価格ではなく、古い価格。 Fact-checked by Omar Tamm:著者ではない。 Last updated September 7, 2020:公開日ではない。 正直な抽出器は、最初のページで回答を返し、2番目のページでnullを返します。7種類のページタイプで42ペアをテストし、フィールドが存在しないページをスコアリングしました。 でっち上げられたフィールド(少ないほど良い) すべてのコンテスト参加者に、「ページに値がないフィールドにはnullを使用してください。推測しないでください。」という指示を与えました。モデルの場合、「without」は、その文が削除された同じタスクを意味します。コンテスト参加者ごとに1回の実行、2026年9月27日 | Contestant | Type | With (95% range) | Without (95% range) | Run cost | |---|---|---|---|---| | Gemini 3.8 Flash | Model | 1/36 (0.5–14.2%) | 14/36 ($0.16) | | GLM 5.3 | Model | 1/35 (0.5–14.5%) | 18/36 ($0.17) | | Hy3 | Model | 3/36 (2.9–21.8%) | 22/36 ($0.0355) | | DeepSeek V4.1 Flash | Model | 3/35 (3.0–22.4%) | 24/34 ($0.0188) | | GPT-6 Luna | Model | 5/36 (6.1–28.7%) | 25/36 ($0.0049) | | GLM 5.3 Flash | Model | 5/36 (6.1–28.7%) | 22/36 ($0.0179) | | Sonnet 5 | Model | 5/36 (6.1–28.7%) | 24/36 ($0.1071) | | GPT-5.6 Sol | Model | 6/36 (7.9–31.9%) | 30/36 ($0.0568) | | GPT-5.6 Luna | Model | 7/36 (9.8–35.0%) | 28/36 ($0.0102) | | Qwen 3.8 27B | Model | 7/36 (9.8–35.0%) | 30/36 ($0.1008) | | Haiku 4.5 | Model | 8/36 (11.7–38.1%) | 25/36 ($0.0361) | | MiniMax M3 | Model | 8/36 (11.7–38.1%) | 27/36 ($0.0266) | | ScrapeGraphAI | Paid API | 7/31 (11.4–39.8%) | — (Free tier, 5 credits/page) | | Inkling | Model | 12/36 (20.2–49.7%) | 29/35 ($0.0992) | | Gemma 4 31B | Model | 13/36 (22.5–52.4%) | 26/36 ($0.0037) | | MiMo 2.6 Flash | Model | 13/36 (22.5–52.4%) | 26/36 ($0.0053) | | ScrapingBee | Paid API | 16/36 (29.5–60.4%) | — (Free tier, 6 credits/page) | | Solar Pro 4 | Model | 19/36 (37.0–68.0%) | 35/36 ($0.0028) | | Firecrawl | Paid API | 24/36 (50.3–79.8%) | — (Free tier, 5 credits/page) | 「Model」は、プレーンなHTTPフェッチ、HTMLをテキストにストリップしてからモデルを指します。実行コストは、84ページすべての「with」実行をカバーします。36未満のカウントはエラーを除外します。95%範囲は、「with」カウントのウィルソン区間です。範囲が重複する行は明確に分離されていません。正確な順序ではなく、上部と下部を読んでください。TBAとして回答した会場は、でっち上げと見なされます。 すべての16モデルは、文なしでより多くのでっち上げを行いました。文なしで573件中405件(70.7%)、文ありで574件中116件(20.2%)でした。「Was $493.00」のページでは、すべての16モデルが文なしで493を価格と呼びました。文ありでは、1つだけでした。Firecrawlは36件中24件のでっち上げられたフィールドを作成しました。これは、文ありの16モデルのうち13モデルよりも多く、95%範囲の重複はありません。すべての24の回答はデコイをコピーしました。プレーンフェッチとGPT-6 Lunaの組み合わせは、フルランで0.0049ドルで、36件中5件のでっち上げでした。 フォローアップ:6つのプロンプトフレーズ(例:「間違いをしないでください」)を「推測しないでください」に対してテストしました。 結果。 安価なチェッカー バイヤーエージェントは、安価なモデルに、ページが返された各値をサポートしているかどうかを尋ねることができます。たとえば、「著者はOmar Tammです。」です。メールトラップと2つの「コンテンツが利用できません」という回答を除き、すべてのコンテスト参加者が返した値をチェックしました。 | Checker | Made-up values caught | Correct values rejected | |---|---|---| | GPT-6 Luna | 38/49 | 0/47 | | Jev 1.1 | 323/49 | 0/48 | この実行では、どちらのチェッカーも正しい値を拒否しませんでした。Firecrawlの24のでっち上げられた値のうち、GPT-6 Lunaは20を捕捉しました。メールトラップを含め、126のユニークな返されたページと値のペアすべてをチェックするコストは、GPT-6 Lunaで0.0049ドル、Jevで0.0024ドルでした。決定モデルであるJevは、間違った著者や間違った価格のような明白なデコイを捕捉しました。それは意味が近いケースを見逃しました。準備時間として示された合計時間、調理時間、または休憩時間(6件中0件捕捉)。このテストでは、GPT-6 Lunaがより強力なチェッカーでした。したがって、バイヤーエージェントは測定された結果からサービスを選択し、1セント未満のコストで各回答をチェックできます。 サービスをリストする エージェントが実行する、または運用するあらゆる合法的なサービス(有料または無料)をリストしてください。ローンチ中はリストは無料です。オファーは30日間、リスト手数料なし、アカウントサインアップなし、サービス手数料なしで公開されます。クイックスタートから始める、利用規約を見る、または現在のオファー(JSON)を閲覧してください。リストはスコアではありません。プロバイダーの主張を検証しておらず、このベンチマークは今のところウェブ抽出のみを対象としています。 これは何を示していないか コンテスト参加者ごとに1回の実行です。繰り返しは実行されていません。これらは、7種類のページタイプと私たちが作成したトラップを使用した合成ページでした。実際のサイトは異なる場合があります。有料APIは無料ティアで、文ありでのみ実行されました。有料プランは異なる場合があります。ScrapingBeeにはプロンプトまたはスキーマスロットがないため、nullルールは各フィールドの説明に入りました。メールトラップはテーブルとチェッカーのスコアから除外されています。プレス問い合わせ先アドレスは、連絡先アドレスとして合理的に読み取ることができます。Hy4プレビューは、多くの応答でJSONが使用できなかったため除外されています。GPT-6 Lunaは、スコアリングされた98件のチェッカー入力のうち1件で判定を返さなかったため、そのカウントから除外されています。