HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Perplexityの引用の3分の1は、引用されている数値を含んでいない

A third of Perplexity's citations don't contain the number they're cited for (hausresearch.com)

104 pointsby jakobgreenfeld36 コメント

要約

Haus Researchの調査によると、Perplexityの検索モデルが引用した情報源の34.7%は、リンク切れ、アクセス不能、または引用文中の数値を含んでいないページを指していました。これは、AI検索エンジンの信頼性における引用の正確性に関する懸念を示唆しています。Perplexityの2つの検索モデルは、事実に関する質問に対して、引用された情報源の正確性において同程度のパフォーマンスを示しました。

全文翻訳

HR-2026-09 · 2026年9月2日 Perplexityの引用の3分の1は、引用されている数値を含んでいない Perplexityの検索モデルが、ある数値を述べた文に付与した1,826件の引用のうち、34.7%は開けないページ、またはその文中の数値を一つも含まないページを指していました。主張ごとに採点した場合、872件の主張のうち14.4%が不合格となりました。 私たちはPerplexityの2つの検索モデルに対し、210のテクノロジー企業に関する310の事実に基づいた質問を投げかけ、それらが引用した全てのソースを取得し、そのページが引用された内容を実際に述べているかを確認しました。数値を述べている文に付与された1,826件の引用(第二の意見なしで確認可能なもの)のうち、34.7%は通常の読者には開けないページ、または開いたとしても引用された文の数値を一つも含まないページを指していました。 モデルは合計で2,511件の引用マーカーを配置しました。上記の単位は引用であり、主張ではありません。872件の数値を伴う主張のうち3分の2は、複数のマーカーを持っており、私たちは各マーカーを個別に採点しました。主張ごとに採点し、引用先のいずれかのページがその数値のいずれかを含んでいる場合に主張を合格とみなした場合、14.4%が不合格となりました。私たちは引用を先に取り上げます。なぜなら、マーカーは個々の出所の主張だからです。この文はあのURLから来た、という主張です。失敗の主な原因はリンク切れではありません。引用されたURLのわずか1.3%がリンク切れでした。大きな2つのカテゴリは、読者がアクセスできないページと、読者がアクセスできるが内容が一致しないページです。 何をしたか 10個の質問テンプレートを用意しました。それぞれが実際に調べるであろう事実です。設立、最新の資金調達ラウンド、従業員数、エントリー価格、本社所在地、収益、開示された侵害、現CEO、買収、有料プランのアップタイムSLAです。各企業に1つずつ質問し、100社には異なるテンプレートで2つ目の質問をしました。Perplexity/Sonar、Perplexity/Sonar-Pro、そして対照としてWebプラグイン付きのGPT-4.1に、温度0で310の質問を投げかけました。両方のPerplexityモデルは、主張を[n]としてインラインでマークし、nはそれらが返す引用配列のインデックスとなります。これは監査を可能にする部分です。回答の最後に参考文献リストがあるのではなく、この文がそのURLから来たという特定の主張です。私たちは各回答を文に分割し、マーカーごとに1つの主張と引用のペアを作成しました。どちらのモデルも、自身の引用リストの末尾を過ぎるマーカーを生成することはありませんでした。その後、ユニークな引用URL(Sonarだけで2,915件)をすべて取得し、リンク切れ、ゲート付き、空、到達不能、またはライブに分類しました。失敗したものはすべて2回の追加チャンスを得ました。より長いタイムアウト、次にローテーションプロキシを介したリトライです。これにより、単一のデータセンターアドレスが歓迎されなかったためにページがブロックされたと記録されることはありませんでした。この3回目のパスで192件のURLが救われました。分類は常にページの有利な方向にしか動きません。見出しのチェックにはモデルは一切必要ありません。各主張から、その詳細(金額、パーセンテージ、規模、年、3桁以上の連続した数字など)を抽出し、引用ページの表示テキストがそれらのうち少なくとも1つを含んでいるかを確認しました。正規化を行い、$185 million、$185M、185000000がすべて一致するようにしました。1つの数値があれば合格です。単なる年も合格です。したがって、34.7%は最低ラインです。不合格となった各ペアは、引用されたページに引用された文から単一の数字も含まれていないものです。 開かない引用 Perplexity/Sonarの2,915件のユニークな引用URLのうち: クラス | 割合 ライブで読み取り可能 | 78.7% ログイン、ペイウォール、403、またはボットウォールによる制限 | 16.1% クライアントレンダリングされたシェルで読み取れなかったもの | 2.5% リンク切れ(404、410、DNSエラー、ソフト404) | 1.3% 3回のパス後も到達不能 | 1.4% 6件に1件の引用がゲート付きです。これはソース(PitchBook、ZoomInfo、Crunchbase、Reuters)の欠陥ではなく、引用の欠陥です。読者が開けない脚注は、検証する方法のない出所の主張であり、引用が存在する目的を阻止する状態です。回答全体で集計すると、Sonarの310の回答の84.2%が、通常の読者が開けないURLを少なくとも1つ引用しており、10.6%が完全にリンク切れのURLを少なくとも1つ引用していました。リンク切れは名前を挙げる価値があります。なぜなら、それらの約半数は同じ種類のページだからです(Sonarの38件のうち20件)。そして、それらのURLはそれらを示唆しています。komo.ai/directory/<company>-offices。temperstack.com/plans/<company>。devhelm.io/sla/<company>。apollo.io/where-is/<company>。portersfiveforce.com/blogs/brief-history/<company>、そしてmatrixbcg.comとcanvasbusinessmodel.comの同一パスです。これらは、質問されたクエリを正確に捉えるために大規模に公開され、上がったときと同じくらい安価に削除された、企業ごとに質問タイプごとに生成されたページです。執筆日に3つを再取得しました。Elasticの本社はどこかと尋ねたところ、Sonarはkomo.ai/directory/elastic-officesを引用しましたが、404でした。Redditの本社について尋ねたところ、両モデルはapollo.io/where-is/redditを引用しましたが、410 Goneでした。Discordの最も安い有料プランについて尋ねたところ、Sonar-Proはtemperstack.com/plans/discordを引用しましたが、404でした。 開くが内容が一致しない引用 ページが開いて読み取り可能だったペアのうち、16.1%は主張自身の数値を一つも含まないものでした。最も分かりやすい例は価格です。Vercelの最も安い有料プランのエントリー価格について尋ねたところ、Sonarは「無料のHobbyプランは月額$0なので、最初の有料ティアは月額$20から始まります」と回答し、vercel.com/docs/plansを引用しました。執筆時にそのページを取得しました。HTTP 200を返し、プラン名を記載していますが、$20、$20/month、20/monthという文字列はどこにも表示されていません。数値はおそらく正しいでしょう。引用はそれの証拠ではありません。 第二のパターンはより示唆に富んでいます。なぜなら、それは企業間で繰り返されるからです。本社について尋ねたところ、両モデルは番地を生成し、その会社のWikipedia記事に帰属させています。 主張 | 引用ページ | そのページに番地はあるか? Docker | 3790 El Camino Real #1052, Palo Alto, CA 94306 | en.wikipedia.org/wiki/Docker,_Inc. | いいえ Rippling | 430 California Street, San Francisco, CA 94104 | en.wikipedia.org/wiki/Rippling_(company) | いいえ Substack | 111 Sutter Street, San Francisco, CA 94104 | en.wikipedia.org/wiki/Substack | いいえ SentinelOne | 444 Castro Street, Mountain View, CA 94041 | en.wikipedia.org/wiki/SentinelOne | いいえ 4つの記事すべてが執筆時に取得され、番地、通りの名前、または郵便番号はどれにも含まれていませんでした。回答のいくつかは、「複数の情報源によると」や「いくつかのビジネスディレクトリによると」といったフレーズでそれ自体を述べており、それでもWikipediaにマーカーを付けています。主張と引用は同じプロセスによって生成されており、そのプロセスは検索ではありません。 同じことのより穏やかなバージョン:SonarはGitLabのCEOをBill Staplesと述べ、彼が2024年12月5日にその役職に就いたと引用し、GitLab自身の役員ページを引用しました。そのページにはBill Staplesという名前があります。日付は記載されていません。文の半分はソースされています。 最悪の失敗箇所 両方のPerplexityモデルをプールし、質問タイプ別に、引用ページが主張の数値のいずれかを含んでいたペアの割合: 質問 | ペア数 | 合格数 | 合格率 現CEOは誰か | 235 | 104 | 44.3% 本社住所 | 202 | 107 | 53.0% エントリー価格 | 171 | 107 | 62.6% セキュリティインシデント | 205 | 137 | 66.8% アップタイムSLA | 145 | 100 | 69.0% 買収 | 278 | 192 | 69.1% 最新の資金調達ラウンド | 103 | 73 | 70.9% 収益またはARR | 192 | 139 | 72.4% 設立 | 128 | 96 | 75.0% 従業員数 | 167 | 137 | 82.0% この順序はランダムではありません。それは、1つの標準的な場所に事実がどれだけうまく書き留められているかを追跡します。従業員数と設立年は、それらを保持するために構築されたページの構造化フィールドにあります。CEOの開始日やオフィスの番地は、誰もが繰り返し述べ、誰も公開しない種類の情報であり、モデルはコンセンサスを再現し、それを決して記載しなかったページを指します。 プレミアムモデルは、より良くも悪くもない 私たちのパイロット調査では、Sonar-ProはSonarよりも主張の根拠が薄いことが示唆されました。フルスケールではそのギャップはなくなります。Sonarは数値ペアの65.9%(95%信頼区間 62.8–68.9)で合格し、Sonar-Proは64.7%(61.5–67.7)で合格しました。信頼区間は快適に重なっており、2つのモデルはほぼ同じレートで引用しています。1回答あたり9.8件と9.7件のソースです。この測定では、それらは同じ製品です。パイロットの結果は、小さなサンプルが物語っていることを示していました。