HN 日本語サマリー

← 一覧へ戻る
ビジネス・スタートアップ

煙を量る:なぜAIの可視性ダッシュボードはほとんど役に立たないのか

Weighing smoke: why AI visibility dashboards are mostly useless (betterthangood.xyz)

4 pointsby iainharper0 コメント

要約

AI検索エージェントにおけるブランドの存在感を追跡するダッシュボードへの投資が年間1億ドルを超えているが、これらのツールの多くは実用性に欠ける。現在のツールは、ベンダーが操作するプロンプトを平均化し、モデルのランダム性や消費者向け製品とAPIの機能差により、信頼性の低い数値を生成している。真に安定したシグナルは、モデルが参照するブランドの候補セットのみであり、これを正確に測定するには多くの試行が必要となるため、ダッシュボードによる迅速な測定はほとんど意味をなさない。

全文翻訳

煙を量る:なぜGEOダッシュボードはほとんど役に立たないのか By Iain, 2026年7月5日 エージェント以前の世界と同様の検索可視性を提供するツールの約束は、理解できるほど魅力的です。しかし、プラットフォームに熱心にお金を払う前に、月に1回の午後の作業の方が費用対効果の高い代替手段になるかどうかを検討してください。最近、私はGEOのキメラ、つまりブランドをAIの回答に最適化すると謳うコテージ産業について書きました。私の主張は、販売されているレバーのほとんどは存在しないということでした。業界のもう一つの部分は、レバーではなくゲージを販売しています。 AIの可視性追跡への支出の推定値は、現在年間1億ドルを超えており、数百のダッシュボードがChatGPTにおけるブランドの存在感を、かつてMozがGoogleでのランクを追跡していたように追跡しています。このピッチは、これまで頼ってきたすべてを失い、来るべき虚無を見つめているブランドマーケターたちの肥沃な土壌に落ちています。これにはポストミレニアル世代のような雰囲気があります。 ハリウッドの脚本家ウィリアム・ゴールデンマンは、「誰も何も知らない」と有名に引用されています。彼の引用のあまり知られていない部分は、「毎回…それは推測であり、運が良ければ、教育された推測である」というものです。それは一文でエージェント検索の可視性を表しています。 ほとんどの現在のツールは毎日プロンプトを実行し、実行結果を平均化し、可視性パーセンテージをトレンドラインと信頼区間とともに報告します。平均化自体は問題ではありません。問題は、平均化されているすべてのものです。なぜなら、測定バスケット内のプロンプトは一般的に分析ベンダーによって誘導され、それらに重み付けされるクエリボリュームはモデル化されたフィクションであり、サンプリングされているクエリサーフェスは人間が使用するものとは異なり、結果のスコアがビジネスにとって重要な単一の結果またはコンバージョンを予測することを示した者はいません。 それにもかかわらず、これらのツールは、死にゆくハイストリートのベイプショップのように増殖しています。私たちが必死に求めている真実は、実際には存在しないのです。検索エージェントの応答での可視性を改善するための最小限のメカニズムしかありません。そして、その可視性を信頼性をもって追跡および測定する方法はありません。四半世紀にわたるSEOとSERPを経て、これは多くの人がまだ受け入れたくない苦い錠剤です。現在代替として提供されている美味しいキャンディーは、私が精密洗浄と呼ぶものです。空虚な測定を十分に頻繁に実行すると、ノイズが相殺され、知識として通用する、安定した、小数点付きの数値が現れます。しかし、平均化は数値を買い取りますが、妥当性を買い取ることはできません。 サイコロのカップ 1月に、ランド・フィッシュキンは検索エージェント追跡業界の詳細な調査を発表しました。Gumshoe.aiのパトリック・オドネルと共に、彼は600人のボランティアを募集し、ChatGPT、Claude、GoogleのAIで12のブランド推奨プロンプトを合計2,961回実行しました。対象はシェフナイフからがん病院まで多岐にわたります。フィッシュキンは、検索エージェントの応答の追跡が無意味であることを証明しようと意気込んでいました。結果はそれよりも奇妙でした。 検索エージェントにブランド推奨を100回尋ねた場合、同じリストが2回得られる確率は100分の1未満です。同じリストが同じ順序で得られる確率は、1000分の1に近くなります。ブランドは変わり、順序は変わり、アイテムの数さえ変わります。 フィッシュキンの順位追跡に関する結論は率直でした。「AIにおける『ランキングポジション』を提供するツールは、すべてインチキである」と彼は書きました。 これは一匹狼の主張ではありません。繰り返し行われたGEO測定のarXiv研究によると、同一のプロンプトに対して返されるブランドのセットは、実行間で59%〜45%しか重複せず、広いばらつきがあり、検索エージェントの可視性の単一の観測は誤解を招くものであり、可視性は繰り返し実行全体での確率として扱われるべきであると結論付けています。2番目の論文は統計的な点を直接指摘しています。生成エンジンからの引用メトリクスは、固定値ではなく確率変数です。Ahrefsは、同じクエリに対してGoogleのAIモードとAIオーバービューが87%の確率で異なるソースを引用していることを発見しました。 この変動は制御できません。言語モデルは回答を検索するのではなく、一度に1つのトークンを生成し、組み込みのランダム性(「温度」として知られる)の範囲から各単語を選択します。そのランダム性は、出力を缶詰のようなものではなく、流暢に読めるようにする設定であるため、重要な設定です。同じ質問を2回尋ねると、回答は自然にずれます。Web検索を追加すると、サイコロはさらに2回振られます。モデルがあなたの質問を独自の検索クエリのセットに分割するとき(「ファンアウト」と呼ばれる)、そして取得したページのどれを引用する価値があるかを選択するときです。 安定させるための設定でさえ、システムがライブになるとぐらつきます。リクエストはバッチ処理され、利用可能なモデルのコピーにサイレントにルーティングされ、測定していると思っていたものの途中で新しいバージョンに切り替えられます。したがって、フィッシュキンが測定した変動は、カテゴリが発展するにつれて落ち着く未熟さではありません。それは製品が設計通りに動作している結果であり、それを排除したプラットフォームは、すべてのユーザーに同じ缶詰の回答を返す、より悪い製品を出荷することになります。 したがって、検索エージェントにおける可視性は、常に分布です。 変動の下で、フィッシュキンは少なくとも何か安定したものを見つけました。モデルが参照するブランドのプールである考慮セットは、順序がスクランブルされていても安定していました。ヘッドホンの実行では、Sony、Bose、Appleがほぼすべての実行に登場し、タイトなカテゴリのトップブランドが90〜100%の応答に表示されましたが、ブランドデザインエージェンシーのような広範なカテゴリは30〜40%に散らばりました。 Amanda Natividadが142人の人間が同じ意図で独自のプロンプトを作成したとき、フレーズのセマンティック類似性は0.081でした。これは、俳句とショッピングリストの類似性に近いです。しかし、考慮セットはそれでも維持されました。あなたはプールにいるかいないかのどちらかであり、メンバーシップは60〜100回の実行でゆっくりとしか推定できないようです。これは狭いですが有効なシグナルですが、それだけです。 間違ったウィンドウの問題 ツールが週に100回プロンプトを実行して確率を報告すると仮定します。それでも、楽器を間違った窓から覗いています。ほとんどのトラッカーは、ベンダーAPIをクエリします。なぜなら、それらは安価でスクリプト化可能だからです。しかし、APIエンドポイント経由でアクセスされるGPT 4.5は、ChatGPTではありません。消費者向け製品には、メモリ、カスタム指示、会話履歴、アカウントコンテキスト、位置情報推論、およびAPI呼び出し元が見ることのないシステムプロンプトがあります。それはモデルのバリアント間をルーティングし、バリアントはしばしば互いに同意しません。 ChatGPTの検索スタックのリバースエンジニアリング研究によると、GPT 5.2、5.3、5.4は知識のカットオフとファミリー名を共有していますが、異なるファンアウトクエリを生成し、異なるソースを取得し、同じプロンプトから異なるページを引用します。ChatGPTの週刊ユーザーの90%以上は無料ティアにあり、そこではデフォルトのエクスペリエンスは、ツールがサンプルする傾向のある有料ティアよりも検索回数が少なく、引用数も少なくなります。 したがって、トラッカーは、実際の顧客がほとんど、あるいは全くいない集団の平均化された訪問のレポートを提出するミステリーショッパーです。さらに悪いことに、ショールームはしばしば夜間に予告なく完全に改装されます。 今年の5月7日、OpenAIは回答内にクリック可能なブランドリンクのレンダリングを開始し、参照トラフィックは週あたり157.7%増加し、ブランドホームページへの訪問シェアは約30%から60%に上昇して維持されました。3月4日、デフォルトモデルはGPT 5.3に切り替わり、回答あたりの平均引用ドメイン数は19から15に減少しました。 この絶えず変化する状況を最適化し測定しようとすることは、愚かな試みのようです。GoogleのFlorida、Panda、Penguinアルゴリズムアップデートを経験した私たちなら、地面が足元から動くことがあることを理解しています。しかし、それが結果的かつ継続的に動くとき、それはすぐに管理不能になります。分母の発明