HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

すべてのAI可視性ツールはあなたを騙している

Every AI Visibility Tool Is Lying to You (canonry.ai)

13 pointsby arberx1 コメント

要約

AIチャットボットにおけるブランドの可視性を測定すると謳うツールは、しばしば不正確な数値を提供します。AIの応答は本質的にノイズが多く、パーソナライズされ、地理的要因や非決定性、頻繁な変化の影響を受けるため、提供される順位や可視率といった指標は信頼性に欠けることが多いです。これらのツールは、ウェブスクレイピングやAPI呼び出しを通じてデータを収集しますが、どちらの方法も実際のユーザー体験を正確に反映するには限界があり、その測定方法の不透明さが問題視されています。

全文翻訳

私は経験豊富なソフトウェアエンジニアであり、測定システムを構築・デバッグするのに十分な時間を費やしてきたため、ダッシュボードがサポートできない数値を信頼するように求めていることがいつかを判断できます。新しいソフトウェアカテゴリが現在、ブランドがChatGPT、Claude、Gemini、Perplexity、GoogleのAI回答の中でどれだけ可視的であるかをブランドに伝えることを約束しています。そして、その複雑なシステムを、言及率、引用率、シェアオブボイス、またはランクといった整然とした主張に変えます。ツールが、あなたのカテゴリで4位である、今週2つ順位を上げた、あるいは可視率が17%であるのに対し競合他社は31%であると述べるとき、私はそのシグナルが無価値だとは思いません。私はその精度がでっち上げられたものだと考えます。これらのシステムはノイズが多く、パーソナライズされ、地理的であり、非決定性であり、絶えず変化しているため、エンジニアが実際に検査したいであろうもの、つまり分布、方法論、分散、そして生の証拠を隠してしまうクリーンなリーダーボードの数字です。ほとんどのベンダーは重要なものを測定しようとしていますが、そのメカニズムはダッシュボードが認めるよりも弱いことがほとんどです。ツールがChatGPTやClaudeで「顧客が見るもの」を示すと主張する場合、それはおそらくコンシューマーアプリをスクレイピングしているか、APIを呼び出しています。スクレイピングは1つの合成セッションをキャプチャし、API呼び出しは顧客が使用するサーフェスとは異なるサーフェスを使用します。どちらも有用な方向性シグナルを生み出す可能性がありますが、特に商業的なプロンプトでの不可視性や地理的なギャップを明らかにする場合、その作業を示さずに正確で安定した真実として販売されるべきではありません。フロントエンドのスクレイピング問題ChatGPTやClaudeのフロントエンドをスクレイピングすることは、最初は説得力があるように聞こえます。ベンダーは、アプリを開き、質問をし、製品が返したものを記録したと、真実を語ることができます。これは実際のユーザーが見るサーフェスに近いものです。それでも、それは1つの制御されたサーフェスを測定します。スクレイプは1つのアカウント、または制御されたアカウントプールから来ます。それは、1つの履歴状態、1つのメモリ状態、1つのサブスクリショントランシェ、1つの地理、1つのブラウザセッション、そして1つのプロンプトを意味します。それらのいずれかを変えると、答えが変わる可能性があります。「シードステージのスタートアップに最適なCRMは?」と尋ねる実際のバイヤーと、データセンターIPから「最高のCRMソフトウェア」を尋ねるクリーンなブラウザは、異なる楽器です。大量のスクレイピングはさらにバイアスを加えます。意味のあるボリュームであっても、作業はどこかから実行する必要があります。クラウドマシン、プロキシルート、マネージドブラウザ、ヘッドレスセッション、またはその他の自動化レイヤーです。その自動化レイヤーが測定に影響を与える可能性があります。集中したIPパターン。繰り返しのログイン。奇妙なセッションのリズム。レートリミットの圧力。AI製品自体からの可能性のある不正使用対策。オペレーターは選択する必要があります。クリーンなアカウントは繰り返し可能であり、顧客とは異なります。古いアカウントには履歴と弱いコントロールがあります。数千のカテゴリプロンプトを尋ねるベンチマークアカウントも、独自のパーソナライゼーションの軌跡を作成します。しばらくすると、アカウントの人生全体がベンチマークトラフィックになります。これは、ローカルおよび商業的なプロンプトで最も重要です。「私の近くの最高の商業屋根会社」は場所によって変わります。「ニューヨークの最高のAEOエージェンシー」は場所によって変わります。答えは、ユーザーの場所、検索システム、アカウント、そしてその瞬間にプルされたソースに依存します。単一のフロントエンドの回答は、1つの実験室サンプルです。同じプロンプトが実行ごとに変わるAI可視性ランクの最も簡単な防御策は次のとおりです。毎週同じ質問をし、あなたがそこに表示されるかどうかを数えます。これは、同じ質問に安定した答えがある場合にのみ機能します。同じ言葉がしばしば異なる答えを生み出します。温度ゼロのLLM呼び出しでさえ、本番環境では完全に安定しているわけではありません。Thinking Machines Labは、技術的な理由の1つを説明しました。バッチ処理とカーネルの動作は、実際のプロダクションロード下で変化する可能性があります。彼らの例では、同じ温度ゼロのリクエストが複数のユニークな完了を生成しました。SparkToroとGumshoeは、マーケティング版の同じ問題を目の当たりにしました。彼らはボランティアに、ChatGPT、Claude、GoogleのAI製品で繰り返しの商業プロンプトを実行させました。彼らの調査では、ブランドの推奨事項が繰り返しの実行で大きく変化することがわかりました。これが中心的な測定問題です。同じシステムからの次のドローが異なるブランドのセットを名前付けできる場合、「あなたは4位です」は分布からの1つのサンプルになります。正直なダッシュボードは分布を示すべきです。コンシューマーアプリとAPIは異なる動作をします一部のツールはブラウザのスクレイピングをスキップし、代わりにプロバイダーAPIを呼び出します。運用上のケースは強力です。API呼び出しは繰り返しやすく、監査しやすく、大規模で実行するのに安価で、Webアプリが変更されたときに壊れにくいです。トレードオフ:APIとコンシューマーアプリは異なる動作をします。コンシューマー製品には、メモリ、アカウントのパーソナライゼーション、モデルルーティング、Web検索、場所の推論、ショッピングモジュール、ローカルモジュール、引用、および製品固有のプレゼンテーションが含まれる場合があります。APIは、有効にしたツールとパラメータを持つプログラム可能なモデル呼び出しを提供します。たとえば、OpenAIのAPIドキュメントでは、グラウンディングされた検索が必要な場合にWeb検索などのツールを追加する必要があります。GoogleのGemini APIには、独自のグラウンディングと検索構成があります。ギャップは両方向に作用します。生のAPI呼び出しは、アプリがどのように検索するかを過小評価する可能性があります。ブラウザのスクレイピングは、1つのパーソナライズされたセッションをキャプチャし、それを代表的なものと見なすため、実際のユーザーが見るものを過大評価する可能性があります。APIは、制御された測定に適したサーフェスになる可能性があります。そのように販売してください。「消費者のアプリがバイヤーに見せたもの」と呼ぶのは避けてください。プロンプトセットがスコアを製造しますAI可視性ツールはプロンプトセットを監視します。それらは実際のバイヤーの質問の完全なロングテールをカバーするのではなく、市場をサンプリングします。プロンプトセットは決定的です。「ニューヨークの最高のAEOエージェンシー」、「AI検索最適化コンサルタント」、「アンサーエンジン最適化監査」を追跡する場合、Canonryの1つの画像が得られます。「SEOエージェンシー」、「デジタルマーケティング会社」、「AIマーケティングソフトウェア」を追跡する場合、別の画像が得られます。どちらのプロンプトセットも有効である可能性があります。それらは異なる質問に答えます。ヘッドラインの数字は、選択されたプロンプト、それらの重み、実行頻度、および競合他社のセットに依存します。Profound自身のプロンプトデザインガイドによると、ユーザーは通常100から1,000のプロンプトを追跡しており、数百が一般的です。ダッシュボードは市場をサンプリングしています。スコアリング式も同様に重要です。1つのダッシュボードは言及頻度をスコアリングできます。別のものは引用位置に重み付けできます。別のものはソースリンクをカウントできます。別のものは感情をブレンドできます。Digital AppliedのAIシェアオブボイスフレームワークは、明確な例を示しています。同じブランド、同じデータで、言及ベースのシェアオブボイスが20%、位置ベースのシェアオブボイスが16.8%、引用ベースのシェアオブボイスが31.4%になります。同じ証拠。3つのヘッドライン数字。3つの競争力のある順位。実務家が懐疑的になるのには十分な理由があります。同じDigital Appliedの記事で、SALT.agencyのDan Taylorは、ベンダーが人工的な環境内で小さく静的なプロンプトセットを測定していると批判しています。Digidayは、バイヤー側の同じ運用上の問題を報告しました。/promptのCEOであるPaul Dyer氏は、3つのツールに同じプロンプトを与えると、3つの異なる答えが得られると述べています。プロンプトリスト、プロンプトあたりの実行回数、地理、モデル、アカウントの状態、およびスコアリング式なしでは、ダッシュボードは構築されたメトリックを示しています。構築されたメトリックは有用である可能性があります。それらにはラベルが必要です。場所がリーダーボードを壊しますほとんどのダッシュボードが無視する部分が地理です。ローカル、リージョナル、サービスエリアのビジネスにとって、場所は質問を変えます。ブルックリン、オースティン、ロンドン、またはミシガン州の田舎のユーザーは、回答エンジンがローカルの意図を推測するため、同じ言葉で異なる推奨事項を得る可能性があります。単一のグローバルな可視性ランクはしばしば無意味です。「ChatGPTで可視的」とはどこで?どのユーザーの場所から?どのローカル検索コンテキストで?どの都市またはサービスエリアのフレーズで?フロントエンドのスクレイピングはこれを特に厄介にします。クラウドサーバーからの合成ブラウザ実行は、あなたが気にかけている市場のバイヤーとは似ていません。プロキシを試すことができます。アカウントプールを試すことができます。ブラウザ自動化を試すことができます。今あなたの「真実」は、フロントエンドがスクレイパーが伝えた場所のストーリーを受け入れたかどうかによって異なります。APIベースの測定