HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Needle: 検索エンジンが記憶できないベンチマーク

Needle: The benchmark your search engine can't memorize (keenable.ai)

26 pointsby matt47111 コメント

要約

AIエージェントがウェブコンテンツの主要な消費者となる中、検索エンジンの性能評価が課題となっています。従来のベンチマークは静的で過学習しやすいため、Keenableはリアルタイムでオープンソースのベンチマーク「NEEDLE」を発表しました。これは、AIエージェントの検索意図を反映したクエリを使用し、検索エンジンの真の品質を継続的に測定します。

全文翻訳

Needle: 検索エンジンが記憶できないベンチマーク Keenable、AccelとConvictionから2600万ドルを調達。Techcrunch Keenable、2600万ドルを調達。Techcrunch 製品価格についてブログドキュメントコンソールコンソール製品価格についてブログドキュメントコンソール 2026年8月27日 2026年8月27日 Ilya Gusev、Matthias Petri、Andrey Styskin Ilya Gusev、Matthias Petri、Andrey Styskin NEEDLE: 検索エンジンが記憶できないベンチマーク NEEDLE: 検索エンジンが記憶できないベンチマーク NEEDLE: 検索エンジンが記憶できないベンチマーク 機械がウェブコンテンツの大多数の消費者になりつつあります。AIエージェントはすぐに検索の最大の消費者になるでしょう。エージェントは検索を必要とします。なぜなら、実際のタスクを完了するために必要な情報は、モデルの重みやコンテキストに存在するよりも、しばしば新しすぎる(「昨日のドジャース戦の勝者は?」)か、ニッチすぎる(「2007年と2008年のSilveradoとSierraプラットフォームの両方に同じGMセンサーを使用できますか?」)からです。しかし、検索はエージェントのために構築されていません。Keenableを含むすべてのエンジンは、エージェントトラフィックで達成可能なものには及びません。過学習とデータ漏洩により、BrowseCompのような標準的な検索ベンチマークが信頼できなくなるため、そのギャップを測定するのは困難です。 この問題を解決するために、検索エンジンの品質のためのライブ、オープンソースのベンチマークであるNEEDLEを導入します。NEEDLEのクエリは、実際のAIエージェントの検索ログから一部引き出され、一部は本番環境で観察される検索意図を反映するように生成されます。これは継続的に公開で実行され、誰でも再現できます。すべてのクエリとメトリクスはライブベンチマークページにあり、完全な評価コードはGitHubリポジトリにあります。貢献を歓迎します。 機械がウェブコンテンツの大多数の消費者になりつつあります。AIエージェントはすぐに検索の最大の消費者になるでしょう。エージェントは検索を必要とします。なぜなら、実際のタスクを完了するために必要な情報は、モデルの重みやコンテキストに存在するよりも、しばしば新しすぎる(「昨日のドジャース戦の勝者は?」)か、ニッチすぎる(「2007年と2008年のSilveradoとSierraプラットフォームの両方に同じGMセンサーを使用できますか?」)からです。しかし、検索はエージェントのために構築されていません。Keenableを含むすべてのエンジンは、エージェントトラフィックで達成可能なものには及びません。過学習とデータ漏洩により、BrowseCompのような標準的な検索ベンチマークが信頼できなくなるため、そのギャップを測定するのは困難です。 この問題を解決するために、検索エンジンの品質のためのライブ、オープンソースのベンチマークであるNEEDLEを導入します。NEEDLEのクエリは、実際のAIエージェントの検索ログから一部引き出され、一部は本番環境で観察される検索意図を反映するように生成されます。これは継続的に公開で実行され、誰でも再現できます。すべてのクエリとメトリクスはライブベンチマークページにあり、完全な評価コードはGitHubリポジトリにあります。貢献を歓迎します。 既存のベンチマークでは検索エンジンを比較できない ほとんどの既存のベンチマークは静的です。時間とともに固定された質問のセットです。静的なベンチマークは、容易な過学習を可能にします。 システムは、間接的であってもテストデータで過学習する可能性があります。Qwen3-Max-InstructはEpoch AIのSimpleQA Verifiedリーダーボードでトップになりましたが、Epoch自体が汚染されている可能性が高いと警告しています。MMLUの回答オプションをシャッフルすると、テストされたすべてのモデルの精度が低下します。そして、検索エージェントはHLEの質問の約3%に対して、グラウンドトゥルースラベル付きのベンチマークをHuggingFaceから直接プルします。 この最後の失敗モードは注目に値します。なぜなら、エージェント評価ではそれは非常に簡単になるからです。ウェブ検索とフェッチツールはHuggingFaceデータセットにアクセスできます。フェッチツールはデータセットファイルをダウンロードして読み取ることもできるため、ベンチマークでテストされているモデルは、評価中に同じベンチマークを見つけて解答キーを読むことができます。フロンティアモデルがこれを行う多くのケースを見てきました。カスタムPythonまたはBashコマンドを許可すると、さらに簡単になります。1回のwgetと1回のgrepで、「検索タスク」は完了です。 エージェントはHuggingfaceから回答をダウンロードできます。 テスト時間での漏洩がない場合でも、記憶は測定を歪めます。モデルが単に答えを知っている場合があります。たとえば、BrowseCompでは、質問は答えを見つけるのが難しいが検証するのは簡単であるように構築されていますが、すでに答えを記憶しているモデルは「見つけるのが難しい」部分を完全にスキップします。すぐに何を検索すべきかを知っており、最終的な答えを直接クエリします。 エージェントは、難解な答えを記憶し、軌道をそれに曲げることができます。 ライブベンチマークは過学習に対する耐性がはるかに高いです。質問がモデルよりも新しく、常に変化している場合、記憶することも漏洩することもありませ。 これは他のドメインではすでに標準的なプラクティスです。LiveBenchは毎月質問を更新し、LiveCodeBenchはモデルのトレーニングカットオフよりも新しい問題でのみスコアリングし、SWE-bench-Liveは新しいGitHubの問題からタスクを再構築します。検索も同様のデザインに値しますが、ウェブ検索のためのライブベンチマークは存在しません。 NEEDLE: エージェント型ウェブ検索のためのライブベンチマーク これらの問題に対処するために、検索エンジンのパフォーマンスを測定するためのライブベンチマークであるNEEDLE(News, Everyday, Expert, Deep-tail, and Legal Evaluation)を構築しました。このベンチマークは公開ソースに基づいており、典型的なエージェント型検索の意図を反映したクエリタイプをカバーしています。 ニュース: 現在人々が尋ねている速報や開発中のストーリー。キュレーションされたRSSフィードとGoogleトレンドから毎時生成されます。 金融: 日常的な企業およびSEC提出書類の検索。Wikidata、GLEIF、SEC XBRLから引き出された既知の回答があります。 学術: 専門的な文献検索。タイトルが劣化している、全文の詳細、または記憶があいまいな説明から特定の論文を見つけるタスクです(Exaの出版物検索評価に触発されています)。 エージェント型レア: 難解なロングテールエンティティ。DeepResearchGym、LRAT、およびOpenResearcherのエージェント型検索ログからサンプリングされたレアワードクエリ。 法律: 特定の裁判所の意見または連邦規則集のセクションを見つけます。 クエリは新しいデータに基づいて構築されています。RSSフィード、Googleトレンド、金融および科学APIです。公開エージェント型ログから直接サンプリングされたレアワードを含むクエリストリームもあります。すべてのタスクは、新しいクエリのスライスで毎日または毎時間再実行されます。 このベンチマークを使用して、Keenableを主要な検索エンジンと比較します。Google(Serper経由)、Bing(SearchAPI経由)、およびBraveです。AI検索スタートアップもあります。Tavily、Parallel、Exaです。 スコアをコンテキストに入れるために、NEEDLEは究極の上限も報告します。これは、比較されたすべてのエンジンが見つけた最高の検索結果を保持する合成エンジンであり、それらすべてをスコアリングするのと同じジャッジによってランク付けされます。これは実際のエンジンではありませんが、すべてのエンジンの上に完璧なリランカーがどのようなスコアになるかを示しています。 NEEDLEからの異なるタスク結果。 垂直方向はクエリの複雑さが異なります。論文のタイトルや企業に関する事実を含むクエリは、ほとんど解決されています。全文の詳細に基づいたキーワードクエリは、ドキュメント本文をインデックスするエンジンと、メタデータのみをインデックスするエンジンを分離します。自然言語や記憶があいまいな説明では、レキシカルエンジンはほとんど機能しなくなります。最も難しいセットは、実際のAIエージェントのログから引き出されたレアエンティティクエリです。そこでは、最高のエンジンでさえ、フィールド全体で見つかるものの多くを見逃しています。これは、クエリクラスが実際のAIエージェントのトラフィックに最も近いものでもあります。クエリセットがAIエージェントが実際に検索する方法に近づくほど、提供される品質と達成可能な品質の間のギャップは大きくなります。 GitHubリポジトリでコードとすべてのクエリ収集およびジャッジング手順を読むことができます。 検索エンジンが学習し、改善する方法を測定する NEEDLEの優れた点は、検索エンジンの品質が時間とともにどのように変化するかを追跡できることです。これは、単一のスナップショットよりも重要です。エージェント型検索にとって、興味深い質問は、今日誰が最高かではなく、誰が最も速く改善しているかです。 検索エンジンは、エンジニアリングのプッシュではなく、アーキテクチャの特性として品質改善が行われる方法で使用されることから改善されるべきです。それは学習マシンであり、AIエージェントに適応できる唯一のシステムです。 科学的ベンチマークの改善。 Keenableを学習マシンとして構築しました。6ヶ月前に最初のインデックスを立ち上げました。4ヶ月前にニュースカバレッジをリリースしました。3ヶ月前にクエリ構文をリリースしました。2ヶ月前に適切なスニペットをリリースしました。現在、Googleのような30年のリードを持つエンジンと同じチャートに載っており、私たちのインデックスは学習を続けています。 独立した検索エンジンのみが、