AI・機械学習
Show HN: ParqDB – Parquet over HTTP によるブラウザ内でのベクトル検索
Show HN: ParqDB – Vector search in the browser from Parquet over HTTP" (search.parqdb.io)
要約
ParqDBは、HTTP経由で保存されたParquetファイルを利用し、ブラウザ内で直接ベクトル検索を実行するシステムです。クエリサーバーを必要とせず、ブラウザとWebAssembly(WASM)のみで動作するため、ユーザーデータは外部に送信されません。これにより、Wikipediaのような大規模データセットに対しても、ローカル環境で高速かつプライベートな検索が可能になります。
全文翻訳
サーバーなしのWiki検索。オブジェクトストレージとあなたのブラウザだけ。
検索
ランダムクエリ
クエリID
アイドル0%
結果を表示
↓
質問を入力して10万件のWikipedia記事を検索します。
ParqDBは、MiniLM埋め込みの上にIVF-LVQ8インデックスを構築し、それを不変のParquetファイルとしてオブジェクトストレージに公開します。あなたのブラウザはクエリを埋め込み、必要なバイト範囲のみを読み取り、WASMで結果をランク付けします。クエリサーバーはあなたのデータを見ることはありません。
レガシーブラウザ ──クエリ──> ベクトルDB ──読み取り──> オブジェクトストレージ
ベクトルDB ×
ParqDBブラウザ + WASM ──HTTPレンジ──> オブジェクトストレージ
ダイレクト
02 / クエリプロファイラー
実行待ち
リクエスト0
メモリ範囲ヒット0
転送済み0 B
選択済みCID—
候補—
クエリ時間—
埋め込み
テキスト → 384次元 ONNX/WASM
発見
manifest.json
ルート
グローバル
LVQ8セントロイド
トップNプローブ
プルーニング
フッター →
選択済み行グループ
ランク付け
LVQ8距離 + バウンデッドトップK
ルックアップ
doc_id →
Wikipedia行
03 / HTTPトレース
0 メモリヒット · 順序付けられたキャッシュ + ネットワークイベント
$ レンジリクエスト待ち
_ 04 / Wikipediaの結果 · doc_idによるレンジルックアップ
$ マテリアライズされた行はありません