HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

100倍安価なオープンモデルで検索性能においてGPT-5.6 Solを凌駕する

Beating GPT-5.6 Sol on retrieval with 100x cheaper open models (neon.com)

409 pointsby moonikakiss114 コメント

要約

この記事では、CastformとNeonの組み合わせがいかにして、GPT-5.6 Solのような最先端モデルと比較して、検索性能で同等以上の結果を100倍安価に達成できるかを解説しています。CastformはオープンソースモデルをRL(強化学習)でポストトレーニングし、NeonのLakebase Searchは効率的なデータ検索インフラを提供します。これにより、企業は自社のデータ資産を活用して、高性能なエージェントを低コストで開発できるようになります。

全文翻訳

ブログ/製品に戻る Castform + Neon が価格と効率でフロンティアモデルを凌駕する方法 Castform でポストトレーニングされた 4B オープンソースモデルが、GPT-5.6 Sol と同等の検索精度を、100倍低コストで実現 Pranav Aurora, Ying Hang Seah, Angel Pan 2026年8月5日 チェンジログを購読する 最新のアップデートのみをお届けします。スパムは保証しません。 購読する 「ほとんどのチームの最高のトレーニングデータは、データベースの中に眠っています。問題は、生のデータを使いやすいものに変えるのが難しく、エージェントが大規模に安価にデータを読み取り、検索し、変更するには高度なインフラが必要だということです。Castform を Neon に接続すれば、その両方をスキップできます。」 Ying Hang Seah, cofounder, Castform 「良いエージェント」は2つの領域で強力である必要があります。 コンテキスト: 正しいデータを見つけるためのツールを提供できるか? モデル: モデルは検索するものを決定できるか? Neon (Lakebase Postgres) とその新しい Search 拡張機能は前者、Castform は後者を解決します。 エージェント検索の進化 約2022年、業界は埋め込み検索にすべてを賭けていました。すべてのデータベースプロバイダーが埋め込み検索を追加し、pgvector は Neon の最もダウンロードされた拡張機能でした。LLM にコンテキストを提供するために、エンジニアは RAG パイプラインを手作業で作成しました。これは本質的には、何らかの形式の埋め込み類似性検索です。 約2025年、エージェントがより注目を集め始めました。開発者はマルチホップ検索ワークフローを作成し、大きな問題を小さな問題に分解し始めました。検索は、ワンショット検索システムからエージェント検索へと移行しました。単一のクエリを発行する代わりに、モデルはループ内で複数回計画し、検索します。ループの各イテレーションは、フロンティアモデルへの別の呼び出しを意味し、ユーザーリクエストあたりの全体的なコストとレイテンシが増加します。 具体的には、gpt-5.6-sol を使用した典型的なマルチターン検索リクエストは、エンドツーエンドで 10 秒以上かかり、約 0.03 ドルのコストがかかるため、非常に遅く高価になります。一方、小さなオープンウェイトモデルは 100 倍安価です。しかし、そのままでは、その機能はクローズドAPIモデルに遅れをとります。RLポストトレーニングは、このギャップを埋めるのに役立ちます。検索などの特定のタスクでは、ポストトレーニングされたオープンソースモデルは、リクエストあたりのコストが桁違いに低いながらも、フロンティアモデルに匹敵し、それを上回ることができます。 だからこそ、私たちは Castform を構築しました。開発者が機械学習と GPU の内部を扱うことなくモデルを RL ポストトレーニングできるようにするためです。目標は、ポストトレーニングをプロンプトエンジニアリングと同じくらい身近なものにすることです。 Castform は Neon をどのように使用するか? Castform のパイプラインは、Lakebase Search を介して Neon で実行されます。 ステージ Neon + Lakebase Search コーパスストレージ 生のドキュメントは Neon の Postgres に保存されます。 合成データ生成 Castform トレーニングパイプラインは lakebase_text と lakebase_vector を使用してトレーニングタスクを書き込みます。 RL トレーニング すべてのロールアウトの検索ツールの呼び出しは、Neon の Lakebase Search を使用します。 本番推論 最終モデルは、推論中に同じ検索ツールの呼び出しを使用します。 あなたの最高のトレーニングデータはすでに存在します RL ポストトレーニングを効果的に行うには、タスク(例: ユーザーの質問に答える)、エージェントが実行する環境(例: コーパスの検索ツール)、および報酬関数(例: 回答は正しいか?)が必要です。これら 3 つの要素がすべて揃うと、RL ポストトレーニングは試行錯誤のループになります。モデルはツールを与えられてタスクを試行し、報酬関数が試行を評価し、フィードバック信号がモデルに最適なパフォーマンスにどのように到達するかをガイドします。 しかし、ほとんどの企業は、ポストトレーニングの準備ができたクリーンなタスクと報酬関数のデータセットを持っていません。エンタープライズは、大量の独自のデータを持っています。 内部ドキュメント 製品レコード サポート記事 顧客インタラクション ウィキ 運用データベース このデータにはエージェントが必要とする知識が含まれていますが、効果的なトレーニングデータセットに変換するには、通常、かなりのデータエンジニアリングと手動ラベリングが必要です。そのため、多くのチームは次の 2 つの理由のいずれかでポストトレーニングを却下します。 「トレーニングデータがありません。」 「ファインチューニングは難しすぎ、インフラが必要です。」 Castform は両方に対応します。既存のコーパスをトレーニングタスクに変換し、オープンソースモデルにそのデータを効果的に使用する方法を教えるために必要な RL ループを管理します。 Castform の使用 Castform を使用すると、会社のナレッジベースをモデルに変換できます。 ドキュメント(データから): Navan で予約されたフライトは、GitLab 出張カードで支払われます。電車での移動は、標準キャビンクラスで 14 日前までに予約する必要があります。 グラウンドトゥルース(データから推測): 電車での移動は、標準キャビンクラスで 14 日前までに予約する必要があります。 質問(合成生成): Navan で鉄道旅行を予約する場合、どれくらい前に予約する必要があり、どの座席クラスを選択する必要がありますか? 生成された質問と回答のデータセットを使用して、Castform はエージェントがアクセスできるツールと報酬関数を指定することで、トレーニング実行をスキャフォールディングできます。報酬関数は、モデルに何ができるようになってほしいかを指定します。この場合、正しいチャンクを取得し、正しい最終回答を提供する際に正しいソースを引用してほしいと考えています。 def run_tool(tool, tool_args): """単一ツール: Lakebase 上のハイブリッド検索。""" if tool == "search": query = tool_args["query"] bm25 = neon.lakebase_text(query, k) vector = neon.lakebase_vector(query, k) return rrf_merge(bm25, vector, k) def reward(trace, ground_truth): """トレースをグラウンドトゥルースの回答に対して採点する。""" answer = parse_trace(trace) retrieval = ... # 正しいソースを取得したか citation = ... # 正しいチャンクを引用したか correctness = ... # 正しい回答にたどり着いたか return retrieval + citation + correctness 包括的なコード例はこちらをご覧ください。 オブザーバビリティ: モデルが学習する様子 Castform は RL 実行の完全なオブザーバビリティを提供します。各ステップでの報酬の上昇を監視できますが、より重要なのは、個々のタスク/プロンプトにドロップインして、モデルが質的にどのようにパフォーマンスを発揮するかを観察できることです。これにより、壊れたツールや報酬ハッキングなどの問題をデバッグできます。 トレーニング実行の監視方法の詳細については、Castform ブログをご覧ください。 例としてのトレーニング実行もこちらで確認できます。 平均報酬 なぜ Neon が「うまく機能する」のか トレーニング中、エージェントは十分なコンテキストが得られるまで繰り返し Lakebase Search を呼び出します。数千の並列ロールアウトで、それぞれが数十回の呼び出しを行う可能性があるため、これは非常にバースト的なワークロードを作成します。Neon の動的なコンピューティングスケーリングは、Castform が常に最大容量をプロビジョニングする必要なしに、これらのピークを吸収します。トレーニング実行は、需要が急増した場合に低レイテンシの検索を取得し、アイドル期間中はコンピューティングがスケールダウンします。 このインフラストラクチャは、エージェントが検索を超えてデータの変更を開始するにつれて、さらに価値が高まります。ステートフルエージェントのトレーニングには、安価に作成およびリセットできる分離された環境が必要です。これにより、あるロールアウトのアクションが別のロールアウトに影響を与えたり、本番環境に触れたりするのを防ぎます。Neon のブランチングは、各ロールアウトに分離されたデータベース状態を提供できますが、タイムトラベルクエリは、エージェントが遭遇した状態を再構築および検査することを可能にします。自動スケーリングとスケールゼロと組み合わせることで、数千の継続的に実行されている環境を維持することなく、数千のステートフルエージェントロールアウトをトレーニングするためのパスが作成されます。 Castform により、どの開発者でもオープンソースモデルをポストトレーニングして、フロンティアモデルよりも安価に、高速に、そして優れたものにすることができます。 今日 castform.com で最初のモデルをポストトレーニングしてください。 共有: Neon よりさらに多くの製品 2026年8月3日 Neon にプロジェクトごとの権限が追加されました ケーススタディ 2026年7月30日 CommSync は Lakebase Search を使用して Postgres 上でテキスト、ベクトル、ハイブリッド検索を実行します 製品 2026年7月23日 私のエージェントは Neon バックエンドを使用して GitHub を(ある程度)クローンしました 製品 2026年8月3日 Neon にプロジェクトごとの権限が追加されました ケーススタディ 2026年7月30日 CommSync は Lakebase Search を使用して Postgres 上でテキスト、ベクトル、ハイブリッド検索を実行します 製品 2026年7月23日 私のエージェントは Neon バックエンドを使用して GitHub を(ある程度)クローンしました