HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Toast 1の紹介

Introducing Toast 1 (mixedbread.com)

206 pointsby mplappert62 コメント

要約

Mixedbreadは、新しい検索エージェント「Toast 1」を発表しました。これは、Claude Opus 5やGPT-5.6 Solといった最先端モデルと同等以上の検索品質を、最大10分の1のコストと12倍の速度で提供します。Toast 1は、複雑な文書コレクションから情報を検索し、クエリを分解して証拠を収集・キュレーションするエージェントとして機能します。これにより、大規模言語モデルは推論や最終的な回答生成といった、より高度なタスクに集中できるようになります。OfficeQA Pro V2やHarvey LABのベンチマークでは、Toast 1を統合したシステムが、コスト効率と回答精度において新たな状態を達成しています。

全文翻訳

すべての投稿 Toast 1の紹介 リサーチ プロダクト MB Mixedbreadチーム · 2026年8月13日 · 6分で読めます クリップボードにコピー Toast 1、当社の最初の専門検索エージェントが本日より利用可能になりました。これは、Claude Opus 5やGPT-5.6 Solを凌駕する最先端の検索品質を提供し、コストは最大10分の1、速度は最大12倍です。Mixedbread Searchとの併用で最高のパフォーマンスを発揮しますが、あらゆる検索バックエンドと連携可能です。 今日、最先端モデルは実際の知識作業を実行できるようになりました。それらは、複雑な文書コレクションにおいて推論、分析、情報検索を行うことができます。しかし、それらはスタックの中で最も高価なモデルでもあります。インテリジェンスがますますメーター制になるにつれて、コストのほんの一部でそれらの能力に匹敵する専門エージェントの必要性はかつてないほど高まっています。 Toast 1は、スタンドアロンの専門検索エージェントとして、またはあなたの最先端モデルがすでに頼ることを知っている多数のサブエージェントの1つとして実行できます。それは検索ループを完全に引き継ぎます。初期クエリが与えられると、それをサブクエリに分解し、証拠を収集し、ソースを検査し、関連するコンテキストをキュレーションしてから返します。これにより、エージェントは、推論、実行、最終的な回答の生成といった、汎用的な最先端モデルを必要とするタスクにコンテキストとコンピューティングリソースを費やすことができます。 Toast 1エージェント検索のウォーターフォールトレース:5秒強で雇用率比較クエリに回答するための3ラウンドでの16回のツール呼び出し。トレースを展開し、ステップを選択すると、エージェントがその時点で生成したサブクエリ、grepパターン、またはプランが表示されます。 「小売業の雇用率の変化は医療分野と比較してどうでしたか?」 16回のツール呼び出し · 3ラウンド · 5.33秒 · トレースを表示 Pareto Optimal Search セクションへのリンク エージェント労働のこの専門化は、検索コストを大幅に削減するだけでなく、多くの現実的なタスクでエンドツーエンドの結果を向上させます。Toast 1は、タスクあたりのコストとタスクあたりの速度の両方で、エージェントワークロード全体で新しいParetoフロンティアを確立することを発見しました。 Financial Analysis: OfficeQA Pro V2 セクションへのリンク DatabricksによってリリースされたOfficeQA Pro V2は、現実的で複雑なエンタープライズ金融状況における90の質問に対する回答の正確性を評価します。Toast 1をCodex内のサブエージェントとして利用したGPT‑5.6 Solは、タスクあたり約1.15ドルで70%の回答正解率を達成します。これは、DatabricksがOfficeQA v2リリースで評価したシステムの中で最高のスコアであり、品質と効率の両方で新たな最先端パフォーマンスを確立しています。 OfficeQA Pro V2における回答正解率対ロールアウトあたりのコストの散布図、対数スケールのコスト。 Toast 1をサブエージェントとしてCodexで実行されるGPT-5.6 Solは、タスクあたり約1.20ドルで70%の正解率を達成します。これは、Databricksの評価における以前のParetoフロンティアを上回っており、Databricks Genie上のClaude Fable 5は、約4ドルで60%を達成しています。 コスト–品質Pareto on OfficeQA Pro V2 20% 30% 40% 50% 60% 70% $0.1 $0.2 $0.5 $1 $2 $5 $10 $20 $50 回答の正確性 ロールアウトあたりのコスト(対数スケール) GPT‑5.6 Luna GPT‑5.6 Terra Claude Fable 5 GPT‑5.6 Sol Kimi K3 GLM 5.2 Haiku 4.5 Sonnet 5 Opus 5 GPT‑5.6 Luna (Codex) GPT‑5.6 Terra (Codex) GPT‑5.6 Sol (Codex) Sonnet 5 (Claude Code) Claude Fable 5 (Claude Code) GPT‑5.6 Sol Low (Codex + Toast 1) GPT‑5.6 Sol High (Codex + Toast 1) Databricks Genie モデルプロバイダーハーネス Paretoフロンティア(Databricks) Codex + Toast 1 OfficeQA Pro V2における回答の正確性とロールアウトあたりのコストの比較。GenieとHarnessの数値はDatabricksの報告によるものです。Codex + Toast 1の実行は当社によるものです。影付きの領域は、以前のParetoフロンティアの下にあります。 比較すると、以前の最高のパフォーマーであるDatabricks Genie上のClaude Fable 5は、タスクあたり約4ドルで60%の正解率を達成するのに対し、Toast 1なしのCodex内のGPT-5.6 Solはわずか33%の正解率しか達成しません。この改善は、証拠収集の経済性を再構築することから生じます。Toast 1の専門化により、高品質でトークン効率の良い証拠パッケージを生成でき、推論プロセスが最終的な回答に到達するための十分なリソースが残されます。 Legal Agentic Benchmark - Firm Knowledge セクションへのリンク Harvey LABの法律事務所知識ベンチマークは、エージェントが大規模で現実的なスケールで制度的な法律知識をどの程度検索し、使用できるかを評価することを目的としています。法律業務は、性質上、コンテキストが豊富です。より優れた、より関連性の高い先例や詳細にアクセスできる相手に勝つことはできません。しかし、それはノイズも多いです。多くの状況は似ていますが、単純な詳細によって異なります。そのため、多数の偽陽性なしに高品質の証拠パッケージを収集するのは困難です。ランダムに選択された33のタスクのサブセットで、GPT-5.6 Solの回答品質は検索方法によって一定であることを発見しました。 Harvey LABの法律事務所知識ベンチマークにおける総トークン使用量の棒グラフ。バニラエージェントは、タスクあたり21.7ターンで8060万トークンを使用します。Mixedbread Searchを追加すると、タスクあたり14.6ターンで4700万トークンに42%削減されます。Toast 1をサブエージェントとして追加すると、タスクあたり11.2ターンでさらに51%削減され、2300万トークンになります。3つの構成すべてが同一のタスクスコア55を達成するため、最終結果は3.5倍少ないトークンで同じパフォーマンスになります。 同じパフォーマンスで3.5倍少ないトークン。 HARVEY LAB FIRM-KNOWLEDGE BENCHMARK (33 TASKS) — すべての設定は検索スタックを除いて同じです トークン/ベンチマーク 80.6M スコア 55 バニラエージェント 21.7 ターン/タスク 47.0M スコア 55 + Mixedbread Search 14.6 ターン/タスク 23.0M スコア 55 + Toast 1 サブエージェント 11.2 ターン/タスク −42% トークン −51% トークン トークンは33タスクベンチマークの合計です。ターンはタスクあたりのエージェントループの繰り返し回数です。3つの構成すべてが同一のタスクスコア55を達成します。しかし、検索品質の向上はトークン効率を劇的に向上させました。バニラエージェントのファイルシステム検索をMixedbread Searchに置き換えると、タスクスコアが同じでトークン使用量が80.6Mから47Mに削減されました。その後、Toast 1を専用検索サブエージェントとして追加すると、さらに23Mに削減され、バニラエージェントが必要としたターンの半分の時間で完了できるようになりました。Mixedbread Search搭載のToast 1の導入は、回答品質を維持しながら、3.5倍少ないトークンを消費し、60%以上のコスト削減につながりました。Toast 1は、最先端モデルのコンテキストウィンドウを解放し、トークンを正しい回答に到達させるために使用できるようにします。 デモ:Dwarkeshのポッドキャストを深く掘り下げる セクションへのリンク ベンチマークと数値は物語の一部しか語れません。Toast 1がどのように機能するかを真に理解するには、検索中の様子を見るのが一番です。Mixedbreadでは、Dwarkeshのポッドキャストを非常に楽しんでおり、そのトランスクリプトを深く検索できると楽しいだろうと思いました。自分で試すことができます。こちら。 Frontier Class Retrieval セクションへのリンク 複雑なタスクに対応できるサブエージェントであると同時に、Toast 1はディープサーチ専用にトレーニングされたスタンドアロンモデルとしても有能です。それは、当社の埋め込みモデルとSiloの背後にある共同設計アプローチの次のステップを表します。モデル、エージェントハーネス、および検索プリミティブは連携するように設計されています。2 BrowseComp Plus、OfficeQA Pro、およびLongSealにおける検索品質対クエリあたりのコストとレイテンシ。 Toast 1は、各ベンチマークで最高の最先端モデルスイープに匹敵またはそれに近づきますが、クエリあたりのコストはわずかで、約8〜10秒で回答します。これは最先端スイープよりもはるかに高速です。 BrowseComp Plus OfficeQA Pro LongSeal BrowseComp Plusの品質対コスト 0.30 0.45 0.60 0.75 0.90 $0.01 $0.03 $0.1 $0.3 $1 NDCG@10 クエリあたりのコスト(対数スケール) DeepSeek Kimi K3 Qwen GLM Haiku 4.5 Sonnet 5 Opus 5 GPT‑5.6 Luna GPT‑5.6 Terra GPT‑5.6 Sol Toast 1 (RRF ×3) コスト レイテンシ リスト価格でのクエリあたりのコスト(プロンプトキャッシュあり)。レイテンシはクエリあたりのp50です。線は各モデルのPareto効率的な推論スイープを示しています。 さまざまなディープサーチベンチマークで、それは最先端モデルのパフォーマンスに達し、GPT-5.6 Solと同じリーグに位置し、Kimi K3やGLM-5.2のようなモデルを快適に上回ります。その際、軽量性を維持しています。標準的なToast 1の実行は、クエリあたり約0.016〜0.023ドルで、8秒の中央レイテンシです。当社の最高品質のフュージョン構成は、クエリあたり約0.05〜0.07ドルで、11秒の中央レイテンシです。実際には、Among the