AI・機械学習
Show HN: Morph Reflexes – エージェントトレースのためのマルチヘッド分類器
Show HN: Morph Reflexes – Multi-head classifiers for agent traces
要約
Morph Reflexesは、GPTやSonnetのようなフロンティアモデルを使用するよりも高速かつ低コストで、エージェントの動作上の失敗(ループ、推論リーク、ユーザーの不満など)を検出するためのセマンティック信号を提供するAPIです。これは、マルチヘッド推論を中心に設計された小型のLLMを基盤とし、カスタムカーネルとvLLMからフォークされた推論エンジンを使用することで、高い効率と低オーバーヘッドを実現しています。プロダクション環境でエージェントを運用している開発者からのフィードバックを求めています。
全文翻訳
プロダクションエージェントの最も一般的な失敗は、行動に関するものです。ループ、推論のリーク、ユーザーの不満などです。GPTやSonnetのようなフロンティアモデルを使ってすべてのターンを評価するのは、大規模に実行するには費用がかかりすぎ、遅すぎます。
これを解決するために、私たちはReflexesを構築しました。エージェントのトレースからセマンティック信号を、API経由で高速かつ安価に提供します。カスタムカーネルと、vLLMからフォークしたカスタム推論エンジンに基づいて構築されています。
内部的には、マルチヘッド推論を中心に設計された小さなLLMです。小さなモデルは特定のタスク用に訓練される必要がありますが、50個の異なる小さなモデルを同じ入力に対して50個のタスクで実行するのは意味がありません。
仕組み:
ハイブリッドアテンションを持つ最新のLLMを使用し、デコードステップを削除します。プリフィル計算をリフレックス間で99%再利用できるようにする推論エンジンを構築しました。これは、2019年頃の古いBERT/HYDRAや古いマルチヘッド技術の精神に似ています。この推論エンジンは、入力全体でKV/キャッシュを再利用し、すべてのリフレックスで計算を再利用するように構築しました。1つの共有バックボーンがトレースを一度読み取り、その後、多くのヘッドが異なる信号を分類します。私たちの推論エンジンは、すべてのリフレックスで同じKV/キャッシュと計算を再利用し、追加のリフレックスごとに0.1%未満のオーバーヘッドで30ms未満の推論を提供します。
私たちは同じ高レベルのアイデアを取り入れ、最新のアーキテクチャとアテンションで機能させるための大変な作業を行いました。これにより、30ms未満で推論を実行し、90ms未満で完全なリクエストを処理できます。4つのリフレックスを実行しても100個実行しても、追加のオーバーヘッドは2ms未満です。
なぜこの最適化が重要なのでしょうか?
中規模のスタートアップであっても、数万のエージェント実行と数百万のターンを処理しています。ユーザーの不満率などの指標を時間経過とともに追跡したい場合、LLM-as-judgeのフロンティアモデルではスケールしません。
私はTeslaで同様のスタックを構築しました。MLエンジニアが`is_camera_obfuscated=true`のような信号や、他の200ものことのためにペタバイト規模のデータをサンプリングする必要がある場合、1) 迅速に立ち上げ、2) 効率的に大規模に実行する必要がありました。
何ではないか:
ダッシュボード。ダッシュボードの99%は使用されません。
100%APIファーストであり、これを自分のトリガーとして使用したい開発者向けに作られています。
ダッシュボードでカスタムリフレックスをvibetrainし、そして/またはプロダクションで自己改善させます: https://www.morphllm.com/dashboard/reflex
ドキュメント: https://docs.morphllm.com/sdk/components/reflexes/index
プロダクションでエージェントを実行している方々からのフィードバックを eagerly 募集しています。現在、すべてのターンで追跡したいができないのは、どのような種類のことですか?
TLDR: エージェントトレースからのセマンティック信号、超高速、API経由で安価