HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Launch HN: EdotEnv (YC S26) – 量的取引RL環境でLLMにリサーチを教える

Launch HN: EdotEnv (YC S26) – Quant Trading RL Envs to Teach LLMs Research (edotenv.com)

28 pointsby Mzzzzz20 コメント

要約

EdotEnvは、量的な取引ワークフローから自己改善型の強化学習(RL)環境を構築するプラットフォームです。進化し続ける市場の性質を利用し、LLMが継続的な学習や長期的な計画といった、より汎用的なリサーチスキルを習得できるように設計されています。この環境は、実際のデータ、ノイズ、トレードオフを含み、LLMの評価に役立つと期待されています。

全文翻訳

私たちはRuiとMichaelで、EdotEnv(https://edotenv.com)を構築しています。これは、量的な取引ワークフローから自己改善型のRL環境を作り出すものです。 多くのベンチマークが飽和し、モデル比較において無意味になっている現状があります。有用なベンチマークは、モデルが進歩するにつれて難易度が増す必要があります。以前、量的なトレーダーとして働いていた頃、私たちは市場がまさにこの性質を持っていることに気づきました。人々が取引の非効率性から利益を得るにつれて市場はより効率的になり、新しい収益性の高い戦略を見つけるのが難しくなり、古い戦略は時間とともに陳腐化していきました。 これは、市場をLLMトレーニングのための理想的で継続的に進化するベンチマークにします。難しいのは、プロの量的なワークフローを信頼性の高いトレーニング環境にすることです。なぜなら、これは非常にニッチな専門知識だからです。 私たちの環境では、LLMに量的な取引ワークフローを与え、アウトオブサンプルデータでのパフォーマンスを評価します。具体的には、予測特徴量/モデルの構築、ポートフォリオの設計、戦略のバックテスト、市場のレジームへの継続的な適応などです。各ステップは、異なる自己構築ツールを持つタスクです。例えば、予測特徴量構築タスクでは、エージェントに期間[0,T]のクリーンな市場データを与えてアイデアをリサーチさせ、作成された特徴量を時刻tで[0, t]でテストするためのバックテストツール、新しい特徴量を使用して[t+1, T]で戦略を取引するための実行ツール、そして最終評価を提供します。私たちの報酬は、エージェントの特徴量構築スキルを分離しつつ、市場の特性から利益を得るように設計されています。 私たちの環境で最先端のモデルを実行した結果、i)モデルはリサーチアイデアの深い反復に苦労する傾向があり、広範で浅い検索を好むこと、ii)高度な推論はパフォーマンスを向上させないように見えること、iii)エージェントは取引を理解していないこと、例えば、お金を失っているときに、より賢く取引するのではなく、取引を停止してしまうこと、などが明らかになりました。詳細については、私たちのブログをご覧ください!(https://edotenv.com/?tab=blog) 量的なワークフローは、本質的に応用機械学習リサーチ、長期計画、継続学習です。私たちの環境を通じて、タスク固有の回答ではなく、これらの転移可能なリサーチスキルを教えます。私たちの環境は、現実的なリサーチワークフローに近いです。合成データではなく実際のデータを使用し、環境には自然にノイズと現実的なトレードオフが含まれています。追加のLLMジャッジや人間の専門家を必要とせず、報酬は検証可能で即時的です。 サンプルタスクリポジトリをオープンソース化しました: https://github.com/MMcollab-dotcom/feature-engineering。私たちは、MLモデリング能力、継続学習、長期計画、または量的なリサーチ全般に興味があり、独自のAIエージェントをトレーニングしているAIラボ/研究者/企業に、継続的に改善される環境を販売する予定です。 私たちの環境で独自のエージェントを評価またはトレーニング後に試した方からのフィードバックを歓迎します。もちろん、LLMとの取引の未来について議論することもいつでも歓迎です(そして、LLMに明日の株を教えてもらうようなものではありません)。コメントをお待ちしています!