AI・機械学習
Dream-RSI: 進化する世界を通じた再帰的自己改善
Dream-RSI: Recursive Self-Improvement through Evolving Worlds (arxiv.org)
要約
本論文では、自律AIエージェントの進歩に不可欠な「再帰的自己改善」を実現するためのフレームワーク「Dream-RSI」を提案しています。このフレームワークは、探索戦略の改善を効率化し、大規模な探索空間における高価値な解の発見を促進します。Dream-RSIは、過去の発見履歴をリプレイシミュレーターとして利用し、低コストでオフポリシーフィードバックを得ることで、探索ポリシーを継続的に洗練させます。
全文翻訳
再帰的自己改善は、自律AIエージェントにとってますます重要になってきており、その進歩は複雑なドメイン全体で高価値な解を発見することにかかっています。
このプロセスの原動力は効果的な探索ですが、探索戦略の管理と改善は依然として大きなボトルネックとなっています。
現在のシステムは根本的なジレンマに直面しています。固定された戦略は、探索空間が拡大するにつれて適応できなくなり、オンラインポリシー最適化は、長期間のロールアウトにおける遅延した高コストなフィードバックをナビゲートするために、広大なメタ探索空間を必要とします。
私たちは、スケーラブルで再帰的に自己改善する探索のためのフレームワークである「Dream-RSI」を導入します。
軽量なオーケストレーションレイヤーにより、探索は明示的かつプログラム可能になり、基盤となるコーディングエージェントは変更されません。
私たちの主な洞察は、蓄積された発見履歴が、実現された探索空間全体のリプレイシミュレーターとして機能できるということです。
歴史的な発見ツリーから構築されたリプレイシミュレーター内でドリーミングを実行することにより、「Dream-RSI」は、繰り返しコストのかかるオンライン評価を呼び出すことなく、探索ポリシーを評価および洗練するための即時的で低コストなオフポリシーフィードバックを確保します。
改善されたポリシーは、その後オンラインで再展開され、さらなる発見を促進し、自己改善ループ内でシミュレータープールを継続的に拡大します。
アルゴリズムエンジニアリング、数理最適化、GPUカーネルエンジニアリング全体で、「Dream-RSI」は、いくつかの設定で発見コストを大幅に削減しながら、競争力のある、または改善された発見品質を達成します。