HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Muse CodeとMuse Spark 1.2の紹介

Muse Code and Muse Spark 1.2 (research.meta.ai)

312 pointsby paulkrush237 コメント

要約

Meta AIは、最新モデルMuse Spark 1.2を搭載したターミナルコーディングエージェント「Muse Code」(ベータ版)を発表しました。Muse Codeは、大規模リポジトリ全体にわたる複雑なソフトウェアエンジニアリングタスク(計画、コード記述、結果検証)に対応し、複数の永続的なサブエージェントを協調させて、より速く、より正確に、より少ない介入で困難な問題を解決します。Muse Spark 1.2は、コード生成、デバッグ、コードベース理解の能力が向上しており、Muse Codeと共同でトレーニングされたことで、最高のパフォーマンスとコーディングの使いやすさを実現しています。

全文翻訳

Muse Code(ベータ版)と、当社の最新モデルであるMuse Spark 1.2を発表できることを嬉しく思います。これは、より大規模で遥かに高性能なモデルが開発中であるという、フロンティアへの次なる一歩を示しています。 macOSまたはLinuxにMuse Codeをインストールしてください: curl -fsSL https://dev.meta.ai/install.sh | bash インストールコマンドをコピー Muse Codeは、大規模リポジトリ全体にわたる複雑なソフトウェアエンジニアリングタスク、すなわち変更の計画、コードの記述、結果の検証に取り組みます。タスクごとに複数の永続的なサブエージェントを協調させることができ、より速く、より正確に、より少ない介入で困難な問題を解決します。 Muse Code 非同期バックグラウンドエージェント Muse Codeは、シンプルなエージェントループと、メインエージェントの能力を強化する非同期バックグラウンドエージェントのセットで動作します。これらの専門化されたバックグラウンドエージェントは、個々のタスクのために生成されるのではなく、各セッション中にアクティブなままとなり、冗長な情報収集を回避するのに役立ちます。それらは次のステップを実行し、メインエージェントにいつ通信を返すかを選択します。それらの永続性により、レイテンシが削減され、困難な複数ステップのタスクでの指示の必要性が軽減されます。 Photon Sphere Embervault Avo Lawn ローディングデモ ランタイムデザイン Muse Codeは、すべてのモデル呼び出し、ツール実行、承認、編集が追加されるローカルイベントログを使用します。この単一の真実の源により、ランタイムは正確に再生可能で、再起動しても安全です。クラッシュ後、エージェントは停止した箇所から正確に再開できます。この機能により、Muse Codeは失敗によって脱線することなく、長時間実行されるタスクに取り組むことができます。 バンドルされたスキル Muse Codeにはいくつかのデフォルトスキルが付属しています。「/plan」はタスクを承認によってゲートされた計画に変換し、「/grill」はその計画が耐えられるまでテストし、「/goal」は指定された目標の成功した完了に向けて作業します。 ユーザーは、家のフライスルービデオをmp4ファイルとしてターミナルに入力します。Muse Codeはビデオを解釈し、視覚的にリッチなバケーションホームのマーケティングおよび予約ページを生成します。 Muse Spark 1.2 Muse Spark 1.2は、コード生成、複雑なデバッグ、コードベースの理解、エンドツーエンドの開発者ワークフローにおける改善を伴う、Muse Spark 1.1のコーディングに焦点を当てたアップデートです。Muse Spark 1.2では、コードタスクにおけるトレーニングコンピュートを大幅にスケールアップし、トレーニング環境の多様性を拡大しました。このモデルは、一般的なエージェントのような他の主要分野でもその強みを維持しています。 コーディング 一般的なエージェント 評価の詳細については、レポートを参照してください。 Muse Codeとの共同トレーニング Muse Spark 1.2はMuse Codeと共同でトレーニングされ、両者がペアになったときにモデルが最高のパフォーマンスとコーディングの使いやすさを発揮することを確認しました。トレーニングには、目標、圧縮、サブエージェントのレシピ最適化、およびMuse Codeツールセットの統合に加えて、拒否サンプリングされたハーネス軌道が含まれ、ハーネスの互換性を最大化しました。 長期間のタスク Muse Spark 1.2は、リポジトリ全体の生成、大規模なエンドツーエンドプロジェクト、自動リサーチを含む、長期間のコーディングタスクで広範囲にトレーニングされました。作業を順序付けるための計画、方向性を維持するための目標条件付け、および進捗を維持するために必要な知識を保持するためのコンテキスト圧縮を活用します。 自己改善 Muse Spark 1.1を使用して、挑戦的なコーディング環境と指示追従テンプレートを生成しました。その後、モデルは候補ソリューションがそれらの要件をどれだけ満たしているかを評価し、Muse Spark 1.2のスケーラブルなトレーニングデータセットを生成しました。この自己改善ループにより、Muse Spark 1.2は前モデルよりも複雑な指示をより正確に追従できるようになりました。 ケーススタディ:カーネル最適化 モデルが1,000以上のツール呼び出し(最大24時間)にわたってGPUカーネルを反復的に最適化する能力をテストしました。Muse Codeのエージェントコーディング環境を活用して、モデルは、提供されたベースライン実装と比較してカーネルパフォーマンスを書き込み、コンパイルし、プロファイルし、徐々に改善します。NVIDIA Hopper GPU用のKDAおよびMLAカーネルでベンチマークを行いました。エージェントは、提供されたベースライン実装に対して大幅な改善を達成し続けています。 KDA MLA ベースラインはKDAのFLA Triton実装です。モデルは、FLAのようなサードパーティのカーネルライブラリを直接インポートすることは禁止されていました。代わりに、特殊なカーネル最適化知識を適用してアルゴリズムをTritonに実装する必要があり、既存の実装をラップするのではなく、アルゴリズムを実装する必要がありました。 バッチサイズ1、ヘッド数64、シーケンス長8192、潜在次元512で、PyTorch参照実装に対してベンチマークを行います。Muse Spark 1.2は、このワークロードのために2カーネルのTritonパイプラインを設計し、カーネル融合とタイリングを、共有KV潜在をKとVの両方として再利用するMLA固有の最適化と組み合わせました。 利用可能性 Muse Spark 1.2は、Muse CodeおよびMeta Model APIで、グローバルアクセスを拡大して本日利用可能です。新しいハーネス機能やより強力なモデルなど、多くの計画があります。皆様が構築されるものを見るのが待ちきれません! Muse Codeで始めましょう