HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Meta Muse Glimmer – オープンウェイト30Bローカルコーディングモデル

Meta Muse Glimmer – open weights 30B local coding model (research.meta.ai)

1151 pointsby riordan620 コメント

要約

Metaは、ローカルエージェントワークフローに最適化された300億パラメータのAIモデル「Muse Glimmer」を発表し、Apache 2.0ライセンスでオープンソース化しました。このモデルは、コンシューマー向けGPUで実行可能で、ローカルでのコーディングやエージェント機能に強みを発揮します。ローカル実行により、インターネット接続なしでもAIを利用できるようになり、開発者はHugging Faceからモデルをダウンロードして利用できます。

全文翻訳

本日、Meta Superintelligence Labsの次期モデルであるMuse Glimmerを発表し、モデルのウェイトを許容的なApache 2.0ライセンスの下でオープンソース化します。Muse Glimmerは、常時稼働するローカルエージェントワークフローに最適化された300億パラメータのモデルです。これは、単一のコンシューマーGPUを搭載したMacまたはPCで実行できるほど小さいため、ローカルエージェントや関数呼び出しから、ローカルコーディング、LLMをジャッジとする評価まで、幅広いユースケースを可能にします。Muse Glimmerは、そのサイズカテゴリの主要モデルと比較して、主要なエージェントユースケースとベンチマークで強力なパフォーマンスを発揮します。基盤モデルは、推論、コード生成、ツール使用において驚異的な能力を達成しましたが、ほとんどのデプロイメントは依然としてクラウドインフラストラクチャとネットワークアクセスに依存しています。モデルをローカルで実行すると、インターネット接続の有無にかかわらず、いつでもどこでもAIを使用できます。これはますます現実的になっています。オープンソースコミュニティは、小規模なモデルでも効果的にトレーニングすれば、ターゲットタスクでフロンティアレベルのパフォーマンスに近づけることを示しています。Muse Glimmerは、これらのローカルユースケースに最適化されています。Metaの基本的なAI研究を共有するという長年の伝統に沿って、本日Hugging FaceでMuse Glimmerのオープンウェイトをリリースし、開発者が独自のAIエージェントを構築・実行するのに役立つ開発者向けドキュメントも提供します。Muse Glimmerは、開発者がすでに使用しているツールと連携するように構築されています。llama.cpp、MLX、ExecuTorchでの最適化された統合が数日中にリリースされる予定ですので、ダウンロードから動作するエージェントまで数分で移行できます。 Muse Glimmerのトレーニング方法 スケジュール管理、メッセージの下書き、ファイル整理、そしてユーザーの働き方を学習するエージェントは、個人のコンテキストに深くアクセスする必要があります。また、長期間の実行、正確なツール呼び出し、マルチモーダル理解、長文コンテキストメモリ、指示追従など、複数の機能を連携させる必要があります。私たちは、Muse Glimmerを、ローカルハードウェアのメモリとコンピューティングの制約に対して能力のバランスを取るように設計しました。これには、コンパクトなアーキテクチャ、はるかに大きな教師モデルからのエージェント推論を転送する新しい蒸留レシピ、およびレイテンシの期待に応えるための量子化を含む推論最適化が必要でした。以下のフェーズでこれを達成しました。 事前トレーニング。教師モデルと同様のデータミックスを活用し、logit蒸留を使用してMuse Sparkの出力でMuse Glimmerをトレーニングしました。 中間トレーニング。より長いコンテキスト、よりエージェント中心のデータ、およびよりリッチな推論トレースを、有機的なデータとともにトレーニングしました。 事後トレーニング。一般的なドメイン、推論ドメイン、コーディングドメイン、エージェントドメイン全体で、オンポリシー蒸留と強化学習のミックスと組み合わせて教師ありファインチューニングを行いました。 Muse Glimmerは、Metaの高度AIスケーリングフレームワークに定められた基準の下で評価され、関連するすべてのカテゴリでオープンウェイトリリースが評価されました。 エージェントのために構築されたもの:Muse Glimmerができること 効果的なエージェントを構築するには、ユーザーの目標を達成するために主要な機能が連携して機能する必要があります。Muse Glimmerは、以下の各機能についてトレーニングおよび評価されています。 エンドツーエンドのエージェントタスク完了。Muse Glimmerは、DeepSearch QA、MCP-Atlas、𝛕-Bench、SWE-Benchなどのフルタスクベンチマークで高い成功率を達成しており、これらはスキャフォールド内での作業、コードの記述とデバッグ、および開始から終了までの複数ターンリクエストの解決能力を測定します。 信頼性の高いツール使用。モデルは、広範囲の関数呼び出しを処理し、拡張ワークフロー全体で正確なスキーマを持つツールを呼び出します。 複数ステップの推論。Muse Glimmerは、長期間にわたる推論を連鎖させ、複雑で拡張されたワークフロー全体で一貫した計画を維持します。 障害回復。ツール呼び出しが失敗したり、予期しない結果が返されたりした場合、モデルはエラーを診断して再試行するようにトレーニングされており、停止しません。 マルチモーダル入力と推論。専用の認識エンコーダーを通じて、モデルはテキストと画像をインターリーブして受け入れます。これにより、エージェントは会話と並行してスクリーンショット、チャート、ドキュメントを解釈できます。 スキャフォールド互換性。Muse Glimmerは、OpenClawおよびその他のエージェントオーケストレーションパターンで動作します。 制御可能な労力。Muse Glimmerは、品質と速度の適切なバランスを選択するために、さまざまな推論強度をサポートします。 多言語対応。Muse Glimmerは、100以上の言語のデータでトレーニングされています。 パフォーマンス 効果的な自律エージェントの動作に必要な多様な能力を評価するために、幅広いベンチマークでMuse Glimmerを評価しました。Gemma4-31BおよびQwen3.6-27Bと比較して、Muse Glimmerは、広く使用されているいくつかのLLMベンチマークにおいて、そのサイズクラスで強力なパフォーマンスを発揮します。評価の詳細については、レポートを参照してください。 ローカルデプロイメント向けに最適化 ローカルエージェントは、応答性が感じられるほど高速でなければ真に役立ちます。応答または次のステップの計画に数分かかるエージェントは、実際の作業の流れを中断します。品質を犠牲にすることなく、コンシューマーハードウェアで実用的な速度でMuse Glimmerを実行できるように、2つの最適化を適用しました。 デバイスにモデルをフィットさせる。フル精度では、300億パラメータモデルは55GB以上のメモリを必要としますが、これはコンシューマーGPUが提供できる容量をはるかに超えています。量子化技術を使用してモデルのウェイトを約4ビット精度に圧縮し、言語モデルを20GB未満に縮小します。これにより、モデルのワーキングメモリ(KVキャッシュ)、画像理解のための認識エンコーダー、および投機的デコーディングドラフターが、24GBまたは32GBのエンベロープ内で同時に実行されるのに十分なヘッドルームが残ります。この圧縮は、エージェントタスクにおいて最小限の、または全く劣化を引き起こさないことを検証しました。 投機的デコーディングによる高速生成。言語モデルは通常、一度に1つのトークンを生成しますが、これは長い推論チェーンや複数ステップのツール呼び出し中に遅く感じられることがあります。Muse Glimmerには、DFlashに基づいた軽量な「ドラフター」モデルが付属しています。これは、一度にトークンのブロック全体を提案する小さなコンパニオンネットワークです。メインモデルは、これらの提案を並列で検証し、正しいトークンを受け入れ、間違ったトークンを修正します。この技術により、Muse Glimmerは、標準的なトークンごとの生成よりも大幅に高速にテキストを生成しながら、同一の出力品質を実現します。リリースでは、メモリオーバーヘッドを小さくするために、量子化されたドラフターバージョンを提供します。 結果:MacBook M4-Max、M5-Max、およびRTX-5090で、K-Quant-17GBモデルと量子化されたDFlashドラフターの速度を測定しました。モデルは、デバイス上で完全に実行されながら、流暢な会話とリアルタイムのエージェントインタラクションに十分な速度です。 Muse Glimmerを今すぐ開始する Muse Glimmerは現在利用可能であり、Hugging Faceからウェイトをダウンロードできます。数日中に、Ollama、LM Studio、Unslothなどのパートナーを通じてローカルで実行したり、llama.cpp、ExecuTorch、MLXなどのエッジフレームワークでデプロイしたり、vLLMおよびSGLangで大規模にサーブしたり、Together AI、Fireworks AI、OpenRouterなどのパートナーを通じて迅速に開始したりできます。PyTorchのTorchTitanトレーニング機能を利用して、ユースケースに合わせてさらにカスタマイズすることもできます。また、AMD、Arm、Dell、Intel、NVIDIAなどのパートナーと協力して、デバイス全体のパフォーマンスを最適化しています。さらに、開発者が開始し、責任を持ってMuse Glimmerを構築するために必要なリソースを提供するドキュメントをリリースしています。これには、カスタムスキャフォールドの設定に関するガイダンスが含まれており、初日からパーソナルエージェントの構築とデプロイをさらに容易にします。MetaのAI開発者センターで詳細を確認し、リソースを見つけることができます。この作業は、Metaの長年のオープンAI研究の実績に基づいており、それをエージェントAIに拡張し、開発者にローカルエージェント機能へのアクセスを提供します。いつものように、コミュニティからのフィードバックを歓迎しており、開発者がこのオープンウェイトモデルで何を構築するかを見るのが待ちきれません。 HuggingFaceでモデルをダウンロードする 開発者向けドキュメント