HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Laguna S 2.1の紹介

Laguna S 2.1 (poolside.ai)

378 pointsby rexledesma70 コメント

要約

Poolside AIは、長距離タスクと推論に焦点を当てた新しいMixture-of-Experts(MoE)モデル「Laguna S 2.1」を発表しました。このモデルは118Bの総パラメータを持ちながら、トークンあたり8Bのアクティブパラメータで、最大100万トークンのコンテキストウィンドウをサポートします。特にコーディングベンチマークにおいて、そのサイズをはるかに超える性能を示し、効率性と能力を両立させています。

全文翻訳

パンチング・アバブ・イッツ・ウェイト・クラス Laguna S 2.1は、私たちが測定できる限り、その重量クラスにおいて圧倒的な差で最も有能なエージェント型コーディングモデルです。 Laguna S 2.1は、当社の長距離タスクと効果的な推論の追求におけるモデル開発の重要な一歩です。Laguna S 2.1は、118Bの総パラメータを持つMixture-of-Experts(MoE)モデルで、トークンあたり8Bのアクティブパラメータを持ち、思考モードと非思考モードの両方で最大100万トークンのコンテキストウィンドウをサポートします。トレーニング開始からローンチまで9週間未満で完了し、長距離コーディングベンチマークでは、その数倍のサイズのモデルに対しても互角の性能を発揮します。本日公開するすべてのベンチマークスコアについて、trajectories.poolside.aiで最終評価セットの各トライアルの完全な軌跡を公開しています。 Laguna S 2.1 118B-A8B Tencent Hy3 295B-A21B Inkling 975B-A41B Nemotron 3 Ultra 550B-A55B DeepSeek-V4-Pro-Max 1.6T-A49B Kimi K3 2.8T-A50B Qwen 3.7 Max — Muse Spark 1.1 — Claude Fable 5 — Terminal-Bench 2.1 Terminal-Bench 2.1 Terminal-Bench 2.1で解決されたタスク。 0.0 0.0 0.0 0.0 0 0.0 0.0 0 SWE-Bench Multilingual SWE-Bench Multilingual SWE-Bench Multilingualで解決されたタスク。 0.0 0.0 0.0 0.0 0.0 SWE-Bench Pro (Public Dataset) SWE-Bench Pro (Public Dataset) SWE-Bench Pro (Public Dataset)で解決されたタスク。 0.0 0.0 0.0 0.0 0.0 0.0 0.0 DeepSWE DeepSWE DeepSWEで解決されたタスク。 0.0 0 0 0.0 0 SWE Atlas (Codebase QnA) SWE Atlas (Codebase QnA) SWE Atlas (Codebase QnA)で解決されたタスク。 0.0 0.0 0.0 Toolathlon Verified Toolathlon Verified Toolathlon Verifiedで解決されたタスク。 0.0 0.0 0.0 0.0 0.0 2026年7月21日時点のベンチマーク。 pass@1はタスクごとに4回の試行の平均値ですが、DeepSWE、SWE Atlas (Codebase QnA)、Toolathlon Verifiedはタスクごとに3回の試行でした。 すべてのベンチマークについて、ベンダーの自己申告スコア、ベンチマーク作成者のリーダーボード、または第三者リーダーボード(Artificial Analysis)の最大値を使用します。ただし、SWE Atlas (Codebase QnA)については第三者リーダーボードの数値は使用しません。 Laguna S 2.1 (118B-A8B) Tencent Hy3 (295B-A21B) Inkling (975B-A41B) Nemotron 3 Ultra (550B-A55B) DeepSeek-V4-Pro Max (1.6T-A49B) Kimi K3 (2.8T-A50B) Qwen 3.7 Max (—) Muse Spark 1.1 (—) Claude Fable 5 (—) Terminal-Bench 2.1 70.2 71.7 63.8 56.4 64.0 88.3 74.5 80 88.0 SWE-Bench Multilingual 78.5 75.8 - 67.7 76.2 - 78.3 - - SWE-Bench Pro (Public Dataset) 59.4 57.9 54.3 - 55.4 - 60.6 61.5 80.3 DeepSWE 40.4 - - - 9.0 69.0 - 53.3 70.0 SWE Atlas (Codebase QnA) 46.2 - - - 27.2 - - 42.2 - Toolathlon Verified 49.7 - 45.5 34.3 55.9 - - 75.6 - Laguna S 2.1は、Terminal-Bench 2.1において、思考を有効にしたエージェントハーネスで70.2%のスコアを記録しています。そのコンパクトなサイズは、ローカルマシンでの複雑な作業にユニークに適しています。 ベンチマーク Terminal-Bench 2.1 SWE-Bench Multilingual SWE-Bench Pro (Public Dataset) DeepSWE SWE Atlas (Codebase QnA) Toolathlon Verified オープンウェイト クローズド / サイズ非公開 1 GPT-5.6 Sol 88.8 2 Kimi K3 2.8T-A50B 88.3 3 Claude Fable 5 88.0 4 GPT-5.6 Terra 87.4 5 GPT-5.6 Luna 84.7 6 Claude Opus 4.8 84.6 7 Claude Sonnet 5 80.4 8 Muse Spark 1.1 80.0 9 Qwen-3.7 Max 74.5 10 Hy3 295B-A21B 71.7 11 Laguna S 2.1 118B-A8B 70.2 12 MiniMax M3 428B-A23B 66.0 13 DeepSeek-V4-Pro-Max 1600B-A49B 64.0 14 Inkling 975B-A41B 63.8 15 DeepSeek-V4-Flash-Max 284B-A13B 61.8 16 Nemotron 3 Ultra 550B-A55B 56.4 17 Inkling-Small 276B-A12B 52.7 18 Qwen3.6-27B 27B 51.3 19 Qwen3.6-35B-A3B 35B-A3B 44.9 20 Nemotron 3 Super 120B-A12B 38.6 21 Laguna XS 2.1 33B-A3B 33.4 22 Mistral Small 4 119B 21.4 2026年7月21日時点のベンチマーク。 pass@1はタスクごとに4回の試行の平均値ですが、DeepSWE、SWE Atlas (Codebase QnA)、Toolathlon Verifiedはタスクごとに3回の試行でした。 すべてのベンチマークについて、ベンダーの自己申告スコア、ベンチマーク作成者のリーダーボード、または第三者リーダーボード(Artificial Analysis)の最大値を使用します。ただし、SWE Atlas (Codebase QnA)については第三者リーダーボードの数値は使用しません。 Terminal-Bench 2.1は、エージェントモデルがターミナルを介して環境に接続される、広範で高品質な長距離タスクを評価します。Laguna S 2.1は、このベンチマークにおいて、そのサイズカテゴリで際立ったモデルです。 ベンチマーク Terminal-Bench 2.1 SWE-Bench Multilingual SWE-Bench Pro (Public Dataset) DeepSWE SWE Atlas (Codebase QnA) Toolathlon Verified Laguna S 2.1 その他 Laguna その他の公開モデル 0 25 50 75 100 30B 100B 300B 1000B 3000B Laguna S 2.1 Laguna S 2.1: 70.2 at 118B Laguna XS 2.1 Laguna XS 2.1: 33.4 at 33B Kimi K3 Kimi K3: 88.3 at 2800B DeepSeek-V4-Pro-Max DeepSeek-V4-Pro-Max: 64 at 1600B Inkling Inkling: 63.8 at 975B Nemotron 3 Ultra Nemotron 3 Ultra: 56.4 at 550B MiniMax M3 MiniMax M3: 66 at 428B Hy3 Hy3: 71.7 at 295B DeepSeek-V4-Flash-Max DeepSeek-V4-Flash-Max: 61.8 at 284B Inkling-Small Inkling-Small: 52.7 at 276B Nemotron 3 Super Nemotron 3 Super: 38.6 at 120B Mistral Small 4 Mistral Small 4: 21.4 at 119B Qwen3.6-35B-A3B Qwen3.6-35B-A3B: 44.9 at 35B Qwen3.6-27B Qwen3.6-27B: 51.3 at 27B 総パラメータ数(B、対数スケール) スコア(Pass@1) 総パラメータ数、対数スケール。 総パラメータ数が非公開のモデルは除外されています。 DeepSWEの詳細 上記のベンチマークはすべて意味のあるものですが、私たちはそれらのフロンティアに近いことに満足しています。しかし、その近さの一部は、ベンチマークの成熟の特性でもあります。フロンティアが進むにつれて、トップスコアは70〜90%の範囲に集中し、非常に異なる動作をするモデルでも数ポイントしか差がなくなります。DatacurveのDeepSWEにはまだ大きなヘッドルームがあります。そのタスクはより長距離であり、部分的にしか解決できず、スコアは実際に広がっています。フロンティアモデルはv1.1バリアントで54%から73%の範囲であり、一部の1T+パラメータのオープンモデルは10%未満のスコアです。 DeepSWE v1.1において、Laguna S 2.1はプールハーネスで思考モードで40.4%のスコアを記録しています。 オープンウェイト クローズド / サイズ非公開 1 GPT-5.6 Sol 73.0 2 Claude Fable 5 70.0 3 GPT-5.6 Terra 70.0 4 Kimi K3 2.8T-A50B 69.0 5 GPT-5.6 Luna 67.2 6 GPT-5.5 67.0 7 Claude Opus 4.8 59.0 8 Claude Sonnet 5 54.0 9 Grok 4.5 54.0 10 Muse Spark 1.1 53.3 11 GPT-5.4 52.0 12 GLM 5.2 753B-A40B 44.0 13 Laguna S 2.1 118B-A8B 40.4 14 Gemini 3.5 Flash 37.0 15 Kimi K2.7 Code 31.0 16 Claude Sonnet 4.6 30.0 17 Gemini 3.1 Pro 12.0 18 DeepSeek-V4-Pro-Max 1600B-A49B 9.0 19 Laguna XS 2.1 33B-A3B 0.3 pass@1はタスクごとに3回の試行の平均値です。ハーネスは異なります(DeepSWEのリーダーボードはmini-swe-agentを使用し、モデルプロバイダーは独自のハーネスで報告する可能性があり、私たちはプールで報告します。私たちのエージェントハーネス)。 すべてのベンチマークについて、ベンダーの自己申告スコア、ベンチマーク作成者のリーダーボード、または第三者リーダーボード(Artificial Analysis)の最大値を使用します。 Laguna S 2.1がプールハーネス(DeepSWEのリーダーボードが使用するmini-swe-agentではなく)で40.4%のスコアを記録したことは注目に値します。他のモデルについては、ほとんどのモデルで公式リーダーボードの結果が報告されているため、報告されたスコアの最大値を使用します。これによりスコアの比較可能性は低下しますが、多くのモデルがネイティブハーネスよりもmini-swe-agentで同等またはそれ以上のスコアを記録していると報告されているため、これは私たちを特に有利な立場に置くとは考えていません。最終評価実行のすべての軌跡はここで入手できます。 評価方法論 報酬ハッキングの蔓延により、エージェントモデルの評価は非常に困難です。以前に、主要なベンチマークにおける報酬ハッキングと、Laguna M.1およびXS.2モデルの技術レポートの一部としての評価システムと厳密さについて記述しました。最近の作業は、報酬ハッキング検出を強化するための敵対的ジャッジに焦点を当てています。 このリリースでは、公開されているLaguna S 2.1チェックポイントの最終評価からのすべての軌跡をtrajectories.poolside.aiで表示およびダウンロードできるようにします。 モデルの動作を見る ベンチマークスコアはモデルの動作を定量的に把握するのに役立ちますが、