AI・機械学習
Laguna S 2.1の紹介
要約
Poolside AIは、長距離タスクと推論に焦点を当てた新しいMixture-of-Experts(MoE)モデル「Laguna S 2.1」を発表しました。このモデルは118Bの総パラメータを持ちながら、トークンあたり8Bのアクティブパラメータで、最大100万トークンのコンテキストウィンドウをサポートします。特にコーディングベンチマークにおいて、そのサイズをはるかに超える性能を示し、効率性と能力を両立させています。
全文翻訳
パンチング・アバブ・イッツ・ウェイト・クラス
Laguna S 2.1は、私たちが測定できる限り、その重量クラスにおいて圧倒的な差で最も有能なエージェント型コーディングモデルです。
Laguna S 2.1は、当社の長距離タスクと効果的な推論の追求におけるモデル開発の重要な一歩です。Laguna S 2.1は、118Bの総パラメータを持つMixture-of-Experts(MoE)モデルで、トークンあたり8Bのアクティブパラメータを持ち、思考モードと非思考モードの両方で最大100万トークンのコンテキストウィンドウをサポートします。トレーニング開始からローンチまで9週間未満で完了し、長距離コーディングベンチマークでは、その数倍のサイズのモデルに対しても互角の性能を発揮します。本日公開するすべてのベンチマークスコアについて、trajectories.poolside.aiで最終評価セットの各トライアルの完全な軌跡を公開しています。
Laguna S 2.1 118B-A8B
Tencent Hy3 295B-A21B
Inkling 975B-A41B
Nemotron 3 Ultra 550B-A55B
DeepSeek-V4-Pro-Max 1.6T-A49B
Kimi K3 2.8T-A50B
Qwen 3.7 Max —
Muse Spark 1.1 —
Claude Fable 5 —
Terminal-Bench 2.1
Terminal-Bench 2.1
Terminal-Bench 2.1で解決されたタスク。
0.0 0.0 0.0 0.0 0 0.0 0.0 0
SWE-Bench Multilingual
SWE-Bench Multilingual
SWE-Bench Multilingualで解決されたタスク。
0.0 0.0 0.0 0.0 0.0
SWE-Bench Pro (Public Dataset)
SWE-Bench Pro (Public Dataset)
SWE-Bench Pro (Public Dataset)で解決されたタスク。
0.0 0.0 0.0 0.0 0.0 0.0 0.0
DeepSWE
DeepSWE
DeepSWEで解決されたタスク。
0.0 0 0 0.0 0
SWE Atlas (Codebase QnA)
SWE Atlas (Codebase QnA)
SWE Atlas (Codebase QnA)で解決されたタスク。
0.0 0.0 0.0
Toolathlon Verified
Toolathlon Verified
Toolathlon Verifiedで解決されたタスク。
0.0 0.0 0.0 0.0 0.0
2026年7月21日時点のベンチマーク。
pass@1はタスクごとに4回の試行の平均値ですが、DeepSWE、SWE Atlas (Codebase QnA)、Toolathlon Verifiedはタスクごとに3回の試行でした。
すべてのベンチマークについて、ベンダーの自己申告スコア、ベンチマーク作成者のリーダーボード、または第三者リーダーボード(Artificial Analysis)の最大値を使用します。ただし、SWE Atlas (Codebase QnA)については第三者リーダーボードの数値は使用しません。
Laguna S 2.1 (118B-A8B)
Tencent Hy3 (295B-A21B)
Inkling (975B-A41B)
Nemotron 3 Ultra (550B-A55B)
DeepSeek-V4-Pro Max (1.6T-A49B)
Kimi K3 (2.8T-A50B)
Qwen 3.7 Max (—)
Muse Spark 1.1 (—)
Claude Fable 5 (—)
Terminal-Bench 2.1
70.2
71.7
63.8
56.4
64.0
88.3
74.5
80
88.0
SWE-Bench Multilingual
78.5
75.8
-
67.7
76.2
-
78.3
-
-
SWE-Bench Pro (Public Dataset)
59.4
57.9
54.3
-
55.4
-
60.6
61.5
80.3
DeepSWE
40.4
-
-
-
9.0
69.0
-
53.3
70.0
SWE Atlas (Codebase QnA)
46.2
-
-
-
27.2
-
-
42.2
-
Toolathlon Verified
49.7
-
45.5
34.3
55.9
-
-
75.6
-
Laguna S 2.1は、Terminal-Bench 2.1において、思考を有効にしたエージェントハーネスで70.2%のスコアを記録しています。そのコンパクトなサイズは、ローカルマシンでの複雑な作業にユニークに適しています。
ベンチマーク
Terminal-Bench 2.1
SWE-Bench Multilingual
SWE-Bench Pro (Public Dataset)
DeepSWE
SWE Atlas (Codebase QnA)
Toolathlon Verified
オープンウェイト
クローズド / サイズ非公開
1 GPT-5.6 Sol
88.8
2 Kimi K3 2.8T-A50B
88.3
3 Claude Fable 5
88.0
4 GPT-5.6 Terra
87.4
5 GPT-5.6 Luna
84.7
6 Claude Opus 4.8
84.6
7 Claude Sonnet 5
80.4
8 Muse Spark 1.1
80.0
9 Qwen-3.7 Max
74.5
10 Hy3 295B-A21B
71.7
11 Laguna S 2.1 118B-A8B
70.2
12 MiniMax M3 428B-A23B
66.0
13 DeepSeek-V4-Pro-Max 1600B-A49B
64.0
14 Inkling 975B-A41B
63.8
15 DeepSeek-V4-Flash-Max 284B-A13B
61.8
16 Nemotron 3 Ultra 550B-A55B
56.4
17 Inkling-Small 276B-A12B
52.7
18 Qwen3.6-27B 27B
51.3
19 Qwen3.6-35B-A3B 35B-A3B
44.9
20 Nemotron 3 Super 120B-A12B
38.6
21 Laguna XS 2.1 33B-A3B
33.4
22 Mistral Small 4 119B
21.4
2026年7月21日時点のベンチマーク。
pass@1はタスクごとに4回の試行の平均値ですが、DeepSWE、SWE Atlas (Codebase QnA)、Toolathlon Verifiedはタスクごとに3回の試行でした。
すべてのベンチマークについて、ベンダーの自己申告スコア、ベンチマーク作成者のリーダーボード、または第三者リーダーボード(Artificial Analysis)の最大値を使用します。ただし、SWE Atlas (Codebase QnA)については第三者リーダーボードの数値は使用しません。
Terminal-Bench 2.1は、エージェントモデルがターミナルを介して環境に接続される、広範で高品質な長距離タスクを評価します。Laguna S 2.1は、このベンチマークにおいて、そのサイズカテゴリで際立ったモデルです。
ベンチマーク
Terminal-Bench 2.1
SWE-Bench Multilingual
SWE-Bench Pro (Public Dataset)
DeepSWE
SWE Atlas (Codebase QnA)
Toolathlon Verified
Laguna S 2.1
その他
Laguna
その他の公開モデル
0
25
50
75
100
30B
100B
300B
1000B
3000B
Laguna S 2.1
Laguna S 2.1: 70.2 at 118B
Laguna XS 2.1
Laguna XS 2.1: 33.4 at 33B
Kimi K3
Kimi K3: 88.3 at 2800B
DeepSeek-V4-Pro-Max
DeepSeek-V4-Pro-Max: 64 at 1600B
Inkling
Inkling: 63.8 at 975B
Nemotron 3 Ultra
Nemotron 3 Ultra: 56.4 at 550B
MiniMax M3
MiniMax M3: 66 at 428B
Hy3
Hy3: 71.7 at 295B
DeepSeek-V4-Flash-Max
DeepSeek-V4-Flash-Max: 61.8 at 284B
Inkling-Small
Inkling-Small: 52.7 at 276B
Nemotron 3 Super
Nemotron 3 Super: 38.6 at 120B
Mistral Small 4
Mistral Small 4: 21.4 at 119B
Qwen3.6-35B-A3B
Qwen3.6-35B-A3B: 44.9 at 35B
Qwen3.6-27B
Qwen3.6-27B: 51.3 at 27B
総パラメータ数(B、対数スケール)
スコア(Pass@1)
総パラメータ数、対数スケール。
総パラメータ数が非公開のモデルは除外されています。
DeepSWEの詳細
上記のベンチマークはすべて意味のあるものですが、私たちはそれらのフロンティアに近いことに満足しています。しかし、その近さの一部は、ベンチマークの成熟の特性でもあります。フロンティアが進むにつれて、トップスコアは70〜90%の範囲に集中し、非常に異なる動作をするモデルでも数ポイントしか差がなくなります。DatacurveのDeepSWEにはまだ大きなヘッドルームがあります。そのタスクはより長距離であり、部分的にしか解決できず、スコアは実際に広がっています。フロンティアモデルはv1.1バリアントで54%から73%の範囲であり、一部の1T+パラメータのオープンモデルは10%未満のスコアです。
DeepSWE v1.1において、Laguna S 2.1はプールハーネスで思考モードで40.4%のスコアを記録しています。
オープンウェイト
クローズド / サイズ非公開
1 GPT-5.6 Sol
73.0
2 Claude Fable 5
70.0
3 GPT-5.6 Terra
70.0
4 Kimi K3 2.8T-A50B
69.0
5 GPT-5.6 Luna
67.2
6 GPT-5.5
67.0
7 Claude Opus 4.8
59.0
8 Claude Sonnet 5
54.0
9 Grok 4.5
54.0
10 Muse Spark 1.1
53.3
11 GPT-5.4
52.0
12 GLM 5.2 753B-A40B
44.0
13 Laguna S 2.1 118B-A8B
40.4
14 Gemini 3.5 Flash
37.0
15 Kimi K2.7 Code
31.0
16 Claude Sonnet 4.6
30.0
17 Gemini 3.1 Pro
12.0
18 DeepSeek-V4-Pro-Max 1600B-A49B
9.0
19 Laguna XS 2.1 33B-A3B
0.3
pass@1はタスクごとに3回の試行の平均値です。ハーネスは異なります(DeepSWEのリーダーボードはmini-swe-agentを使用し、モデルプロバイダーは独自のハーネスで報告する可能性があり、私たちはプールで報告します。私たちのエージェントハーネス)。
すべてのベンチマークについて、ベンダーの自己申告スコア、ベンチマーク作成者のリーダーボード、または第三者リーダーボード(Artificial Analysis)の最大値を使用します。
Laguna S 2.1がプールハーネス(DeepSWEのリーダーボードが使用するmini-swe-agentではなく)で40.4%のスコアを記録したことは注目に値します。他のモデルについては、ほとんどのモデルで公式リーダーボードの結果が報告されているため、報告されたスコアの最大値を使用します。これによりスコアの比較可能性は低下しますが、多くのモデルがネイティブハーネスよりもmini-swe-agentで同等またはそれ以上のスコアを記録していると報告されているため、これは私たちを特に有利な立場に置くとは考えていません。最終評価実行のすべての軌跡はここで入手できます。
評価方法論
報酬ハッキングの蔓延により、エージェントモデルの評価は非常に困難です。以前に、主要なベンチマークにおける報酬ハッキングと、Laguna M.1およびXS.2モデルの技術レポートの一部としての評価システムと厳密さについて記述しました。最近の作業は、報酬ハッキング検出を強化するための敵対的ジャッジに焦点を当てています。
このリリースでは、公開されているLaguna S 2.1チェックポイントの最終評価からのすべての軌跡をtrajectories.poolside.aiで表示およびダウンロードできるようにします。
モデルの動作を見る
ベンチマークスコアはモデルの動作を定量的に把握するのに役立ちますが、