HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

CognitionのSWE-2、Terminal-Bench 2.1で92.8を達成

Cognition's SWE-2 achieves 92.8 on Terminal-Bench 2.1 (tokenstead.ai)

34 pointsby cdnsteve14 コメント

要約

Cognitionは、同社の最新AIモデルSWE-2が、コーディング能力を評価するベンチマークであるTerminal-Bench 2.1で92.8という高いスコアを達成したと発表しました。SWE-2は、2.8兆パラメータを持つMoE(Mixture of Experts)モデルで、Kimi K3ベースにCognitionの追加学習を施したものです。特に、より少ないステップ数と低コストでタスクを完了する能力が向上しており、FrontierCodeベンチマークでも高い性能を示していますが、長期間にわたるエージェント的な作業ではまだ改善の余地があることが示唆されています。

全文翻訳

モデル / SWE-2 SWE-2 MoEプレミア Cognition → ハードウェア向け検索 2.8兆総パラメータ、トークンあたり1040億アクティブ(MoE)- Cognitionによるポストトレーニングが追加されたKimi K3ベースであり、CognitionがRLをマルチ兆パラメータ領域にスケールさせたのは初めてです。ベースモデルはすでにエージェントコーディングのためにRLを多用していましたが、Cognitionのパスにより、ほとんどのベンチマークでさらに5〜6ポイント向上しました。 サービングスタック: NVFP4およびFP8カーネルでのMoE推論と量子化認識トレーニング。FP8はMLAレイヤーでK、Q、V、およびスコア計算を処理します。SpecForgeで再トレーニングされたドラフトモデルは、15%長い受け入れ長を提供し、プリフィルディレイヤーはGPUあたりのTPMとリクエストあたりのトークン/秒を10〜20%向上させます(TTFTは影響を受けます)。 努力レベル: 平均ステップ数/実行 53(中)、80(高)、98(最大)、SWE-1.7の127と比較して。Mediumは、58%少ないターン数と81%低い平均コストで、SWE-1.7よりも高いFrontierCodeスコアを記録し、最初の実際の編集を中央値18ステップで完了します(SWE-1.7: 48)。 ベンチマーク(Cognition自己申告): FrontierCode 1.1 Main 50.0、DeepSWE 1.1 73.0、Terminal-Bench 2.1 92.8、Terminal-Bench 4.0 27.3。 ヘッドライン: FrontierCodeの50.0は、Claude Fable 5.1(50.9)に1ポイント、GPT-6 Astra(53.3)に3.3ポイント遅れていますが、Fable 5.1よりも64%低コスト、Astraの4分の1のコストと主張されています。Terminal-Bench 2.1は、公開テーブルで最高の数値です。 弱点はTerminal-Bench 4.0で、SWE-2の27.3はFable 5.1(55.8)とGPT-6 Astra(57.9)に大きく引き離されています。長期間にわたるエージェント作業が、フロンティアとのギャップが依然として存在する領域です。 プロプライエタリなウェイト、ローカル実行なし。CognitionはSWE-2のウェイトを公開していないため、ダウンロードできるものも、待つべき量子化ラダーもありません。Devin DesktopおよびCLIで本日利用可能であり、Devin WebおよびFusionでもロールアウトされます。 CognitionはSWE-2のトークンごとのAPIを公開していないため、タスクあたりのコスト比較(FrontierCode同等でFable 5.1より64%安価)が価格の表面であり、$/1Mレートカードではありません。 ここに記載されているすべての数値はCognition自身の数値であり、独立した再現待ちです。 コーディングエージェント パラメータ 2800.0B ライセンス プロプライエタリ 開発者 Cognition 原産国 🇺🇸 USA リリース 2026年9月 SWE-2で人々が構築しているもの Xからの実際のデモ ローンチ投稿: SWE-2、Kimi K3からポストトレーニング - FrontierCode 1.1 Main 50.0、Terminal-Bench 2.1 92.8 Xで表示 → ベンチマークスコア ベンダー報告 - 開発者自身のモデルカード/テクニカルレポートから DeepSWE73.0 FrontierCode 1.1 Main50.0 Terminal-Bench 2.192.8 Terminal-Bench 4.027.3 ベンダー報告 - 開発者自身のモデルカード/テクニカルレポートから またはクラウドで実行 SWE-2のプロバイダー価格は、トークンごとのAPIではまだ追跡されていません。フラッグシップのリスト価格については、計算機を参照してください。 価格履歴 推論コストの推移 データは最初の毎日の同期から蓄積されます - より長い範囲は時間とともに表示されます。価格はOpenRouterのスナップショットから取得され、履歴APIではありません。 価格履歴の読み込み中...