HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

K2 Horizon: フロンティアパフォーマンス、ラディカルにオープン

K2 Horizon: Frontier Performance, Radically Open (ifm.ai)

280 pointsby karimf89 コメント

要約

IFMは、6つのモデルからなる「K2 Horizon」を発表しました。このモデル群は、様々なサイズクラスにおいて、推論、数学、コーディング、エージェントタスク、および汎用的な能力でトップクラスのパフォーマンスを発揮します。特に0.9B、3.7B、7Bモデルは、それぞれのスケールで新たな最先端を記録しています。K2 Horizonは、トレーニングライフサイクル全体(事前学習から推論、エージェントタスクのポストトレーニングまで)を公開する、史上最も包括的なオープンリリースであり、Apache 2.0ライセンスで提供されます。

全文翻訳

本日、IFMはK2 Horizonを発表します。これは、375B-A23B、36B-A4B、32B、7B、3.7B、0.9Bの6つのモデルからなるコネクテッドフリートです。 推論、数学、コーディング、エージェントタスク、および汎用的な能力において、K2 Horizonはあらゆるサイズクラスでトップクラスのパフォーマンスを発揮します。特に0.9B、3.7B、7Bモデルは、それぞれのスケールで新たな最先端を記録しています。 K2 Horizonは、これまでで最も包括的なオープンリリースでもあります。すべてのモデルについて、事前学習から推論、エージェントタスクのポストトレーニングまでのトレーニングライフサイクルを公開します。中間チェックポイント、トレーニングデータまたは詳細なデータ構築レシピ、オープンアーキテクチャ、混合構成、トレーニングコード、設定、詳細なログ、評価結果、および最終的な重みを公開します。 モデルとコードはApache 2.0ライセンスでリリースされます。データセットは、ODC-BYなどの適用可能なライセンスでリリースされます。再配布が不可能な場合は、データの構築方法と混合方法を開示します。 合わせて、K2 Horizonは、これまでで最も包括的なオープンモデルリリースであり、スケール全体にわたる新たなパフォーマンスフロンティアを代表します。 0.9B、3.7B、および7Bモデルは、広く使用されている評価において、それぞれのサイズクラスで世界をリードするパフォーマンスを達成しています。 当社の新しいMixture-of-Value-Attention(MoVA)メカニズムを搭載した36B-A4Bモデルは、アクティブパラメータあたりの卓越した能力を発揮し、はるかに大きなモデルの一部を上回っています。 32Bおよび375B-A23Bモデルは、それぞれのクラスでトップクラスのモデルにランクインしています。 6つのモデルは、エッジデバイスからエンタープライズまで、さまざまなデプロイメント環境で競争力のあるパフォーマンスを提供します。 エージェント向けの初の完全オープンモデルフリート。 K2 Horizonは、エージェントタスクのポストトレーニングを通じて、開発プロセス全体を公開する初のオープンモデルファミリーです。各ステージにわたるチェックポイント、データ(またはデータレシピ)、コード、設定、トレーニングログをリリースすることで、K2 Horizonは、推論、ツールの使用、計画、およびエージェントタスクの能力がどのように出現するかを研究し、それらを作成する手法を再現し、それらの手法を新しいツール、環境、およびドメインに適応させることを可能にします。 エッジからエンタープライズまでをカバーする6つのモデル。 0.9Bモデルは、時計やメガネのような非常に制約の厳しい環境向けに設計されており、3.7Bおよび7Bモデルは、スマートフォンやその他のオンデバイスアプリケーションに高度な機能をもたらします。 密な32Bモデルと疎な36B-A4Bモデルは、ローカルワークステーションや効率的なサービングのための強力なオプションを提供します。 375B-A23Bモデルは、フリートの最も強力な機能を、要求の厳しいエンタープライズデプロイメントにもたらします。 6つのモデルすべてに量子化サポートが含まれています。 1つのコネクテッドフリート。 6つのモデルは、コアアーキテクチャ、語彙、トレーニング方法論、インターフェース、評価インフラストラクチャ、およびデプロイメントツールを共有しています(0.9Bモデルにはより小さな語彙が含まれます)。この一貫性により、サイズ間での移行、作業の動的なルーティング、およびスケール全体での能力と効率の研究が容易になります。 スケール全体にわたる世界をリードするパフォーマンス。 0.9B、3.7B、および7Bモデルは、数学、推論、汎用能力、コーディング、およびエージェントタスク全体で、それぞれのクラスで最先端の結果を達成しています。 36B-A4Bモデルは、アクティブパラメータ数から通常期待されるレベルを上回るパフォーマンスを発揮し、注意計算値における独自のMixture-of-Expert設計の効率性を示しています。 32Bおよび375B-A23Bモデルは、それぞれの比較クラスでトップクラスのモデルに位置しています。 特に小型モデルが注目に値します。 K2 Horizon 0.9Bは、48を超えるAIME 2026スコアを達成し、強力な推論、ツールの使用、およびエージェントタスクの能力を備えています。 K2 Horizon 3.7Bおよび7Bは、SWE-benchおよびBrowseCompでの強力なパフォーマンスによって実証されるように、これらの機能を、より要求の厳しいソフトウェアエンジニアリングおよびマルチステップ環境に拡張します。 TerminalBenchのような、広範な探索と繰り返し回復を必要とする複雑なタスクは、最小のモデルにとっては依然として困難ですが、K2 Horizonはあらゆるスケールで可能な範囲を前進させます。 なぜHorizonフリートが重要なのか。 能力のフロンティアをはるかに下回る透明なモデルは、研究の基盤としても限定的な価値しかありません。 同時に、最終的な重みとしてのみリリースされた強力なモデルは、人々がそれを実行することを可能にしますが、その能力がどのように作成されたかについての洞察はほとんど提供しません。 K2 Horizonはこれら2つを統合します。 このフリートは、非常に競争力のあるモデルを提供し、それらをトレーニングするために使用されたレシピを公開します。 研究者は、それらを示すのに十分強力なモデルで高度な能力を研究でき、開発者は、最終的なチェックポイントを不透明な出発点として扱うのではなく、手法を再現、適応、および拡張できます。 2023年のLLM360論文で完全オープン原則を導入して以来、毎年オープンモデルをリリースし、そのコミットメントをより大きなスケール、より強力な能力、そして現在ではエージェントタスクのポストトレーニングを通じた完全なライフサイクルにまで拡大してきました。 K2 Horizonフリートの詳細な分析。 K2 Horizon 375B-A23B: エンタープライズの強力なモデル。 K2 Horizon 375B-A23Bは、フリートの中で最大かつ最も有能なモデルです。 その疎なMoEアーキテクチャは、合計3750億パラメータの容量を提供し、各トークンあたり約230億パラメータをアクティブ化します。これにより、すべてのパラメータを各トークンに使用することなく、はるかに大きなモデルの容量を利用できます。 このモデルは、汎用、推論、コーディング、およびエージェントタスクの評価において、4000億パラメータ未満のモデルの中でトップクラスにランクインしています。 複雑な推論、ソフトウェアエンジニアリング、研究、および長期間のエージェントタスクを含む、モデルの品質が最も重要な要求の厳しいワークロード向けに設計されています。 Horizonフリートのすべてのモデルと同様に、375B-A23Bは単一のエンドポイントとしてではなく、開発ツリーとしてリリースされます。 その中間チェックポイントとポストトレーニングブランチは、ベースモデルが推論、指示追従、および特殊なエージェントバリアントにどのように発展するかを公開します。 K2 Horizon 32Bおよび36B-A4B: ローカルデプロイメント向けの強力なパフォーマンス。 Horizon 32Bは、フリートの中で最も強力な密なモデルであり、能力、適応性、およびローカルデプロイメントの強力なバランスを提供します。 400億パラメータ未満の密なモデルの中でトップクラスにランクインしています。 Horizon 36B-A4Bは、密な32Bモデルのパフォーマンスにほぼ匹敵しますが、各トークンあたり約40億パラメータしかアクティブ化しません。 その効率性は、当社の新しい疎なアテンションアーキテクチャであるMoVAと、MoEフィードフォワードレイヤーから来ています。 これらの2つのモデルは、同様のトレーニング条件下での密なアーキテクチャと疎なアーキテクチャの動作を研究するための重要な参照点となります。 これらのモデルは、フリートのローカルパフォーマンスのスイートスポットを占めています。 要求の厳しい推論、コーディング、およびエージェントタスクを実行するのに十分強力でありながら、ローカルワークステーションや効率的なサービングシステムにとって実用的です。 K2 Horizon 7B、3.7B、および0.9B: 小型スケールでのフロンティア能力。 K2 Horizon 7Bおよび3.7Bは、ローカルおよびオンデバイスデプロイメントに適した、強力な推論、数学、コーディング、ツールの使用、およびエージェントタスクのパフォーマンスを提供します。 いくつかの評価では、その結果は、前世代の数倍大きなモデルの結果に近づくか、それを超えています。 K2 Horizon 0.9Bは、これらの機能の多くを、非常に制約の厳しい環境に持ち込みます。 数学的推論を実行し、ツールを使用し、簡単なエージェントタスクを完了することができますが、時計、メガネ、その他のエッジデバイスでのアプリケーションに十分なコンパクトさを保ち、量子化されています。 適切なタスクはスケールによって変化します:0.9Bモデルは、集中した対話と軽量なツールの使用に最も適していますが、3.7Bおよび7Bモデルは、より要求の厳しいコーディングとマルチステップワークフローを処理できます。 これらは together、ほぼどこでも実行できるほど小さなモデルに、現在どれだけの能力を保持できるかを示しています。 K2 Horizonの設計。 最初から1つのファミリーとして。 Horizonは、無関係なモデルのコレクションではなく、コネクテッドファミリーとして設計されました。 6つのモデルは、コアアーキテクチャの決定、トレーニング方法論、インターフェース、評価インフラストラクチャ、およびデプロイメントツールを共有しています。 これは