HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Kimi Linear: 表現力豊かで効率的なAttentionアーキテクチャ

Kimi Linear: An Expressive, Efficient Attention Architecture (arxiv.org)

290 pointsby ronfriedhaber123 コメント

要約

本論文では、Kimi Linearというハイブリッド線形Attentionアーキテクチャを提案する。これは、短・長コンテキスト、強化学習(RL)のスケーリング領域など、様々なシナリオにおいて、公平な比較のもとで初めてフルAttentionを上回る性能を示した。Kimi Delta Attention(KDA)を中核とし、Gated DeltaNetを拡張してよりきめ細やかなゲーティングメカニズムを導入している。このアーキテクチャは、KVキャッシュ使用量を最大75%削減し、1Mコンテキストで最大6倍のデコーディングスループットを達成しつつ、フルAttentionアーキテクチャのドロップインリプレイスメントとして優れた性能と効率を提供する。

全文翻訳

コンピュータサイエンス > 計算と言語 arXiv:2510.26692 (cs) 2025年10月30日(v1)提出、2025年11月1日(現バージョン、v2)改訂 タイトル: Kimi Linear: 表現力豊かで効率的なAttentionアーキテクチャ 著者: Kimi Team: Yu Zhang, Zongyu Lin, Xingcheng Yao, Jiaxi Hu, Fanqing Meng, Chengyin Liu, Xin Men, Songlin Yang, Zhiyuan Li, Wentao Li, Enzhe Lu, Weizhou Liu, Yanru Chen, Weixin Xu, Longhui Yu, Yejie Wang, Yu Fan, Longguang Zhong, Enming Yuan, Dehao Zhang, Yizhi Zhang, T.Y. Liu, Haiming Wang, Shengjun Fang, Weiran He, Shaowei Liu, Yiwei Li, Jianlin Su, Jiezhong Qiu, Bo Pang, Junjie Yan, Zhejun Jiang, Weixiao Huang, Bohong Yin, Jiacheng You, Chu Wei, Zhengtao Wang, Chao Hong, Yutian Chen, Guanduo Chen, Yucheng Wang, Huabin Zheng, Feng Wang, Yibo Liu, Mengnan Dong, Zheng Zhang, Siyuan Pan, Wenhao Wu, Yuhao Wu, Longyu Guan, Jiawen Tao, Guohong Fu, Xinran Xu, Yuzhi Wang, Guokun Lai, Yuxin Wu, Xinyu Zhou, Zhilin Yang, Yulun Du Kimi Team: Yu Zhang他58名の著者による「Kimi Linear: 表現力豊かで効率的なAttentionアーキテクチャ」というタイトルの論文PDFを表示 PDFを表示 要旨: 私たちはKimi Linear、ハイブリッド線形Attentionアーキテクチャを導入します。これは、公平な比較のもと、短コンテキスト、長コンテキスト、および強化学習(RL)のスケーリング領域を含む様々なシナリオにおいて、初めてフルAttentionを上回る性能を示しました。その中核には、Kimi Delta Attention(KDA)があり、これはGated DeltaNetを拡張して、よりきめ細やかなゲーティングメカニズムを導入し、限られた有限状態RNNメモリの効果的な利用を可能にします。私たちのカスタムチャンクアルゴリズムは、対角線プラス低ランク(DPLR)遷移行列の特殊なバリアントを通じて高いハードウェア効率を達成します。これは、一般的なDPLR定式化と比較して計算量を大幅に削減しつつ、古典的なデルタ則により一貫性を保ちます。私たちは、KDAとMulti-Head Latent Attention(MLA)のレイヤーごとのハイブリッドに基づいた、3Bのアクティブパラメータと48Bの総パラメータを持つKimi Linearモデルを事前学習しました。私たちの実験によると、同一のトレーニングレシピで、Kimi Linearは評価されたすべてのタスクにおいて、MLAよりも大幅に優れた性能を示し、KVキャッシュ使用量を最大75%削減し、1Mコンテキストで最大6倍のデコーディングスループットを達成しました。これらの結果は、Kimi Linearが、長い入力および出力長を持つタスクを含む、優れた性能と効率を持つフルAttentionアーキテクチャのドロップインリプレイスメントとなり得ることを示しています。さらなる研究を支援するため、KDAカーネルとvLLMの実装をオープンソース化し、事前学習済みおよび指示チューニング済みのモデルチェックポイントをリリースします。 コメント: Kimi Linear技術レポート 主題: 計算と言語 (cs.CL); 機械学習 (cs.LG) 引用: arXiv:2510.26692 [cs.CL] (またはこのバージョンについてはarXiv:2510.26692v2 [cs.CL]) https://doi.org/10.48550/arXiv.2510.26692 詳細はこちら arXiv発行DOI (DataCite経由) 提出履歴: From: Yulun Du [メールを表示] [v1] Thu, 30 Oct 2025 16:59:43 UTC (645 KB) [v2] Sat, 1 Nov 2025 12:05:18 UTC (691 KB) 全文リンク: 論文にアクセス: Kimi Team: Yu Zhang他58名の著者による「Kimi Linear: 表現力豊かで効率的なAttentionアーキテクチャ」というタイトルの論文PDFを表示PDFを表示TeXソース表示ライセンス 現在の閲覧コンテキスト: cs.CL < 前 | 次 > 新着 | 最近 | 2025-10 次のブラウジングに変更: cs cs.LG 参考文献と引用: NASA ADS Google Scholar Semantic Scholar エクスポート BibTeX引用 読み込み中... BibTeX形式の引用 × 読み込み中... 提供データ: ブックマーク 書誌ツール 書誌および引用ツール 書誌エクスプローラー 書誌エクスプローラー (書誌エクスプローラーとは?) Connected Papers Connected Papers Litmaps Litmaps scite.ai sciteスマート引用 (スマート引用とは?) コード、データ、メディア この論文に関連するコード、データ、メディア alphaXiv alphaXiv (alphaXivとは?) コードへのリンク CatalyzeX CatalyzeX コードファインダー (論文のコードファインダーとは?) DagsHub DagsHub (DagsHubとは?) GotitPub Gotit.pub (GotitPubとは?) Huggingface Hugging Face (Hugging Faceとは?) ScienceCast ScienceCast (ScienceCastとは?) デモ デモ Replicate Replicate (Replicateとは?) Spaces Hugging Face Spaces (Spacesとは?) Spaces TXYZ.AI (TXYZ.AIとは?) 関連論文 レコメンダーおよび検索ツール 影響力フラワーへのリンク 影響力フラワー (影響力フラワーとは?) Coreレコメンダー COREレコメンダー (COREレコメンダーとは?) 著者 会場 機関 トピック arXivについて arXivLabs arXivLabs: コミュニティ協力者との実験的なプロジェクト arXivLabsは、協力者がarXivの新しい機能を直接ウェブサイトで開発・共有できるフレームワークです。arXivLabsと協力する個人および組織は、オープンさ、コミュニティ、卓越性、ユーザーデータプライバシーという私たちの価値観を受け入れ、遵守しています。arXivはこの価値観にコミットしており、それらを遵守するパートナーのみと協力します。arXivコミュニティに価値をもたらすプロジェクトのアイデアがありますか?arXivLabsの詳細をご覧ください。 この論文の著者のうち、推薦者は誰ですか? 数式表示の無効化 (MathJaxとは?)