HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Qwen3.8-2.4T

Qwen3.8-2.4T (huggingface.co)

48 pointsby mmastrac5 コメント

要約

Qwen3.8-2.4Tは、Hugging Face Transformers形式で提供される、ポストトレーニング済みのFP8量子化モデルです。このモデルは、コーディング、専門的な作業、研究、長期的なエージェントタスクにおいて大幅な性能向上をもたらし、特に自律的な計画と環境フィードバックの処理能力が強化されています。2.4兆パラメータ(アクティブ95B)を持ち、最大1,010,000トークンまで拡張可能なコンテキスト長を備えています。

全文翻訳

Qwen3.8-2.4T-A95B-FP8 このリポジトリには、Hugging Face Transformers形式のポストトレーニング済みモデルのFP8量子化モデルウェイトと設定ファイルが含まれています。これらのアーティファクトは、vLLM、SGLang、TokenSpeedなどと互換性があります。量子化手法は、ブロックサイズ128のきめ細かなfp8量子化であり、そのパフォーマンスメトリックは元のモデルとほぼ同等です。インフラストラクチャのメンテナンスなしで、管理されたスケーラブルな推論を求めるユーザーのために、Qwen Cloudによって公式のQwen APIサービスが提供されています。特に、Qwen3.8-Maxは、ビジョン入力とノンシンキングサポート、デフォルトで1Mのコンテキスト長、公式の組み込みツールなどの追加機能を備えた、Qwen3.8-2.4T-A95Bに基づく公式バージョンです。詳細については、Qwen3.8-Maxの概要を参照してください。 Qwen3.5およびQwen3.6シリーズの広範なコミュニティ採用に続き、私たちはこれまでで最も有能なQwenオープンモデルファミリーの世代であるQwen3.8を発表できることを嬉しく思います。Qwen3.8は初めて、Qwen-Maxクラスのモデルをオープンリリースにもたらします。Qwen3.5のアーキテクチャ基盤上に構築されたQwen3.8は、コーディング、専門的な作業、研究、および長期的なエージェントタスク全体で大幅な進歩をもたらします。より難しい質問に答えるだけでなく、Qwen3.8は、より高い信頼性で複雑で多段階のタスクを完了できるように設計されています。 Qwen3.8のハイライト Qwen3.8は以下の強化機能を備えています。 コア機能:コーディング、専門的な作業、研究、および長期的なエージェントタスク全体での包括的な改善。 エージェント実行:より強力な自律計画と環境フィードバックのより良い処理により、エンドツーエンドのタスク完了の信頼性が向上します。 下流互換性:一般的なハーネスや開発ツールへのサポートが拡大され、既存のスタックへの統合が容易になります。 柔軟な思考制御:reasoning_effortで推論の深さを調整でき、preserve_thinkingを介して過去のメッセージからの推論コンテキストが保持されます。詳細については、ブログ記事Qwen3.8-Maxを参照してください。 モデル概要 タイプ:Causal Language Model トレーニング段階:事前トレーニング&ポストトレーニング 言語モデル パラメータ数:合計2.4T、アクティブ95B 隠れ次元:8192 トークン埋め込み:248,320 (パディング済み) レイヤー数:92 隠れレイアウト:23 × (3 × (Gated DeltaNet → MoE) → 1 × (Gated Attention → MoE)) Gated DeltaNet: 線形アテンションヘッド数:Vに128、QKに16 ヘッド次元:128 ロータリー位置埋め込み次元:64 Gated Attention: アテンションヘッド数:Qに64、KVに4 ヘッド次元:256 ロータリー位置埋め込み次元:64 Mixed of Experts (MoE): エキスパート数:512 アクティブなエキスパート数:10 ルーティング済み + 1 共有エキスパート 中間次元:2048 LM出力:248,320 (パディング済み) MTP (Multi-Token Prediction):複数ステップでトレーニング済み コンテキスト長:ネイティブで262,144、最大1,010,000トークンまで拡張可能。 ベンチマーク結果 Opus 4.8 Fable 5 GPT 5.6 Sol (max) Qwen3.7-Max Qwen3.8-Max コーディングエージェント Terminal Bench 2.1 84.6 84.6 88.8 74.5 86.6 SWE-bench Pro 69.2 80.0 64.6 60.6 67.7 DeepSWE 1.1 59.0 70.0 73.0 21.6 56.6 NL2Repo-Bench 69.4 -- -- 47.2 55.9 FrontierSWE 70.0 88.8 -- 40.7 73.5 MLS-Bench-Lite 42.8 49.9 46.2 31.7 41.0 PaperBench 80.3 88.8 90.5 64.8 93.0 AndroidBench 69.8 84.5 74.0 56.5 75.1 QwenSWEBench 84.0 86.3 73.5 63.4 80.7 QwenQoderBench 62.7 63.1 53.8 36.8 58.4 QwenReactBench 1694 1770 1564 1538 1724 QwenSVGBench 1648 1690 1758 1499 1713 一般エージェント CoWorkBench 72.3 75.9 71.5 64.6 74.8 WorkSpaceBench 66.8 68.7 65.6 61.4 67.7 JobBench 48.4 57.4 45.4 31.3 53.4 SkillsBench 65.1 70.9 73.5 61.2 70.2 Agents' Last Exam (Pass / Score) 27.0 / 45.1 -- / -- 30.6 / 53.6 11.8 / 31.1 27.0 / 52.4 Automation-Bench (Pass@1) 27.2 29.1 29.7 14.2 27.3 Toolathlon Verified (Pass@1) 76.2 77.9 74.9 49.7 72.5 WideSearch 72.9 81.2 -- 75.2 81.9 HLE w/ tools 57.9 64.5 58.0 53.5 56.2 一般機能 GPQA Diamond 92.0 92.6 94.1 92.4 92.6 HLE 45.7 53.3 47.2 41.4 43.6 IFBench 62.2 63.5 72.7 79.1 82.8 $OneMillion-Bench (expert score) 41.8 55.9 53.8 44.4 52.5 HealthBench 52.4 -- 55.3 54.5 60.2 PLawBench 69.6 70.2 72.3 58.9 73.2 PRBench-Legal 52.7 57.6 57.6 48.5 57.6 PRBench-Finance 51.9 55.8 55.5 46.8 58.3 MRCR v2 256K (8-needle) 83.2 -- 93.8 86.7 92.9 LongBench v2 69.1 -- 67.1 65.3 66.3 1. Fable5の結果にはフォールバックが含まれる場合があります。 2. Terminal Bench 2.1: Claude Code (avg@10)、5時間のタイムアウト、max_tokens=131,072で評価。他のすべてのモデルについては、ハーネス全体で公開されている最高のスコアを報告します:Claude Opus 4.8およびClaude Fable 5はArtificial Analysis (https://artificialanalysis.ai/evaluations/terminalbench-v2-1) のTerminus 2を使用。GPT-5.6 SolはCodex (https://openai.com/index/previewing-gpt-5-6-sol/) を使用。 3. SWE-bench Pro: Claude Codeハーネス、temp=1.0、top_p=0.95、256Kコンテキストウィンドウで評価。問題のあるタスクは修正され、すべてのベースラインは改良されたベンチマークで評価されました。 4. DeepSWE 1.1: Claude Codeおよびmini-SWE-agentハーネス、temp=1.0、top_p=0.95、256Kコンテキストウィンドウで評価。両方のハーネスの中で最も高いスコアを報告します。特に、Qwen3.8-MaxはClaude Codeで最高のパフォーマンスを発揮します。 5. NL2Repo-Bench: Claude Codeハーネスで評価。報酬ハッキングを防ぐため、pip download、pip install、git cloneなどの特定のレポジトリにアクセスしようとするBashコマンドは無効にしています。 6. FrontierSWE: Claude Codeハーネスで評価。利用可能な他のすべてのMEAN@5結果は、2026年8月3日時点の公式FrontierSWEリーダーボード (https://www.frontierswe.com) から取得しています。優位性スコアは、公式評価スクリプトを使用して生スコアから再計算されます。「--」は、その日付時点で公式のMEAN@5結果が利用できなかったことを示します。 7. MLS-Bench-Lite: Claude Codeを使用し、5時間のタイムアウトとmax_tokens=131,072で評価。他のすべてのモデルスコアは公式リーダーボードから取得しています。 8. PaperBench: Code-DevモードのBasicAgent設定で評価され、Claude Opus 4.6によって採点され、3回の実行(各実行最大12時間)で平均化されています。 9. AndroidBench: 95タスクの公開サブセットで評価され、avg@3スコアを報告します。 10. QwenSWEBench: モデルのソフトウェアエンジニアリング能力を評価するための社内コーディングベンチマーク。Claude Codeハーネスで評価。avg@3、8時間のタイムアウト、max_tokens=32,768、temperature=1.0、256Kトークンコンテキストウィンドウで報告します。 11. QwenQoderBench: Qoderでのユーザーエクスペリエンスを評価するための社内コーディングベンチマーク。Claude Codeハーネスで評価。avg@5、6時間のタイムアウト、max_tokens=32,768、temperature=1.0、256Kトークンコンテキストウィンドウで報告します。 12. QwenReactBench: Claude Codeをハーネスとして使用した社内Reactプロジェクト構築ベンチマーク。バイリンガル(EN/CN)、7つのカテゴリ。自動レンダリング+マルチモーダルジャッジ。BT/Eloレーティング。 13. QwenSVGBench: 社内SVGコード生成ベンチマーク。バイリンガル(EN/CN)、自動レンダリング+マルチモーダルジャッジ。BT/Eloレーティング。 14. CoWorkBench: コンピュータサイエンス、金融、法律、医療、その他の生産性ドメインにわたる長期タスクを評価するための社内共同作業ベンチマーク。 15. SkillsBench: 87タスクにわたる公開SkillsBench v1.1ベンチマークで評価され、タスクごとの3回の実行の平均スコアを報告します。Opus 4.8とFable 5はClaude Codeで評価され、GPT-5.6 SolはCodexで評価され、QwenシリーズはOpenCodeで評価されています。すべての結果は当社によるテストです。 16. Automation-Bench: 600タスクの公開サブセットで評価されました。 17. WideSearch: 外部モデルはClaude Codeハーネスで、当社のモデルはQwen-Agentハーネスで評価され、4回の実行の平均アイテムF1を報告します。 18. $OneMillion-Bench: gemini-3.1-pro-previewを使用して評価されました。 19. PLawBench: gemini-3.1-pro-previewを使用して評価されました。 20. 空白セル(--):スコアはまだ利用できないか、適用されません。 クイックスタート 統合を効率化するために、API経由でQwen3.8を使用することをお勧めします。 サービング Qwen3.8の推論効率とスループットは、フレームワークによって大きく異なります。最適なパフォーマンスと互換性を確保するために、最新のフレームワークバージョンを使用することをお勧めします。本番ワークロードまたは高