HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Qwen/Qwen3.8-2.4T-A95B: 新世代オープンモデルの登場

Qwen/Qwen3.8-2.4T-A95B (huggingface.co)

689 pointsby Philpax159 コメント

要約

Qwen3.8は、Qwenオープンモデルファミリーの最新かつ最も高性能な世代です。コーディング、専門業務、研究、長期的なエージェントタスクにおいて大幅な性能向上を実現し、Qwen-Maxクラスのモデルが初めてオープンリリースされました。このモデルは、2.4兆のパラメータを持ち、最大1Mトークンのコンテキスト長をサポートし、より信頼性の高い複雑なタスク実行を目指しています。

全文翻訳

Qwen3.8-2.4T-A95B このリポジトリには、Hugging Face Transformersフォーマットのポストトレーニング済みモデルのモデルウェイトと設定ファイルが含まれています。これらの成果物は、vLLM、SGLang、TokenSpeedなどと互換性があります。インフラストラクチャのメンテナンスなしで、管理されスケーラブルな推論を求めるユーザーのために、公式Qwen APIサービスがQwen Cloudによって提供されています。特に、Qwen3.8-Maxは、ビジョン入力とノンシンキングサポート、デフォルトで1Mのコンテキスト長、公式の組み込みツールなどの追加機能を備えた、Qwen3.8-2.4T-A95Bに基づいた公式バージョンです。詳細については、Qwen3.8-Maxの概要を参照してください。 Qwen3.5およびQwen3.6シリーズの広範なコミュニティ採用に続き、Qwenオープンモデルファミリーの現時点で最も有能な世代であるQwen3.8を発表できることを嬉しく思います。Qwen3.8は、初めてQwen-Maxクラスのモデルをオープンリリースにもたらします。Qwen3.5のアーキテクチャ基盤上に構築されたQwen3.8は、コーディング、専門業務、研究、および長期的なエージェントタスク全体で大幅な進歩をもたらします。より難しい質問に答えるだけでなく、Qwen3.8は、より高い信頼性で複雑で多段階のタスクを完了できるように設計されています。 Qwen3.8のハイライト Qwen3.8は以下の強化機能を備えています。 コア機能:コーディング、専門業務、研究、および長期的なエージェントタスク全体にわたる包括的な改善。 エージェント実行:より強力な自律計画と環境フィードバックのより良い処理により、エンドツーエンドのタスク完了の信頼性が向上。 下流互換性:一般的なハーネスや開発ツールへのサポートが拡大され、既存のスタックへの統合が容易に。 柔軟な思考制御:reasoning_effortで推論の深さを調整でき、preserve_thinkingを介して過去のメッセージからの推論コンテキストが保持されます。詳細については、ブログ記事Qwen3.8-Maxを参照してください。 モデル概要 タイプ:Causal Language Model トレーニングステージ:事前トレーニング&ポストトレーニング 言語モデル パラメータ数:合計2.4T、アクティブなのは95B 隠れ次元:8192 トークン埋め込み:248,320(パディング済み) レイヤー数:92 隠れレイアウト:23 × (3 × (Gated DeltaNet → MoE) → 1 × (Gated Attention → MoE)) Gated DeltaNet: 線形アテンションヘッド数:Vに128、QKに16 ヘッド次元:128 Gated Attention: アテンションヘッド数:Qに64、KVに4 ヘッド次元:256 ロータリー位置埋め込み次元:64 Mixture of Experts: エキスパート数:512 アクティブなエキスパート数:10ルーティング + 1共有エキスパート 中間次元:2048 LM出力:248,320(パディング済み) MTP(Multi-Token Prediction):複数ステップでトレーニング済み コンテキスト長:ネイティブで262,144、最大1,010,000トークンまで拡張可能。 ベンチマーク結果 Opus 4.8Fable 5GPT 5.6 Sol (max)Qwen3.7-MaxQwen3.8-Max コーディングエージェント Terminal Bench 2.1 84.6 84.6 88.8 74.5 86.6 SWE-bench Pro 69.2 80.0 64.6 60.6 67.7 DeepSWE 1.1 59.0 70.0 73.0 21.6 56.6 NL2Repo-Bench 69.4 -- -- 47.2 55.9 FrontierSWE 70.0 88.8 -- 40.7 73.5 MLS-Bench-Lite 42.8 49.9 46.2 31.7 41.0 PaperBench 80.3 88.8 90.5 64.8 93.0 AndroidBench 69.8 84.5 74.0 56.5 75.1 QwenSWEBench 84.0 86.3 73.5 63.4 80.7 QwenQoderBench 62.7 63.1 53.8 36.8 58.4 QwenReactBench 1694 1770 1564 1538 1724 QwenSVGBench 1648 1690 1758 1499 1713 一般エージェント CoWorkBench 72.3 75.9 71.5 64.6 74.8 WorkSpaceBench 66.8 68.7 65.6 61.4 67.7 JobBench 48.4 57.4 45.4 31.3 53.4 SkillsBench 65.1 70.9 73.5 61.2 70.2 Agents' Last Exam (Pass / Score) 27.0 / 45.1 -- / -- 30.6 / 53.6 11.8 / 31.1 27.0 / 52.4 Automation-Bench (Pass@1) 27.2 29.1 29.7 14.2 27.3 Toolathlon Verified (Pass@1) 76.2 77.9 74.9 49.7 72.5 WideSearch 72.9 81.2 -- 75.2 81.9 HLE w/ tools 57.9 64.5 58.0 53.5 56.2 一般機能 GPQA Diamond 92.0 92.6 94.1 92.4 92.6 HLE 45.7 53.3 47.2 41.4 43.6 IFBench 62.2 63.5 72.7 79.1 82.8 $OneMillion-Bench (expert score) 41.8 55.9 53.8 44.4 52.5 HealthBench 52.4 -- 55.3 54.5 60.2 PLawBench 69.6 70.2 72.3 58.9 73.2 PRBench-Legal 52.7 57.6 57.6 48.5 57.6 PRBench-Finance 51.9 55.8 55.5 46.8 58.3 MRCR v2 256K (8-needle) 83.2 -- 93.8 86.7 92.9 LongBench v2 69.1 -- 67.1 65.3 66.3 1. Fable5の結果にはフォールバックが含まれる場合があります。 2. Terminal Bench 2.1: Claude Code (avg@10)、5時間のタイムアウト、max_tokens=131,072で評価。他のすべてのモデルについては、ハーネス全体で公開されている最高のスコアを報告します:Claude Opus 4.8およびClaude Fable 5はArtificial Analysis (https://artificialanalysis.ai/evaluations/terminalbench-v2-1) のTerminus 2を使用;GPT-5.6 SolはCodex (https://openai.com/index/previewing-gpt-5-6-sol/) を使用。 3. SWE-bench Pro: Claude Codeハーネス、temp=1.0、top_p=0.95、256Kコンテキストウィンドウで評価。問題のあるタスクは修正され、すべてのベースラインは改良されたベンチマークで評価されました。 4. DeepSWE 1.1: Claude Codeおよびmini-SWE-agentハーネス、temp=1.0、top_p=0.95、256Kコンテキストウィンドウで評価。両方のハーネスの中で最も高いスコアを報告します。特に、Qwen3.8-MaxはClaude Codeで最高のパフォーマンスを発揮します。 5. NL2Repo-Bench: Claude Codeハーネスで評価。報酬ハッキングを防ぐため、pip download、pip install、git cloneなどのリポジトリにアクセスしようとするBashコマンドは無効にしています。 6. FrontierSWE: Claude Codeハーネスで評価。利用可能な他のすべてのMEAN@5結果は、2026年8月3日時点の公式FrontierSWEリーダーボード (https://www.frontierswe.com) から取得しています。優位性スコアは、公式評価スクリプトを使用して生スコアから再計算されます。「--」は、その日付時点で公式のMEAN@5結果が利用できなかったことを示します。 7. MLS-Bench-Lite: Claude Codeを使用し、5時間のタイムアウトとmax_tokens=131,072で評価。他のすべてのモデルスコアは公式リーダーボードから取得しています。 8. PaperBench: Code-DevモードのBasicAgent設定で評価され、Claude Opus 4.6によって採点され、3回の実行(各実行最大12時間)で平均化されています。 9. AndroidBench: 95タスクの公開サブセットで評価され、avg@3スコアを報告します。 10. QwenSWEBench: モデルのソフトウェアエンジニアリング能力を評価するための社内コーディングベンチマーク。Claude Codeハーネスで評価。8時間のタイムアウト、max_tokens=32,768、temperature=1.0、256Kトークンコンテキストウィンドウでavg@3を報告します。 11. QwenQoderBench: Qoderでのユーザーエクスペリエンスを評価するための社内コーディングベンチマーク。Claude Codeハーネスで評価。6時間のタイムアウト、max_tokens=32,768、temperature=1.0、256Kトークンコンテキストウィンドウでavg@5を報告します。 12. QwenReactBench: Claude Codeをハーネスとして使用した社内Reactプロジェクト構築ベンチマーク。バイリンガル(EN/CN)、7つのカテゴリ。自動レンダリング+マルチモーダルジャッジ。BT/Eloレーティング。 13. QwenSVGBench: 社内SVGコード生成ベンチマーク。バイリンガル(EN/CN)、自動レンダリング+マルチモーダルジャッジ。BT/Eloレーティング。 14. CoWorkBench: コンピュータサイエンス、金融、法律、医療、その他の生産性ドメインにわたる長期タスクを評価するための社内共同作業ベンチマーク。 15. SkillsBench: 87タスクにわたる公開SkillsBench v1.1ベンチマークで評価され、タスクごとの3回の実行の平均スコアを報告します。Opus 4.8とFable 5はClaude Codeで評価され、GPT-5.6 SolはCodexで評価され、QwenシリーズはOpenCodeで評価されます。すべての結果は当社のテストによるものです。 16. Automation-Bench: 600タスクの公開サブセットで評価されました。 17. WideSearch: 外部モデルはClaude Codeハーネスで、当社のモデルはQwen-Agentハーネスで評価され、4回の実行の平均アイテムF1を報告します。 18. $OneMillion-Bench: gemini-3.1-pro-previewを使用して評価されました。 19. PLawBench: gemini-3.1-pro-previewを使用して評価されました。 20. 空白セル(--):スコアはまだ利用できないか、適用できません。 クイックスタート 統合を簡素化するために、API経由でQwen3.8を使用することをお勧めします。 サービング Qwen3.8の推論効率とスループットは、フレームワークによって大きく異なります。最適なパフォーマンスと互換性を確保するために、最新のフレームワークバージョンを使用することをお勧めします。本番ワークロードまたは高スループットのシナリオでは、SGLang、vLLM、またはTokenSpeedなどの専用サービングエンジンが推奨されます。 Qwen3.8は、一般的な推論フレームワークでデプロイできます。例:SGLang:Qwen3