HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Qwen3.8-Flash-Next 知能、パフォーマンス、価格分析

Qwen3.8-Flash-Next Intelligence, Performance and Price Analysis (artificialanalysis.ai)

10 pointsby theanonymousone3 コメント

要約

Qwen3.8-Flash-Nextは、同サイズのオープンウェイトモデルと比較して、知能と価格の面で優れた性能を発揮するモデルです。平均よりも高速ですが、非常に冗長な出力を行います。このモデルはテキスト、画像、ビデオ入力をサポートし、256kトークンのコンテキストウィンドウを備えています。

全文翻訳

Artificial Analysis KAlibaba•オープンウェイトモデル•2026年8月リリース Qwen3.8-Flash-Next 知能、パフォーマンス、価格分析 APIプロバイダーのベンチマークを比較 モデル概要 知能 #4 / 11056 Artificial Analysis 知能指数 知能で4ユニット中4ユニット 速度 #22 / 11073.5 1秒あたりの出力トークン数 速度で4ユニット中3ユニット コスト $0.00 $0.00 N/A 知能指数タスクあたりのコスト コストで4ユニット中不明 冗長性 #40 / 110200M 知能指数からの出力トークン数 冗長性で4ユニット中4ユニット 比較概要 Qwen3.8-Flash-Nextは、知能において主要なモデル群に属し、同サイズの他のオープンウェイトモデルと比較して価格も良好です。平均よりも高速ですが、非常に冗長です。このモデルはテキスト、画像、ビデオ入力をサポートし、テキストを出力し、256kトークンのコンテキストウィンドウを備えています。 Qwen3.8-Flash-Nextは、Artificial Analysis 知能指数で56点を獲得し、比較対象モデルの中央値28点を大きく上回っています。知能指数を評価する際、1億1000万トークンの中央値と比較して非常に冗長な2億トークンを生成しました。 Qwen3.8-Flash-Nextの価格は、100万入力トークンあたり0.00ドル(中央値0.30ドルと比較して競争力のある価格設定)および100万出力トークンあたり0.00ドル(中央値1.17ドルと比較して競争力のある価格設定)です。 1秒あたり74トークンという速度で、Qwen3.8-Flash-Nextは平均(65)よりも高速です。 技術仕様 推論 はい このページは、このモデルの推論バージョンを示しています。 推論しないバリアントも存在する可能性があります。 入力モダリティ サポート: テキスト、画像、ビデオ 出力モダリティ サポート: テキスト コンテキストウィンドウ 256k ~384 A4サイズ(Arialフォント12ポイント)のページ 総パラメータ数 180B アクティブパラメータ数 6B 推論中にトークンごとにアクティブなパラメータ数 ライセンス Qwen Community License 1.0 モデルウェイト Hugging Face このクラスの110モデル メトリクスは、同じクラスのモデルと比較されます。 推論しないモデル → 推論しない他のモデルとのみ比較 推論モデル → 推論モデルと推論しないモデルの両方で比較 オープンウェイトモデル → 同じサイズクラスの他のオープンウェイトモデルとのみ比較 Tiny: ≤4Bパラメータ Small: 4B–40Bパラメータ Medium: 40B–150Bパラメータ Large: >150Bパラメータ プロプライエタリモデル → プロプライエタリモデルとオープンウェイトモデルを、入力と出力の価格比を3:1でブレンドした価格帯で比較 <0.15ドル/100万トークン 0.15ドル–1ドル/100万トークン >1ドル/100万トークン ハイライト 知能 Artificial Analysis 知能指数 · 高いほど良い 速度 1秒あたりの出力トークン数 · 高いほど良い コスト タスクあたりのコスト 知能指数タスクあたりの加重平均コスト(USD) · 低いほど良い プロンプトオプション 知能 Artificial Analysis 知能指数 エージェントインデックス Artificial Analysis 知能指数 Artificial Analysis 知能指数 v4.1.1には、9つの評価が含まれています: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR 623モデル中29モデル 特定のプロバイダーからモデルを追加 推論モデルは電球アイコンで示されます Artificial Analysis 知能指数 Artificial Analysis 知能指数 v4.1.1には、GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCRが含まれます。各評価の詳細と実行方法については、知能指数方法論を参照してください。 オープンウェイト / プロプライエタリ 推論 / 非推論 テキストのみ / マルチモーダル入力 Artificial Analysis 知能指数(オープンウェイト / プロプライエタリ別) Artificial Analysis 知能指数 v4.1.1には、9つの評価が含まれています: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR 623モデル中29モデル 特定のプロバイダーからモデルを追加 プロプライエタリ オープンウェイト(商用利用制限あり) オープンウェイト 推論モデルは電球アイコンで示されます Artificial Analysis 知能指数 Artificial Analysis 知能指数 v4.1.1には、GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCRが含まれます。各評価の詳細と実行方法については、知能指数方法論を参照してください。 オープンウェイト モデルウェイトが利用可能かどうかを示します。「商用利用制限あり」は、商用利用が条件によって制限されている場合、「非商用」は、ライセンスが商用利用を禁止している場合を示します。 ベンチマーク 知能評価 Artificial Analysis による独立した知能評価 · 高いほど良い コーディング ツール使用 プライベートデータセット ユーザーインタラクション ファイナンス メディカル リーガル 知能指数 長コンテキスト マルチモーダル 指示追従 忠実性 ライティング ビジネス その他多数 評価の19/24 623モデル中29モデル 特定のプロバイダーからモデルを追加 GDPval-AA v2 エージェントによる実世界のタスク(Elo-500)/2000 𝜏³-Banking エージェントによるツール使用 Terminal-Bench v2.1 エージェントによるコーディングとターミナル使用 SciCode コーディング Humanity's Last Exam 推論と知識 GPQA Diamond 科学的推論 CritPt 物理学の推論 AA-Omniscience 知識 AA-Omniscience 非幻覚率 1 - 幻覚率 AA-LCR 長コンテキスト推論 AA-Briefcase エージェントによる知識作業、Elo AutomationBench-AA エージェントによるSaaSワークフロー Harvey LAB-AA リーガルエージェントの作業、基準達成率 EnterpriseOps-Gym-AA エージェントによるビジネスオペレーション AA-Analyst 新しい スプレッドシートとドキュメントの定量的分析 IFBench 指示追従 APEX-Agents-AA 長期間のエージェントタスク ITBench-AA Kubernetesインシデントの原因究明 MMMU-Pro 視覚的推論 推論モデルは電球アイコンで示されます 知能評価の関連性 モデルの知能は一般的にユースケース全体に翻訳されますが、特定の評価は特定のユースケースにより関連性が高い場合があります。 Artificial Analysis 知能指数 Artificial Analysis 知能指数 v4.1.1には、GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCRが含まれます。各評価の詳細と実行方法については、知能指数方法論を参照してください。 AA-Omniscience AA-Omniscience指数 AA-Omniscience 精度 AA-Omniscience 幻覚率 AA-Omniscience指数 AA-Omniscience指数(高いほど良い)は、知識の信頼性と幻覚を測定します。正解を報酬とし、幻覚を罰し、回答を拒否することにペナルティはありません。スコアは-100から100の範囲で、0は正解と不正解が同数であることを意味し、負のスコアは不正解が多いことを意味します。 494モデル中29モデル 特定のプロバイダーからモデルを追加 推論モデルは電球アイコンで示されます AA-Omniscience指数 AA-Omniscience指数(高いほど良い)は、知識の信頼性と幻覚を測定します。正解を報酬とし、幻覚を罰し、回答を拒否することにペナルティはありません。スコアは-100から100の範囲で、0は正解と不正解が同数であることを意味し、負のスコアは不正解が多いことを意味します。 オープンネス指数 オープンネス指数 オープンネス指数の構成要素 オープンネス対知能 Artificial Analysis オープンネス指数: スコア オープンネス指数は、0から100の正規化されたスケールでモデルのオープンさを評価します(高いほどオープン)。 311モデル中19モデル 特定のプロバイダーからモデルを追加 推論モデルは電球アイコンで示されます 知能指数比較 知能指数対タスクあたりのコスト 知能指数対タスクあたりの時間 知能指数対出力速度 知能指数対エンドツーエンド応答時間 知能指数対知能指数タスクあたりのコスト Artificial Analysis 知能指数 · Artificial Analysis 知能指数タスクあたりの加重平均コスト(USD) 623モデル中29モデル 最も魅力的な象限 パレート線 Meta OpenAI NVIDIA DeepSeek Google Anthropic SpaceX AIZ AI Kimi Alibaba MiniMax Xiaomi Thinking Machines Tencent 推論モデルは電球アイコンで示されます 知能指数タスクあたりのコスト 知能指数タスクあたりの加重平均コスト。各評価のコストは、入力、キャッシュヒット、キャッシュ書き込み、推論、回答トークンの価格から計算され、タスク数で割られ、知能指数の重みで加重されます。