HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Qwen3.8 27B、Artificial Analysisで52点を獲得

Qwen3.8 27B scores 52 on Artificial Analysis (artificialanalysis.ai)

257 pointsby anana_114 コメント

要約

AlibabaのオープンウェイトモデルQwen3.8 27Bが、Artificial Analysisのインテリジェンスインデックスで52点を獲得し、同サイズの他のオープンウェイトモデルと比較して高い知能と優れた価格性能を示しました。このモデルはテキストと画像の入力をサポートし、256kトークンのコンテキストウィンドウを備えています。

全文翻訳

Artificial AnalysisKAlibaba•オープンウェイトモデル•2026年8月リリース Qwen3.8 27B 知能、パフォーマンス、価格分析 比較 APIプロバイダー ベンチマーク モデル概要 知能 #1 / 13552 Artificial Analysis インテリジェンスインデックス 知能の4つのユニット中4つを獲得。 スピード N/A 1秒あたりの出力トークン スピードの4つのユニット中不明。 コスト $0.00 $0.00 N/A インテリジェンスインデックスタスクあたりのコスト コストの4つのユニット中不明。 冗長性 #23 / 135160M インテリジェンスインデックスからの出力トークン 冗長性の4つのユニット中4つを獲得。 比較概要 Qwen3.8 27Bは、知能において主要モデルの一つであり、同サイズの他のオープンウェイトモデルと比較して価格も優れています。このモデルはテキストと画像の入力をサポートし、テキストを出力し、256kトークンのコンテキストウィンドウを備えています。 Qwen3.8 27BはArtificial Analysisインテリジェンスインデックスで52点を獲得し、比較対象モデルの中央値9点を大きく上回っています。インテリジェンスインデックスの評価では、160Mトークンを生成し、中央値の43Mと比較して非常に冗長でした。 Qwen3.8 27Bの価格は、1M入力トークンあたり$0.00(競争力のある価格、中央値:$0.04)、1M出力トークンあたり$0.00(競争力のある価格、中央値:$0.15)です。 技術仕様 推論 はい このページは、このモデルの推論バージョンを示しています。 推論しないバリアントも存在する可能性があります。 入力モダリティ サポート: テキストと画像 出力モダリティ サポート: テキスト コンテキストウィンドウ 256k ~384 A4ページ(12ポイントArialフォントサイズ) 総パラメータ数 27B ライセンス Apache 2.0 モデルウェイト Hugging Face このクラスの135モデル メトリクスは同じクラスのモデルと比較されます: 推論しないモデル → 推論しないモデルのみと比較 推論モデル → 推論モデルと推論しないモデルの両方で比較 オープンウェイトモデル → 同サイズのクラスのオープンウェイトモデルのみと比較: Tiny: ≤4Bパラメータ Small: 4B–40Bパラメータ Medium: 40B–150Bパラメータ Large: >150Bパラメータ プロプライエタリモデル → プロプライエタリモデルとオープンウェイトモデルを同じ価格帯で比較、入力と出力の価格比を3:1でブレンド: <$0.15/1Mトークン $0.15–$1/1Mトークン >$1/1Mトークン ハイライト 知能 Artificial Analysis インテリジェンスインデックス · 高いほど良い スピード 1秒あたりの出力トークン · 高いほど良い コスト タスクあたりのコスト インテリジェンスインデックスタスクあたりの加重平均コスト(USD) · 低いほど良い プロンプトオプション 知能 Artificial Analysis インテリジェンスインデックス 更新済み エージェントインデックス 更新済み Artificial Analysis インテリジェンスインデックス Artificial Analysis インテリジェンスインデックス v4.1.1には、9つの評価が含まれています: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR 29 / 609モデル NEWモデルを追加 推論モデルは電球アイコンで示されます Artificial Analysis インテリジェンスインデックス Artificial Analysis インテリジェンスインデックス v4.1.1には、GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCRが含まれます。詳細については、インテリジェンスインデックスの方法論を参照してください。これには、各評価の内訳と実行方法が含まれます。 オープンウェイト / プロプライエタリ 推論 / 非推論 テキストのみ / マルチモーダル入力 Artificial Analysis インテリジェンスインデックス(オープンウェイト / プロプライエタリ別) Artificial Analysis インテリジェンスインデックス v4.1.1には、9つの評価が含まれています: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR 29 / 609モデル NEWモデルを追加 プロプライエタリ オープンウェイト(商用利用制限あり) オープンウェイト 推論モデルは電球アイコンで示されます Artificial Analysis インテリジェンスインデックス Artificial Analysis インテリジェンスインデックス v4.1.1には、GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCRが含まれます。詳細については、インテリジェンスインデックスの方法論を参照してください。 オープンウェイト モデルウェイトが利用可能かどうかを示します。「商用利用制限あり」とラベル付けされているモデルは、ウェイトは利用可能ですが、商用利用が制限されています(通常、有料ライセンスの取得が必要です)。 ベンチマーク 知能評価 Artificial Analysis による独立した知能評価 · 高いほど良い コーディング ツール使用 長コンテキスト マルチモーダル 指示追従 忠実性 ライティング ユーザーインタラクション ビジネス ファイナンス 法律 メディカル その他19 / 23評価 29 / 609モデル NEWモデルを追加 GDPval-AA v2 エージェントによる実世界のタスク(Elo-500)/2000 𝜏³-Banking 更新済み エージェントのツール使用 Terminal-Bench v2.1 エージェントのコーディングとターミナル使用 SciCode コーディング Humanity's Last Exam 更新済み 推論と知識 GPQA Diamond 科学的推論 CritPt 物理学の推論 AA-Omniscience 精度 更新済み 知識 AA-Omniscience 非幻覚率 更新済み 1 - 幻覚率 AA-LCR 更新済み 長コンテキスト推論 AA-Briefcase エージェントによる知識作業、Elo AutomationBench-AA エージェントによるSaaSワークフロー Harvey LAB-AA エージェントによる法的作業、基準達成率 EnterpriseOps-Gym-AA エージェントによるビジネスオペレーション AA-Analyst 新規 表計算ソフトとドキュメントの定量的分析 IFBench 指示追従 APEX-Agents-AA 長期間のエージェントタスク ITBench-AA Kubernetesインシデントの根本原因分析 MMMU-Pro 視覚的推論 推論モデルは電球アイコンで示されます 知能評価の関連性 モデルの知能は一般的にユースケース全体に翻訳されますが、特定の評価は特定のユースケースにより関連性が高い場合があります。 Artificial Analysis インテリジェンスインデックス Artificial Analysis インテリジェンスインデックス v4.1.1には、GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCRが含まれます。詳細については、インテリジェンスインデックスの方法論を参照してください。 AA-Omniscience AA-Omniscience Index AA-Omniscience Accuracy AA-Omniscience Hallucination Rate AA-Omniscience Index AA-Omniscience Index(高いほど良い)は、知識の信頼性と幻覚を測定します。正解を評価し、幻覚を罰し、回答を拒否してもペナルティはありません。スコアは-100から100の範囲で、0は正解と不正解が同数であることを意味し、負のスコアは不正解が多いことを意味します。 29 / 480モデル NEWモデルを追加 推論モデルは電球アイコンで示されます AA-Omniscience Index AA-Omniscience Index(高いほど良い)は、知識の信頼性と幻覚を測定します。正解を評価し、幻覚を罰し、回答を拒否してもペナルティはありません。スコアは-100から100の範囲で、0は正解と不正解が同数であることを意味し、負のスコアは不正解が多いことを意味します。 オープンネスインデックス オープンネスインデックス オープンネスインデックスの構成要素 オープンネス対知能 Artificial Analysis オープンネスインデックス: スコア オープンネスインデックスは、0から100の正規化されたスケールでモデルのオープンネスを評価します(高いほどオープン)。 20 / 306モデル NEWモデルを追加 推論モデルは電球アイコンで示されます インテリジェンスインデックスの比較 インテリジェンスインデックス対タスクあたりのコスト インテリジェンスインデックス対タスクあたりの時間 インテリジェンスインデックス対出力スピード インテリジェンスインデックス対エンドツーエンド応答時間 インテリジェンスインデックス対インテリジェンスインデックスタスクあたりのコスト Artificial Analysis インテリジェンスインデックス Artificial Analysis インテリジェンスインデックスタスクあたりの加重平均コスト(USD) 29 / 609モデル 最も魅力的な象限 パレート線 Google Anthropic Z AI DeepSeek SpaceX AI Kimi NVIDIA Meta OpenAI Alibaba Mistral 推論モデルは電球アイコンで示されます タスクあたりのコスト インテリジェンスインデックスタスクあたりの加重平均コスト。各評価のコストは、入力、キャッシュヒット、キャッシュ書き込み、推論、回答トークンの価格から計算され、タスク数で割られ、インテリジェンスインデックスの重み付けがされます。 Artificial Analysis インテリジェンスインデックス Artificial Analysis インテリジェンスインデックス v4.1.1には、GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCRが含まれます。詳細については、インテリジェンスインデックスの方法論を参照してください。