HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

GLM-5.3-Flash 知能、パフォーマンス、価格分析

GLM-5.3-Flash Intelligence, Performance and Price Analysis (artificialanalysis.ai)

63 pointsby theanonymousone15 コメント

要約

GLM-5.3-Flashは、Artificial Analysis Intelligence Indexで57という高いスコアを記録し、同クラスのモデルと比較して知能面で平均を大きく上回っています。価格も入力トークンあたり0.15ドル、出力トークンあたり0.50ドルと競争力があり、400kトークンのコンテキストウィンドウをサポートしています。ただし、出力トークン数は中央値と比較して多い傾向があります。

全文翻訳

GLM-5.3-Flash知能、パフォーマンス、価格分析 Artificial Analysis KZ AI • プロプライエタリモデル • 2026年8月リリース GLM-5.3-Flash 知能、パフォーマンス、価格分析 比較 APIプロバイダー ベンチマーク モデル概要 知能 #1 / 17357 Artificial Analysis Intelligence Index 知能で4ユニット中4ユニットを獲得。 速度 N/A 1秒あたりの出力トークン 不明 速度で4ユニット中0ユニットを獲得。 コスト #35 / 173 $0.15 (入力) $0.50 (出力) キャッシュ割引 83% $0.09 知能インデックスタスクあたりのコスト コストで4ユニット中3ユニットを獲得。 冗長性 #55 / 173 150M 知能インデックスからの出力トークン 冗長性で4ユニット中4ユニットを獲得。 比較概要 GLM-5.3-Flashは、知能面で主要なモデルの一つであり、類似価格帯の他のモデルと比較しても価格設定は良好です。このモデルはテキスト入力をサポートし、テキストを出力し、400kトークンのコンテキストウィンドウを備えています。 GLM-5.3-Flashは、Artificial Analysis Intelligence Indexで57を記録し、比較対象モデルの中央値18を大きく上回っています。Intelligence Indexの評価では、150Mトークンを生成しましたが、これは中央値の64Mと比較して非常に冗長です。 GLM-5.3-Flashの価格は、1M入力トークンあたり0.15ドル(中央値0.25ドルと比較して競争力がある)および1M出力トークンあたり0.50ドル(中央値0.90ドルと比較して競争力がある)です。Intelligence IndexでのGLM-5.3-Flashの評価にかかった総費用は138.02ドルでした。 技術仕様 推論 はい このページは、このモデルの推論バージョンを示しています。 推論しないバリアントも存在する可能性があります。 入力モダリティ サポート: テキスト 出力モダリティ サポート: テキスト コンテキストウィンドウ 400k 約600ページ A4サイズ、12pt Arialフォント このクラスの173モデル メトリクスは同じクラスのモデルと比較されます: 推論しないモデル → 推論しないモデルのみと比較 推論モデル → 推論モデルと推論しないモデルの両方で比較 オープンウェイトモデル → 同じサイズクラスの他のオープンウェイトモデルのみと比較: Tiny: ≤4B パラメータ Small: 4B–40B パラメータ Medium: 40B–150B パラメータ Large: >150B パラメータ プロプライエタリモデル → ブレンドされた3:1の入出力価格比を使用して、同じ価格帯のプロプライエタリモデルとオープンウェイトモデルの両方で比較: <0.15ドル/1M トークン 0.15ドル–1ドル/1M トークン >1ドル/1M トークン ハイライト 知能 Artificial Analysis Intelligence Index · 高いほど良い 速度 1秒あたりの出力トークン · 高いほど良い コスト タスクあたりのコスト Intelligence Indexタスクあたりの加重平均コスト(USD) · 低いほど良い 冗長性 プロンプトオプション 知能 Artificial Analysis Intelligence Index 更新済み Agentic Index 更新済み Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.1.1 は9つの評価を含みます: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR 29 / 619 モデル 新規 特定のプロバイダーからモデルを追加 推論モデルは電球アイコンで示されます Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.1.1 には以下が含まれます: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR。 オープンウェイト / プロプライエタリ 推論 / 非推論 テキストのみ / マルチモーダル入力 Artificial Analysis Intelligence Index by Open Weights / Proprietary Artificial Analysis Intelligence Index v4.1.1 は9つの評価を含みます: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR。 29 / 619 モデル 新規 特定のプロバイダーからモデルを追加 プロプライエタリ オープンウェイト (商用利用制限あり) オープンウェイト 推論モデルは電球アイコンで示されます Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.1.1 には以下が含まれます: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR。 オープンウェイト モデルのウェイトが利用可能かどうかを示します。「商用利用制限あり」は、ライセンス条件により商用利用が制限されている場合、「非商用」は、ライセンスが商用利用を禁止している場合です。 ベンチマーク 知能評価 Artificial Analysis によって独立して測定された知能評価 · 高いほど良い コーディング ツール使用 プライベートデータセット ユーザーインタラクション ファイナンス メディカル リーガル インテリジェンスインデックス ロングコンテキスト マルチモーダル 指示追従 忠実性 ライティング ビジネス その他を表示 19 / 24 評価 29 / 619 モデル 新規 特定のプロバイダーからモデルを追加 GDPval-AA v2 Agentic リアルワールドタスク (Elo-500)/2000 𝜏³-Banking 更新済み Agentic ツール使用 Terminal-Bench v2.1 Agentic コーディングとターミナル使用 SciCode コーディング Humanity's Last Exam 更新済み 推論と知識 GPQA Diamond 科学的推論 CritPt 物理学の推論 AA-Omniscience 精度 更新済み 知識 AA-Omniscience 非幻覚率 更新済み 1 - 幻覚率 AA-LCR 更新済み ロングコンテキスト推論 AA-Briefcase Agentic 知識作業、Elo AutomationBench-AA Agentic SaaS ワークフロー Harvey LAB-AA リーガルエージェントワーク、基準達成率 EnterpriseOps-Gym-AA Agentic ビジネスオペレーション AA-Analyst 新規 スプレッドシートとドキュメントの定量的分析 IFBench 指示追従 APEX-Agents-AA ロングホライゾンエージェントタスク ITBench-AA Kubernetes インシデント根本原因分析 MMMU-Pro 視覚的推論 推論モデルは電球アイコンで示されます 知能評価の関連性 モデルの知能は一般的にユースケース全体に翻訳されますが、特定の評価は特定のユースケースにより関連性が高い場合があります。 Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.1.1 には以下が含まれます: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR。 AA-Omniscience AA-Omniscience Index AA-Omniscience Accuracy AA-Omniscience Hallucination Rate AA-Omniscience Index AA-Omniscience Index (高いほど良い) は、知識の信頼性と幻覚を測定します。正解を報酬とし、幻覚を罰し、回答を拒否しても罰はありません。スコアは-100から100の範囲で、0は正解と不正解が同数であることを意味し、負のスコアは不正解が多いことを意味します。 29 / 490 モデル 新規 特定のプロバイダーからモデルを追加 推論モデルは電球アイコンで示されます AA-Omniscience Index AA-Omniscience Index (高いほど良い) は、知識の信頼性と幻覚を測定します。正解を報酬とし、幻覚を罰し、回答を拒否しても罰はありません。スコアは-100から100の範囲で、0は正解と不正解が同数であることを意味し、負のスコアは不正解が多いことを意味します。 インテリジェンスインデックス比較 インテリジェンスインデックス vs. タスクあたりのコスト インテリジェンスインデックス vs. タスクあたりの時間 インテリジェンスインデックス vs. 出力速度 インテリジェンスインデックス vs. エンドツーエンド応答時間 インテリジェンスインデックス vs. Intelligence Index タスクあたりのコスト Artificial Analysis Intelligence Index · Intelligence Index タスクあたりの加重平均コスト 29 / 619 モデル 新規 最も魅力的な象限 パレート線 Z AIMeta OpenAI NVIDIA DeepSeek Google Anthropic SpaceXAI Kimi MiniMax Xiaomi Tencent Upstage Thinking Machines Alibaba 推論モデルは電球アイコンで示されます Intelligence Index タスクあたりのコスト Intelligence Index タスクあたりの加重平均コスト。各評価のコストは、入力、キャッシュヒット、キャッシュ書き込み、推論、回答トークンの価格から計算され、タスク数で割られ、Intelligence Indexの重みで加重されます。 Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.1.1 は9つの評価を含みます: GDPval-AA v2, 𝜏³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR。 トークン使用量 タスクあたりの出力トークン インテリジェンスインデックス vs. タスクあたりの出力トークン インテリジェンスインデックス トークン使用量 インテリジェンスインデックス vs. トークン使用量 出力トークン