HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Stepfun Step 5 Preview (LLM): AA Pareto frontierについて

Stepfun Step 5 Preview (LLM): On AA Pareto frontier (artificialanalysis.ai)

8 pointsby AnodicElegy2 コメント

要約

「Step 5 Preview」は、2026年9月にリリースされたArtificial AnalysisのプロプライエタリなLLMです。このモデルは、知能指数(Intelligence Index)で44/20044という高いスコアを記録し、平均を上回る知能と、同価格帯のモデルと比較して良好な価格設定が特徴です。また、平均よりも高速ですが、非常に冗長な出力傾向があります。テキストと画像の入力をサポートし、1Mトークンのコンテキストウィンドウを備えています。

全文翻訳

Artificial Analysis KStepFun • プロプライエタリモデル • 2026年9月リリース Step 5 Preview 知能・パフォーマンス・価格分析 比較 試してみる APIプロバイダー ベンチマーク モデル概要 知能 更新済み #25 / 20044 Artificial Analysis Intelligence Index 知能で4ユニット中4ユニット 速度 #41 / 20099.8 1秒あたりの出力トークン数 速度で3ユニット中4ユニット コスト #27 / 200 $1.00(入力) / $2.70(出力) キャッシュ割引 95% $0.71 知能指数タスクあたりのコスト コストで2ユニット中4ユニット 冗長性 #65 / 200160M 知能指数からの出力トークン数 冗長性で4ユニット中4ユニット 比較概要 Step 5 Previewは、知能においては主要なモデルの1つであり、同価格帯の他のモデルと比較して価格も良好です。平均よりも高速ですが、非常に冗長です。このモデルは、テキストと画像入力をサポートし、テキストを出力し、1Mトークンのコンテキストウィンドウを備えています。 Step 5 Previewは、Artificial Analysis Intelligence Indexで44を記録し、比較可能なモデルの中央値25を大きく上回っています。Intelligence Indexの評価では160Mトークンを生成しましたが、これは中央値の90Mと比較して非常に冗長です。 Step 5 Previewの価格は、1M入力トークンあたり$1.00(競争力のある価格設定、中央値:$1.88)、1M出力トークンあたり$2.70(競争力のある価格設定、中央値:$10.00)です。Intelligence Indexの評価にかかった総費用は$918.34でした。 1秒あたり100トークンで、Step 5 Previewは平均(65)よりも高速です。 技術仕様 推論 はい このページは、このモデルの推論バージョンを示しています。 推論しないバリアントも存在する可能性があります。 入力モダリティ サポート: テキストと画像 出力モダリティ サポート: テキスト コンテキストウィンドウ 1M 約1500枚のA4用紙(サイズ12、Arialフォント) 200モデルはこのクラスに属します。 メトリクスは同じクラスのモデルと比較されます。 非推論モデル → 他の非推論モデルとのみ比較 推論モデル → 推論・非推論の両方と比較 オープンウェイトモデル → 同じサイズクラスの他のオープンウェイトモデルとのみ比較: Tiny: ≤4Bパラメータ Small: 4B–40Bパラメータ Medium: 40B–150Bパラメータ Large: >150Bパラメータ プロプライエタリモデル → 同じ価格帯のプロプライエタリおよびオープンウェイトモデル全体で比較。入力/出力価格比3:1のブレンドを使用: <$0.15 / 1Mトークン $0.15–$1 / 1Mトークン >$1 / 1Mトークン ハイライト 更新済み 知能 Artificial Analysis Intelligence Index · 高いほど良い 速度 1秒あたりの出力トークン数 · 高いほど良い コスト タスクあたりのコスト 加重平均コスト(USD)/ 知能指数タスク · 低いほど良い プロンプトオプション 知能 更新済み Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.3は、10の評価を含みます。 AA-Briefcase, GDPval-AA v2, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1 653モデル中27モデル 特定のプロバイダーからモデルを追加 Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.3には、AA-Briefcase, GDPval-AA v2, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1が含まれます。各評価と実行方法の詳細については、Intelligence Index methodologyを参照してください。 プロプライエタリ オープンウェイト(商用利用制限あり) オープンウェイト Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.3には、AA-Briefcase, GDPval-AA v2, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1が含まれます。各評価と実行方法の詳細については、Intelligence Index methodologyを参照してください。 オープンウェイト モデルのウェイトが利用可能かどうかを示します。商用利用が条件付きで制限されているモデルは「商用利用制限あり」と表示され、ライセンスが商用利用を禁止しているモデルは「非商用」と表示されます。 機能インデックス 特定の機能や業界におけるモデルのパフォーマンスを測定します。 金融・会計 戦略・オペレーション 法務 エンジニアリング 経済学 Artificial Analysis Finance & Accounting Index 7つの評価を含みます。 AA-Omniscience, GDPval-AA v2, AA-Briefcase, Humanity's Last Exam, AutomationBench-AA, AA-LCR v1.1, GDP.pdf · 高いほど良い 161モデル中26モデル 特定のプロバイダーからモデルを追加 ベンチマーク 知能評価 Artificial Analysisによって独立して測定された知能評価 · 高いほど良い コーディング エージェント ツールの使用 プライベートデータセット ユーザーインタラクション 金融 医療 法務 知能指数 長コンテキスト マルチモーダル 指示追従 忠実度 ライティング ビジネス その他を見る 26の評価中18 653モデル中27モデル 特定のプロバイダーからモデルを追加 AA-Briefcase エージェント型知識業務(Elo-500)/2000 GDPval-AA v2 エージェント型実世界タスク(Elo-500)/2000 AutomationBench-AA 更新済み エージェント型SaaSワークフロー Terminal-Bench 4.0 新規 エージェント型コーディング&ターミナル使用 SciCode コーディング Humanity's Last Exam 推論と知識 GDP.pdf 新規 プロフェッショナル文書推論、全合格 CritPt 物理学推論 AA-Omniscience Accuracy 知識 AA-Omniscience Non-Hallucination Rate 1 - ハルシネーション率 AA-LCR v1.1 長コンテキスト推論 Harvey LAB-AA 法務エージェント業務、基準合格率 EnterpriseOps-Gym-AA エージェント型ビジネスオペレーション AA-Analyst スプレッドシートとドキュメントの定量的分析 𝜏³-Banking エージェント型ツール使用 ITBench-AA Kubernetesインシデント根本原因分析 MMMU-Pro 視覚的推論 MLCR-AA 新規 医療長コンテキスト推論 知能評価の関連性 モデルの知能は一般的にユースケース全体に翻訳されますが、特定の評価は特定のユースケースにより関連性が高い場合があります。 Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.3には、AA-Briefcase, GDPval-AA v2, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1が含まれます。各評価と実行方法の詳細については、Intelligence Index methodologyを参照してください。 AA-Briefcase AA-Briefcase Elo AA-Briefcase Rubric Score (%) Analytical Quality & Presentation Elo AA-Briefcase Elo AA-Briefcase Eloは、ルーブリック合格率、分析品質Elo、プレゼンテーションEloを統合した複合メトリックです · 高いほど良い 170モデル中27モデル 特定のプロバイダーからモデルを追加 AA-Briefcase Elo AA-Briefcase Eloは、分析品質Elo、プレゼンテーションElo、ルーブリック合格率を統合した複合メトリックであり、ルーブリックパフォーマンスは合成ヘッドツーヘッドマッチを通じてEloに変換されます。Eloおよび95%信頼区間は0にクランプされます。 AA-Omniscience AA-Omniscience Index AA-Omniscience Accuracy AA-Omniscience Hallucination Rate AA-Omniscience Index AA-Omniscience Index(高いほど良い)は、知識の信頼性とハルシネーションを測定します。正解を報酬とし、ハルシネーションを罰し、回答を拒否しても罰はありません。スコアは-100から100の範囲で、0は正解と不正解が同数であることを意味し、負のスコアは不正解の方が多いことを意味します。 528モデル中27モデル 特定のプロバイダーからモデルを追加 AA-Omniscience Index AA-Omniscience Index(高いほど良い)は、知識の信頼性とハルシネーションを測定します。正解を報酬とし、ハルシネーションを罰し、回答を拒否しても罰はありません。スコアは-100から100の範囲で、0は正解と不正解が同数であることを意味し、負のスコアは不正解の方が多いことを意味します。 知能指数比較 知能指数 vs. タスクあたりのコスト 知能指数 vs. タスクあたりの時間 知能指数 vs. 出力速度 知能指数 vs. エンドツーエンド応答時間 知能指数 vs. 知能指数タスクあたりのコスト Artificial Analysis Intelligence Index