AI・機械学習
Stepfun Step 5 Preview (LLM): AA Pareto frontierについて
Stepfun Step 5 Preview (LLM): On AA Pareto frontier (artificialanalysis.ai)
要約
「Step 5 Preview」は、2026年9月にリリースされたArtificial AnalysisのプロプライエタリなLLMです。このモデルは、知能指数(Intelligence Index)で44/20044という高いスコアを記録し、平均を上回る知能と、同価格帯のモデルと比較して良好な価格設定が特徴です。また、平均よりも高速ですが、非常に冗長な出力傾向があります。テキストと画像の入力をサポートし、1Mトークンのコンテキストウィンドウを備えています。
全文翻訳
Artificial Analysis
KStepFun • プロプライエタリモデル • 2026年9月リリース
Step 5 Preview
知能・パフォーマンス・価格分析
比較
試してみる
APIプロバイダー
ベンチマーク
モデル概要
知能
更新済み
#25 / 20044
Artificial Analysis Intelligence Index
知能で4ユニット中4ユニット
速度
#41 / 20099.8
1秒あたりの出力トークン数
速度で3ユニット中4ユニット
コスト
#27 / 200
$1.00(入力) / $2.70(出力)
キャッシュ割引 95%
$0.71
知能指数タスクあたりのコスト
コストで2ユニット中4ユニット
冗長性
#65 / 200160M
知能指数からの出力トークン数
冗長性で4ユニット中4ユニット
比較概要
Step 5 Previewは、知能においては主要なモデルの1つであり、同価格帯の他のモデルと比較して価格も良好です。平均よりも高速ですが、非常に冗長です。このモデルは、テキストと画像入力をサポートし、テキストを出力し、1Mトークンのコンテキストウィンドウを備えています。
Step 5 Previewは、Artificial Analysis Intelligence Indexで44を記録し、比較可能なモデルの中央値25を大きく上回っています。Intelligence Indexの評価では160Mトークンを生成しましたが、これは中央値の90Mと比較して非常に冗長です。
Step 5 Previewの価格は、1M入力トークンあたり$1.00(競争力のある価格設定、中央値:$1.88)、1M出力トークンあたり$2.70(競争力のある価格設定、中央値:$10.00)です。Intelligence Indexの評価にかかった総費用は$918.34でした。
1秒あたり100トークンで、Step 5 Previewは平均(65)よりも高速です。
技術仕様
推論
はい
このページは、このモデルの推論バージョンを示しています。
推論しないバリアントも存在する可能性があります。
入力モダリティ
サポート: テキストと画像
出力モダリティ
サポート: テキスト
コンテキストウィンドウ
1M
約1500枚のA4用紙(サイズ12、Arialフォント)
200モデルはこのクラスに属します。
メトリクスは同じクラスのモデルと比較されます。
非推論モデル → 他の非推論モデルとのみ比較
推論モデル → 推論・非推論の両方と比較
オープンウェイトモデル → 同じサイズクラスの他のオープンウェイトモデルとのみ比較:
Tiny: ≤4Bパラメータ
Small: 4B–40Bパラメータ
Medium: 40B–150Bパラメータ
Large: >150Bパラメータ
プロプライエタリモデル → 同じ価格帯のプロプライエタリおよびオープンウェイトモデル全体で比較。入力/出力価格比3:1のブレンドを使用:
<$0.15 / 1Mトークン
$0.15–$1 / 1Mトークン
>$1 / 1Mトークン
ハイライト
更新済み
知能
Artificial Analysis Intelligence Index · 高いほど良い
速度
1秒あたりの出力トークン数 · 高いほど良い
コスト
タスクあたりのコスト
加重平均コスト(USD)/ 知能指数タスク · 低いほど良い
プロンプトオプション
知能
更新済み
Artificial Analysis Intelligence Index
Artificial Analysis Intelligence Index v4.3は、10の評価を含みます。
AA-Briefcase, GDPval-AA v2, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1
653モデル中27モデル
特定のプロバイダーからモデルを追加
Artificial Analysis Intelligence Index
Artificial Analysis Intelligence Index v4.3には、AA-Briefcase, GDPval-AA v2, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1が含まれます。各評価と実行方法の詳細については、Intelligence Index methodologyを参照してください。
プロプライエタリ
オープンウェイト(商用利用制限あり)
オープンウェイト
Artificial Analysis Intelligence Index
Artificial Analysis Intelligence Index v4.3には、AA-Briefcase, GDPval-AA v2, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1が含まれます。各評価と実行方法の詳細については、Intelligence Index methodologyを参照してください。
オープンウェイト
モデルのウェイトが利用可能かどうかを示します。商用利用が条件付きで制限されているモデルは「商用利用制限あり」と表示され、ライセンスが商用利用を禁止しているモデルは「非商用」と表示されます。
機能インデックス
特定の機能や業界におけるモデルのパフォーマンスを測定します。
金融・会計
戦略・オペレーション
法務
エンジニアリング
経済学
Artificial Analysis Finance & Accounting Index
7つの評価を含みます。
AA-Omniscience, GDPval-AA v2, AA-Briefcase, Humanity's Last Exam, AutomationBench-AA, AA-LCR v1.1, GDP.pdf · 高いほど良い
161モデル中26モデル
特定のプロバイダーからモデルを追加
ベンチマーク
知能評価
Artificial Analysisによって独立して測定された知能評価 · 高いほど良い
コーディング
エージェント
ツールの使用
プライベートデータセット
ユーザーインタラクション
金融
医療
法務
知能指数
長コンテキスト
マルチモーダル
指示追従
忠実度
ライティング
ビジネス
その他を見る
26の評価中18
653モデル中27モデル
特定のプロバイダーからモデルを追加
AA-Briefcase
エージェント型知識業務(Elo-500)/2000
GDPval-AA v2
エージェント型実世界タスク(Elo-500)/2000
AutomationBench-AA
更新済み
エージェント型SaaSワークフロー
Terminal-Bench 4.0
新規
エージェント型コーディング&ターミナル使用
SciCode
コーディング
Humanity's Last Exam
推論と知識
GDP.pdf
新規
プロフェッショナル文書推論、全合格
CritPt
物理学推論
AA-Omniscience Accuracy
知識
AA-Omniscience Non-Hallucination Rate
1 - ハルシネーション率
AA-LCR v1.1
長コンテキスト推論
Harvey LAB-AA
法務エージェント業務、基準合格率
EnterpriseOps-Gym-AA
エージェント型ビジネスオペレーション
AA-Analyst
スプレッドシートとドキュメントの定量的分析
𝜏³-Banking
エージェント型ツール使用
ITBench-AA
Kubernetesインシデント根本原因分析
MMMU-Pro
視覚的推論
MLCR-AA
新規
医療長コンテキスト推論
知能評価の関連性
モデルの知能は一般的にユースケース全体に翻訳されますが、特定の評価は特定のユースケースにより関連性が高い場合があります。
Artificial Analysis Intelligence Index
Artificial Analysis Intelligence Index v4.3には、AA-Briefcase, GDPval-AA v2, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1が含まれます。各評価と実行方法の詳細については、Intelligence Index methodologyを参照してください。
AA-Briefcase
AA-Briefcase Elo
AA-Briefcase Rubric Score (%)
Analytical Quality & Presentation Elo
AA-Briefcase Elo
AA-Briefcase Eloは、ルーブリック合格率、分析品質Elo、プレゼンテーションEloを統合した複合メトリックです · 高いほど良い
170モデル中27モデル
特定のプロバイダーからモデルを追加
AA-Briefcase Elo
AA-Briefcase Eloは、分析品質Elo、プレゼンテーションElo、ルーブリック合格率を統合した複合メトリックであり、ルーブリックパフォーマンスは合成ヘッドツーヘッドマッチを通じてEloに変換されます。Eloおよび95%信頼区間は0にクランプされます。
AA-Omniscience
AA-Omniscience Index
AA-Omniscience Accuracy
AA-Omniscience Hallucination Rate
AA-Omniscience Index
AA-Omniscience Index(高いほど良い)は、知識の信頼性とハルシネーションを測定します。正解を報酬とし、ハルシネーションを罰し、回答を拒否しても罰はありません。スコアは-100から100の範囲で、0は正解と不正解が同数であることを意味し、負のスコアは不正解の方が多いことを意味します。
528モデル中27モデル
特定のプロバイダーからモデルを追加
AA-Omniscience Index
AA-Omniscience Index(高いほど良い)は、知識の信頼性とハルシネーションを測定します。正解を報酬とし、ハルシネーションを罰し、回答を拒否しても罰はありません。スコアは-100から100の範囲で、0は正解と不正解が同数であることを意味し、負のスコアは不正解の方が多いことを意味します。
知能指数比較
知能指数 vs. タスクあたりのコスト
知能指数 vs. タスクあたりの時間
知能指数 vs. 出力速度
知能指数 vs. エンドツーエンド応答時間
知能指数 vs. 知能指数タスクあたりのコスト
Artificial Analysis Intelligence Index