AI・機械学習
NanoGPTスピードランフロンティア
NanoGPT Speedrun Frontier (primeintellect.ai)
要約
この記事では、様々なAIモデルが「人間記録」と呼ばれるタスクを達成するまでの時間を比較する「スピードラン」の成果を分析しています。Fable 5やOpus 5、Kimi K3、GPT-5.6などのモデルが、人間が達成した記録との差をどれだけ縮められたか、またタスク完了までの日数などが詳細な表で示されています。これにより、最新のAIモデルの性能向上と効率化の進捗が視覚的に理解できます。
全文翻訳
人間記録との差の割合
人間記録 100%
0%
20%
40%
60%
80%
100%
0日
1日
2日
4日
7日
9日
Fable 5
Opus 5
Kimi K3 · prime-agent
Kimi K3
Opus 4.8
GPT-5.6 Sol
GPT-5.6 Sol Pro
Sonnet 5
GPT-5.6 Luna
Grok 4.5
Qwen3.8 Max
GLM 5.2
DeepSeek V4 Pro
GPT-5.6 Terra
Grok 4.6
Muse Spark 1.2
Muse Spark 1.1
GPT-5.5
Kimi K2.7
エージェント時間(日数)
人間記録との差の割合
0%
20%
40%
60%
80%
100%
0日
1日
2日
4日
7日
9日
Fable 5
Opus 5
Kimi K3 · prime-agent
Kimi K3
Opus 4.8
GPT-5.6 Sol
GPT-5.6 Sol Pro
Sonnet 5
GPT-5.6 Luna
Grok 4.5
Qwen3.8 Max
GLM 5.2
DeepSeek V4 Pro
GPT-5.6 Terra
Grok 4.6
Muse Spark 1.2
Muse Spark 1.1
GPT-5.5
Kimi K2.7
エージェント時間(日数)
モデルをすべて折りたたむ
すべてのモデル
各モデルの検証済み最高結果
すべてのトレース
モデルでフィルタリング
1
Fable 5
note
2,726
81.7% 達成
claude-code · high@24H
3,010
8.7日
Open
2
Opus 5
serial era
2,920
53.6% 達成
claude-code · max@24H
3,045
2.9日
Open
3
Kimi K3
serial era
2,930
52.2% 達成
prime-agent · max@24H
3,125
3.6日
Open
4
Kimi K3
note
2,974
45.8% 達成
kimi-code · max@24H
3,135
5.1日
Open
5
Opus 4.8
3,018
39.4% 達成
claude-code · max@24H
3,180
3.0日
Open
6
GPT-5.6 Sol
note
3,042
35.9% 達成
codex · xhigh@24H
3,160
6.1日
Open
7
GPT-5.6 Sol Pro
serial era
3,058
33.6% 達成
codex · xhigh@24H
3,100
3.4日
Open
8
Sonnet 5
note
3,105
26.8% 達成
claude-code · max@24H
3,120
2.0日
Open
9
GPT-5.6 Luna
note
3,110
26.1% 達成
codex · xhigh@24H
3,170
1.9日
Open
10
Grok 4.5
note
3,120
24.6% 達成
grok-cli · xhigh@24H
3,160
2.7日
Open
11
Qwen3.8 Max
running
3,120
24.6% 達成
qwen-code · max@24H
3,225
1.9日
Open
12
GLM 5.2
3,150
20.3% 達成
pi · high@24H
3,200
1.8日
Open
13
DeepSeek V4 Pro
running
3,205
12.3% 達成
claude-code · max@24H
3,205
1.1日
Open
14
GPT-5.6 Terra
serial era
3,214
11.0% 達成
codex · xhigh@24H
3,214
1.1日
Open
15
Grok 4.6
running
3,220
10.1% 達成
grok-cli · xhigh
—
0.6日
Open
16
Muse Spark 1.2
running
3,230
8.7% 達成
muse-code · xhigh
—
0.6日
17
Muse Spark 1.1
3,232
8.4% 達成
pi · max@24H
3,240
3.7日
Open
18
GPT-5.5
serial era
3,234
8.1% 達成
codex · xhigh@24H
3,234
1.1日
Open
19
Kimi K2.7
note
3,240
7.2% 達成
kimi-code · max@24H
3,240
1.6日
Open
20
GLM 5.3
running
—
記録なし
claude-code · xhigh
モデル
Model Harness
記録ギャップ達成率
@24H
総トークン数
出力トークン数
実験数
コール数
日数
トレース数
Fable 5
claude-code · high
note
2,726
81.7%
3,010
800M
1.1M
81
13k
8.7
Open
Opus 5
claude-code · max
serial era
2,920
53.6%
3,045
183M
690k
292
40
12.9
Open
Kimi K3
prime-agent · max
serial era
2,930
52.2%
3,125
112M
2.2M
—
488
3.6
Open
Kimi K3
kimi-code · max
note
2,974
45.8%
3,135
682M
1.4M
71
34k
5.1
Open
Opus 4.8
claude-code · max
3,018
39.4%
3,180
318M
2.3M
42
72k
3.0
Open
GPT-5.6 Sol
codex · xhigh
note
3,042
35.9%
3,160
2.9B
2.2M
96
328k
6.1
Open
GPT-5.6 Sol Pro
codex · xhigh
serial era
3,058
33.6%
3,100
1.2B
4.6M
50
97k
3.4
Open
Sonnet 5
claude-code · max
note
3,105
26.8%
3,120
998M
2.1M
21
32k
2.0
Open
GPT-5.6 Luna
codex · xhigh
note
3,110
26.1%
3,170
894M
888k
36
212k
1.9
Open
Grok 4.5
grok-cli · xhigh
note
3,120
24.6%
3,160
46M
385k
39
94k
2.7
Open
Qwen3.8 Max
qwen-code · max
running
3,120
24.6%
3,225
216M
629k
31
286k
1.9
Open
GLM 5.2
pi · high
3,150
20.3%
3,200
57M
1.7M
19
41k
1.8
Open
DeepSeek V4 Pro
claude-code · max
running
3,205
12.3%
3,205
26M
319k
18
930k
1.1
Open
GPT-5.6 Terra
codex · xhigh
serial era
3,214
11.0%
3,214
417M
298k
15
43k
1.1
Open
Grok 4.6
grok-cli · xhigh
running
3,220
10.1%
—
27M
346k
97
691k
0.6
Open
Muse Spark 1.2
muse-code · xhigh
running
3,230
8.7%
—
41M
910k
56
724k
0.6
—
Muse Spark 1.1
pi · max
3,232
8.4%
3,240
122M
1.6M
48
92k
3.7
Open
GPT-5.5
codex · xhigh
serial era
3,234
8.1%
3,234
70M
77k
18
561k
1.1
Open
Kimi K2.7
kimi-code · max
note
3,240
7.2%
3,240
160M
763k
18
73k
1.6
Open
GLM 5.3
claude-code · xhigh
running
—
—
—
—
—
—
—
—
比較結果
トレース数
モデル
記録
人間
2,600
ベースライン
3,290
Fable 5
3,010
Opus 5
3,045
GPT-5.6 Sol Pro
3,100
Sonnet 5
3,120
Kimi K3 · prime-agent
3,125
Kimi K3
3,135
GPT-5.6 Sol
3,160
Grok 4.5
3,160
GPT-5.6 Luna
3,170
Opus 4.8
3,180
GLM 5.2
3,200
DeepSeek V4 Pro
3,205
GPT-5.6 Terra
3,214
Grok 4.6
3,220
Qwen3.8 Max
3,225
Muse Spark 1.2
3,230
GPT-5.5
3,234
Muse Spark 1.1
3,240
Kimi K2.7
3,240
GLM 5.3
—
選択された予算の前に終了したグレーの実行
利用可能なトレースを読み込んでいます…
41個の厳選された完全なエージェントトレース(ツールコール、サブエージェント、スクラッチパッドを含む)を開く。