HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

NanoGPTスピードランフロンティア

NanoGPT Speedrun Frontier (primeintellect.ai)

127 pointsby stared32 コメント

要約

この記事では、様々なAIモデルが「人間記録」と呼ばれるタスクを達成するまでの時間を比較する「スピードラン」の成果を分析しています。Fable 5やOpus 5、Kimi K3、GPT-5.6などのモデルが、人間が達成した記録との差をどれだけ縮められたか、またタスク完了までの日数などが詳細な表で示されています。これにより、最新のAIモデルの性能向上と効率化の進捗が視覚的に理解できます。

全文翻訳

人間記録との差の割合 人間記録 100% 0% 20% 40% 60% 80% 100% 0日 1日 2日 4日 7日 9日 Fable 5 Opus 5 Kimi K3 · prime-agent Kimi K3 Opus 4.8 GPT-5.6 Sol GPT-5.6 Sol Pro Sonnet 5 GPT-5.6 Luna Grok 4.5 Qwen3.8 Max GLM 5.2 DeepSeek V4 Pro GPT-5.6 Terra Grok 4.6 Muse Spark 1.2 Muse Spark 1.1 GPT-5.5 Kimi K2.7 エージェント時間(日数) 人間記録との差の割合 0% 20% 40% 60% 80% 100% 0日 1日 2日 4日 7日 9日 Fable 5 Opus 5 Kimi K3 · prime-agent Kimi K3 Opus 4.8 GPT-5.6 Sol GPT-5.6 Sol Pro Sonnet 5 GPT-5.6 Luna Grok 4.5 Qwen3.8 Max GLM 5.2 DeepSeek V4 Pro GPT-5.6 Terra Grok 4.6 Muse Spark 1.2 Muse Spark 1.1 GPT-5.5 Kimi K2.7 エージェント時間(日数) モデルをすべて折りたたむ すべてのモデル 各モデルの検証済み最高結果 すべてのトレース モデルでフィルタリング 1 Fable 5 note 2,726 81.7% 達成 claude-code · high@24H 3,010 8.7日 Open 2 Opus 5 serial era 2,920 53.6% 達成 claude-code · max@24H 3,045 2.9日 Open 3 Kimi K3 serial era 2,930 52.2% 達成 prime-agent · max@24H 3,125 3.6日 Open 4 Kimi K3 note 2,974 45.8% 達成 kimi-code · max@24H 3,135 5.1日 Open 5 Opus 4.8 3,018 39.4% 達成 claude-code · max@24H 3,180 3.0日 Open 6 GPT-5.6 Sol note 3,042 35.9% 達成 codex · xhigh@24H 3,160 6.1日 Open 7 GPT-5.6 Sol Pro serial era 3,058 33.6% 達成 codex · xhigh@24H 3,100 3.4日 Open 8 Sonnet 5 note 3,105 26.8% 達成 claude-code · max@24H 3,120 2.0日 Open 9 GPT-5.6 Luna note 3,110 26.1% 達成 codex · xhigh@24H 3,170 1.9日 Open 10 Grok 4.5 note 3,120 24.6% 達成 grok-cli · xhigh@24H 3,160 2.7日 Open 11 Qwen3.8 Max running 3,120 24.6% 達成 qwen-code · max@24H 3,225 1.9日 Open 12 GLM 5.2 3,150 20.3% 達成 pi · high@24H 3,200 1.8日 Open 13 DeepSeek V4 Pro running 3,205 12.3% 達成 claude-code · max@24H 3,205 1.1日 Open 14 GPT-5.6 Terra serial era 3,214 11.0% 達成 codex · xhigh@24H 3,214 1.1日 Open 15 Grok 4.6 running 3,220 10.1% 達成 grok-cli · xhigh — 0.6日 Open 16 Muse Spark 1.2 running 3,230 8.7% 達成 muse-code · xhigh — 0.6日 17 Muse Spark 1.1 3,232 8.4% 達成 pi · max@24H 3,240 3.7日 Open 18 GPT-5.5 serial era 3,234 8.1% 達成 codex · xhigh@24H 3,234 1.1日 Open 19 Kimi K2.7 note 3,240 7.2% 達成 kimi-code · max@24H 3,240 1.6日 Open 20 GLM 5.3 running — 記録なし claude-code · xhigh モデル Model Harness 記録ギャップ達成率 @24H 総トークン数 出力トークン数 実験数 コール数 日数 トレース数 Fable 5 claude-code · high note 2,726 81.7% 3,010 800M 1.1M 81 13k 8.7 Open Opus 5 claude-code · max serial era 2,920 53.6% 3,045 183M 690k 292 40 12.9 Open Kimi K3 prime-agent · max serial era 2,930 52.2% 3,125 112M 2.2M — 488 3.6 Open Kimi K3 kimi-code · max note 2,974 45.8% 3,135 682M 1.4M 71 34k 5.1 Open Opus 4.8 claude-code · max 3,018 39.4% 3,180 318M 2.3M 42 72k 3.0 Open GPT-5.6 Sol codex · xhigh note 3,042 35.9% 3,160 2.9B 2.2M 96 328k 6.1 Open GPT-5.6 Sol Pro codex · xhigh serial era 3,058 33.6% 3,100 1.2B 4.6M 50 97k 3.4 Open Sonnet 5 claude-code · max note 3,105 26.8% 3,120 998M 2.1M 21 32k 2.0 Open GPT-5.6 Luna codex · xhigh note 3,110 26.1% 3,170 894M 888k 36 212k 1.9 Open Grok 4.5 grok-cli · xhigh note 3,120 24.6% 3,160 46M 385k 39 94k 2.7 Open Qwen3.8 Max qwen-code · max running 3,120 24.6% 3,225 216M 629k 31 286k 1.9 Open GLM 5.2 pi · high 3,150 20.3% 3,200 57M 1.7M 19 41k 1.8 Open DeepSeek V4 Pro claude-code · max running 3,205 12.3% 3,205 26M 319k 18 930k 1.1 Open GPT-5.6 Terra codex · xhigh serial era 3,214 11.0% 3,214 417M 298k 15 43k 1.1 Open Grok 4.6 grok-cli · xhigh running 3,220 10.1% — 27M 346k 97 691k 0.6 Open Muse Spark 1.2 muse-code · xhigh running 3,230 8.7% — 41M 910k 56 724k 0.6 — Muse Spark 1.1 pi · max 3,232 8.4% 3,240 122M 1.6M 48 92k 3.7 Open GPT-5.5 codex · xhigh serial era 3,234 8.1% 3,234 70M 77k 18 561k 1.1 Open Kimi K2.7 kimi-code · max note 3,240 7.2% 3,240 160M 763k 18 73k 1.6 Open GLM 5.3 claude-code · xhigh running — — — — — — — — 比較結果 トレース数 モデル 記録 人間 2,600 ベースライン 3,290 Fable 5 3,010 Opus 5 3,045 GPT-5.6 Sol Pro 3,100 Sonnet 5 3,120 Kimi K3 · prime-agent 3,125 Kimi K3 3,135 GPT-5.6 Sol 3,160 Grok 4.5 3,160 GPT-5.6 Luna 3,170 Opus 4.8 3,180 GLM 5.2 3,200 DeepSeek V4 Pro 3,205 GPT-5.6 Terra 3,214 Grok 4.6 3,220 Qwen3.8 Max 3,225 Muse Spark 1.2 3,230 GPT-5.5 3,234 Muse Spark 1.1 3,240 Kimi K2.7 3,240 GLM 5.3 — 選択された予算の前に終了したグレーの実行 利用可能なトレースを読み込んでいます… 41個の厳選された完全なエージェントトレース(ツールコール、サブエージェント、スクラッチパッドを含む)を開く。