AI・機械学習
GPT-5.6、Grok 4.5、Claude、Muse Sparkが同じ4つのアプリを構築
GPT-5.6, Grok 4.5, Claude, and Muse Spark build the same 4 apps (tryai.dev)
要約
この記事では、GPT-5.6、Grok 4.5、Claude、Muse Sparkを含む12のAIモデルが、4つの異なるアプリケーション(レイキャスター迷路、3Dルービックキューブ、電卓、Conwayのライフゲーム)を構築する能力を比較しています。各モデルのパフォーマンス、コスト、時間を複数の試行で評価し、その強みと弱みについての観察結果を提供しています。
全文翻訳
前回のビルドオフはHacker Newsのトップページに掲載され、コメントは遠慮なく意見を述べました。もっともなことです、その多くは良いフィードバックでした。そこで私たちはそれを受け取り、GPT-5.6が3つのティア(Sol、Terra、Luna)で登場し、Metaがコーディングモデル(Muse Spark 1.1)をサプライズドロップしたため、私たちはそれをさらに大規模に再実行しました。12のモデル、4つのアプリ、それぞれ5回の試行です。
フィードバックに基づいて変更した点:オープンウェイトモデルを混ぜてほしいという要望がありました。そこで、GLM-5.2、Qwen 3.7 Plus、DeepSeek V4 Pro、Kimi K2.6を比較対象として追加しました。これらはすべてFireworks経由で提供されます。
試行が1つ奇妙だった、という意見がありました。同意します。各モデルはタスクごとに5回の試行を行います。上部にはモデルごとのサンプル実行が1つ表示され、各タスクの表には5回のうち何回成功したと判断したか(およびカウント方法)、そして最も気に入った試行へのリンクが示されています。また、すべての試行が下部にリンクされているため、モデルが実行ごとにどれだけ変動するかを確認できます。
「これは客観的ではない。」正しいです、そして私たちはそれを装っていません。私たちは科学的な判決を下しているわけではありません。私たちは大量の成果物を生成し、それらをすべて公開します。あなたは自分の意見を形成できます。以下のすべては、結果を観察したことから得られた私たちの観察結果にすぎません。生のビルドをすぐに確認したいですか?すべての試行にジャンプして、自分で実行してください。
ラインナップは12モデル:新しいGPT-5.6 Sol、GPT-5.6 Terra、GPT-5.6 Luna。MetaのMuse Spark 1.1。Grok 4.5、GPT-5.5、Claude Opus 4.8、Claude Fable 5。さらにオープンウェイトのグループ:Qwen 3.7 Plus、DeepSeek V4 Pro、Kimi K2.6、GLM-5.2。
各タスクは次のとおりです。上部に表示されている5回の試行のうちの私たちの選択、その下の5回の試行すべてのコストと時間、そして投稿の下部にあるすべての生の試行へのリンクで、自分で判断できます。
タスク1:Doom風レイキャスター迷路
WASDで歩く一人称レイキャスター、深度のあるシェーディングされた壁、床と天井、衝突判定。
Grok 4.5
Claude Opus 4.8
GPT-5.5
Qwen 3.7 Plus
Kimi K2.6
Claude Fable 5
DeepSeek V4 Pro
GLM-5.2
GPT-5.6 Sol
GPT-5.6 Terra
GPT-5.6 Luna
Muse Spark 1.1
カウント方法「プレイ可能」:私たちが気にした唯一の質問は、実際に迷路を歩き回ったり、移動したり、回転したりできるかどうかでした。もしできれば、カウントされました。
モデル
プレイ可能
ベストビルド
コスト(5回実行)
平均時間
私たちの見解
Grok 4.5
5/5
#4
$0.27
62秒
価格の割に素晴らしい。
Claude Opus 4.8
4/5
#2
$0.54
48秒
一貫性はあるが、退屈。
GPT-5.5
4/5
#1
$1.44
138秒
GPT-5.6以前の全体的なベスト。
Qwen 3.7 Plus
2/5
#4
$0.13
43秒
—
Kimi K2.6
2/5
#2
$1.37
88秒
—
Claude Fable 5
3/5
#1
$2.35
107秒
良い結果だが、一貫性に欠ける。
DeepSeek V4 Pro
3/5
#4
$0.30
318秒
—
GLM-5.2
0/5
—
$0.12
133秒
良いディテールをレンダリングしたが、どの試行でもキャラクターが移動できなかった。
GPT-5.6 Sol
5/5
#5
$1.35
120秒
最高の成果:一貫性があり、GPT-5.5よりも優れており、ゲーム全体でより詳細。
GPT-5.6 Terra
3/5
#1
$0.44
39秒
良いディテールだが、一貫性に欠け、常に歩けるわけではなかった。
GPT-5.6 Luna
5/5
#5
$0.15
23秒
素晴らしい成果だが、私の意見ではGPT-5.5ほどではない。
Muse Spark 1.1
2/5
#1
$0.55
169秒
動作したときは驚くほど素晴らしかった。5回のうち3回は壊れていたが、動作したものはFableやSolと同等で、GrokやOpusのものよりも優れていた。
全体として、Claudeはここで予想よりもパフォーマンスが悪かった。GPTは他のすべてのモデルを上回り、Grokはその価格帯で実際に使用可能な代替となり、Muse Sparkは実際に動作した実行で真の驚きだった。
タスク2:3Dルービックキューブ(スクランブル+ソルブ)
スクランブルボタンとソルブボタンがあり、回転が視覚的にアニメーションするカラフルな3Dルービックキューブを構築する。
Grok 4.5
Claude Opus 4.8
GPT-5.5
Qwen 3.7 Plus
Kimi K2.6
Claude Fable 5
DeepSeek V4 Pro
GLM-5.2
GPT-5.6 Sol
GPT-5.6 Terra
GPT-5.6 Luna
Muse Spark 1.1
「クリーンソルブ」のカウント方法:キューブをスクランブルしてソルブし、両方のアニメーションがスムーズに実行され、グリッチや色の変更がなかった場合にのみ試行をカウントしました。
モデル
クリーンソルブ
ベストビルド
コスト(5回実行)
平均時間
私たちの見解
Grok 4.5
3/5
#4
$0.65
191秒
シンプルで良い結果。
Claude Opus 4.8
0/5
#1
$0.56
44秒
完璧な例はなく、すべてに小さな問題があり、キューブの色が変わったが、いくつかは近かった。
GPT-5.5
4/5
#4
$1.36
136秒
良い結果。ちらつく色やスムーズでない回転アニメーションのような小さな欠点があった。
Qwen 3.7 Plus
1/5
#5
$0.07
24秒
動作したときは、素晴らしい見た目だった!
Kimi K2.6
1/5
#4
$1.05
59秒
あまり良くない。
Claude Fable 5
5/5
#2
$2.03
92秒
特に言うことはない、本当に良い結果。
DeepSeek V4 Pro
1/5
#3
$0.35
380秒
—
GLM-5.2
0/5
—
$0.08
89秒
驚くべきことに、動作する結果はなかった。
GPT-5.6 Sol
4/5
#5
$1.06
72秒
素晴らしい結果。1つは奇妙なアニメーションで、1つはすべて黒いキューブをレンダリングした(興味深い選択)が、動作したものはうまくやった。
GPT-5.6 Terra
4/5
#4
$0.42
38秒
問題なし、奇妙なスクランブルアニメーション。GPT-5.5から少し進歩した感じ。
GPT-5.6 Luna
0/5
—
$0.14
24秒
通常は最初に正しくレンダリングされたが、スクランブルするとすぐに壊れた。
Muse Spark 1.1
2/5
#1
$0.54
182秒
OSSモデルより一段上だが、価格を考えるとGrokの代わりには使わないだろう。
全体として、レイキャスターでの明確な3Dリードを考えると、GPTのパフォーマンスが低いことに驚いた。Claudeは再び素晴らしい仕事をした。Fableが5回中5回クリーンに達成してそれを牽引したが、Opusは奇妙なことに、単一の完璧なソルブを達成できなかった。
すべてのモデルの5回の試行をライブで再生:Grok · Opus · Qwen(他の試行のために番号1-5を入れ替えてください)。
タスク3:電卓
数字、演算子、クリア、イコール、正しい演算子優先順位、実際の電卓の外観。
Grok 4.5
Claude Opus 4.8
GPT-5.5
Qwen 3.7 Plus
Kimi K2.6
Claude Fable 5
DeepSeek V4 Pro
GLM-5.2
GPT-5.6 Sol
GPT-5.6 Terra
GPT-5.6 Luna
Muse Spark 1.1
「動作する」のカウント方法:網羅的ではない、単純な計算(例:(((5 × 5) − 100) / 10))で、各モデルが演算順序をどのように処理し、結果をレンダリングするかを確認しました。
モデル
動作する
ベストビルド
コスト(5回実行)
平均時間
私たちの見解
Grok 4.5
5/5
#5
$0.37
110秒
シンプルで一貫性のある結果、追加のスタイリングなし。
Claude Opus 4.8
5/5
#1
$0.46
35秒
—
GPT-5.5
4/5
#1
$0.91
75秒
時々追加のボタンがあり、3Dでレンダリングしようとしたが、それはしばしば切り取られた。
Qwen 3.7 Plus
4/5
#4
$0.04
12秒
動作し、かなり一貫性があったが、1つは負の数を扱えなかった。
Kimi K2.6
0/5
#5
$0.76
50秒
動作したが、負の数を扱えなかった。
Claude Fable 5
5/5
#1
$1.22
48秒
スタイルだけで、私の個人的なお気に入り。
DeepSeek V4 Pro
3/5
#3
$0.28
342秒
1つは順序が狂った数字があり、1つの結果がレンダリングされなかった。
GLM-5.2
2/5
#1
$0.07
63秒
動作したときは素晴らしい結果だった。
GPT-5.6 Sol
5/5
#1
$0.84
61秒
GPT-5.5のように、スタイリングに過剰に傾倒しようとする。それはレイキャスターでは役立ったが、ここでは迷惑だった。クリーンで一貫性がある代わりに、いくつかのスタイリングがオフだった。
GPT-5.6 Terra
4/5
#1
$0.28
20秒
動作したときは良い結果だった。
GPT-5.6 Luna
5/5
#1
$0.11
16秒
良い、一貫性のある結果。Grokのものに似ていた。
Muse Spark 1.1
5/5
#5
$0.33
94秒
全体的にかなり良く、目立った問題はなく、Grok 4.5と同等だった。時折、順序が狂ったボタンや奇妙な配置のボタンがあり、スタイルポイントをいくつか失った。
全体として、これは明らかにClaudeの最高の仕事だった:OpusとFableの両方が5回中5回を達成し、Fableのスタイルが私たちのお気に入りだった。GPT-5.6 Solはスタイルに過剰に傾倒し、Fableのように電卓を3Dでレンダリングしようとする。しかし、スタイルをうまくこなせず、全体的な体験が悪くなっている。よりシンプルなGPTモデルは、すぐに使える体験だったため、より良い仕事をしたように見えた。GLM-5.2は、推論オフで、9分間の失敗から、素早く、1セント未満のビルドに戻ってきた。
タスク4:Conwayのライフゲーム
グリッドキャンバス、再生/一時停止/ステップ/ランダム化/クリア、セルを切り替えるクリック、アニメーション世代。
Grok 4.5
Claude Opus 4.8
GPT-5.5
Qwen 3.7 Plus
Kimi K2.6
Claude Fable 5
DeepSeek V4 Pro
GLM-5.2
GPT-5.6 Sol
GPT-5.6 Terra
GPT-5.6 Luna
Muse Spark 1.1
ライフゲームについては個別の5回試行のスコアリングパスを実行しなかったため、ここではコストと時間、および以下の一般的な印象のみを示します。
モデル
コスト(5回実行)
平均時間
Grok 4.5
$0.14
38秒
Claude Opus 4.8
$0.48
35秒
GPT-5.5
$1.06
79秒
Qwen 3.7 Plus
$0.04
11秒
Kimi K2.6
$0.93
53秒
Claude Fable 5
$1.27
48秒
DeepSeek V4 Pro
$0.25
304秒
GLM-5.2
$0.10
121秒
GPT-5.6 Sol
$0.99
62秒
GPT-5.6 Terra
$0.36
25秒
GPT-5.6 Luna
$0.13
18秒
Muse Spark 1.1
$0.32
98秒
Grok 4.5はここでうまくやりましたが、より大きな教訓は、このタスクはOSSモデルが非常にうまく実行できるほどシンプルだったということです。ライフゲームのオープンなサンプルコードは十分に存在する可能性が高いため、それらを非常にうまく実行できました。