HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

Grok 4.5、GPT-5.5、Claudeが同じアプリをビルドした

We made Grok 4.5, GPT-5.5, and Claude build the same apps (tryai.dev)

117 pointsby hershyb_56 コメント

要約

xAIの最新モデルGrok 4.5、OpenAIのGPT-5.5、AnthropicのClaude Opus 4.8およびClaude Fable 5を対象に、同一のプロンプトでHTMLファイルのみで構成されるインタラクティブなアプリをビルドさせる比較テストを実施しました。結果として、Grok 4.5は速度とコスト効率で優位に立ち、GPT-5.5はスタイリッシュな結果を、Claudeモデルは信頼性の高いビルド能力を示しました。

全文翻訳

今週、xAIがコーディングやエージェントワークにおいて最も賢いモデルだと主張するGrok 4.5が登場しました。「Cursorと共同でトレーニングされた」とのことです。新しいコーディングモデルのバイブチェックをするインターネットのお気に入りの方法は、ビルドオフです。1つのプロンプトを与え、どのようなアプリが出力されるかを見て、クリップを投稿します。私たちはそれを、きちんと行いました。Grok 4.5、GPT-5.5、Claude Opus 4.8、Claude Fable 5に全く同じ3つのプロンプトを与えました。インタラクティブなアプリのための、単一の自己完結型HTMLファイル(ライブラリなし、ネットワークコールなし)をビルドすることです。それぞれ1回ずつ、手助けなし、プロンプトの調整なしです。その後、すべての結果を実際のブラウザにロードし、操作して、何が起こったかを記録しました。以下のクリップはすべてモデルの生の出力であり、「ライブで再生」をクリックすると、実際に生成されたアプリを実行できます。失敗に関する1つのルール:アプリが全くレンダリングされなかった場合、1回の再試行を許可し、それを使用した場合は通知します。 ラウンド1:3Dルービックキューブをシャッフルして解く 「シャッフル」と「解く」ボタン付きのカラフルな3D風ルービックキューブをビルドしてください。キューブは回転を視覚的にアニメーションさせる必要があります。これは難しい課題です。実際の3D数学、面ごとの状態、アニメーションがすべて1つのファイルに必要です。 Grok 4.5 GPT-5.5 Claude Opus 4.8 Claude Fable 5 ライブで再生:Grok 4.5 · GPT-5.5 · Opus 4.8 · Fable 5 このラウンドはClaudeが制しました。Opus 4.8とFable 5は、どちらも最初の試行で、正しく色分けされた本格的な3Dキューブを生成し、シャッフルとソルブのアニメーションターンを行いました。Grok 4.5はここでつまずきました。最初の試みではタイトルとボタンはレンダリングされましたが、キューブは全く表示されませんでした(空白の虚無)。そのため、許可された1回の再試行を使用し、2回目の試みでクリーンでカラフルな3Dキューブが生成されました。GPT-5.5は異質で、完全なキューブの代わりに、ほとんど色がなく、単一の暗い面をレンダリングしました。 勝者:OpusとFable、同点。 ラウンド2:パーティクル重力サンドボックス キャンバス上にインタラクティブなパーティクル重力サンドボックスを作成してください。数百個のパーティクルに軌跡があり、クリックすると重いアトラクターが追加されます。魅惑的にしてください。 Grok 4.5 GPT-5.5 Claude Opus 4.8 Claude Fable 5 ライブで再生:Grok 4.5 · GPT-5.5 · Opus 4.8 · Fable 5 ここでは全員が動作するサンドボックスを出荷したため、好みで決まりました。GPT-5.5は最も本当に魅惑的なものを作成しました。光るネオンのアトラクターと、密集した渦巻くカラフルな軌跡です。Grok 4.5はクリーンで軌道的なスタイルで、整然としたアトラクターリングとカラフルな流れるようなパーティクルでした。Fable 5は柔らかく光る球体に傾倒し、Opus 4.8は最も賑やかでウェブらしいパーティクルフィールドと優れた物理演算を生成しましたが、視覚的な魅力はやや劣りました。 勝者:GPT-5.5、雰囲気で。 ラウンド3:プレイ可能なブレイクアウトゲーム キャンバス上にプレイ可能なブレイクアウト/ブリックブレーカーを作成してください。パドルはマウスに追従し、ボールはカラフルなブロックを破壊し、スコアとライフが表示されます。 Grok 4.5 GPT-5.5 Claude Opus 4.8 Claude Fable 5 ライブで再生:Grok 4.5 · GPT-5.5 · Opus 4.8 · Fable 5 デッドヒート。4つすべてが、最初の試行でスコア、ライフ、光るパドルを備えた洗練された、実際にプレイ可能なブリックブレーカーを生成しました。Grok 4.5とGPT-5.5はネオンアーケードの外観を最も強く押し出し(GPTはスクリプトがボールを打ち返している間にスコアを記録しました)。細かく見れば、4つすべてが製品品質です。 勝者:全員。 証拠:速度とコスト 見栄えの良いデモは一つの側面です。各モデルの実行コストはいくらでしょうか?私たちは独自のハーネス(コーディング、推論、要約を網羅する3つの固定プロンプト、それぞれ3回繰り返し、出力トークンは400に制限)を使用して、アプリが使用するのと同じプロバイダーパスを通じて測定しました。スループットは、全プロバイダーで一様に測定された総ウォールクロックレイテンシに対する出力トークンです。 モデル | 中央値レイテンシ | 初回トークン | スループット | 返信あたりのコスト | 成功 ---|---|---|---|---|--- Grok 4.5 | 2.8秒 | 0.44秒 | 110 トーク/秒 | 0.002¢ | 100% GPT-5.5 | 2.0秒 | 1.26秒 | 53 トーク/秒 | 0.004¢ | 100% Claude Opus 4.8 | 2.6秒 | 1.16秒 | 47 トーク/秒 | 0.004¢ | 100% Claude Fable 5 | 6.3秒 | 3.47秒 | 28 トーク/秒 | 0.009¢ | 100% ここでGrok 4.5が強みを発揮します。0.5秒未満で初回トークンに到達し、約110トークン/秒(ここの他のモデルの約2倍)でストリーミングし、バッチの中で最も安価な返信でした。これはまさにxAIがアピールした「時間とコストあたりの知能」のピッチです。中央値ウォールクロックタイムが中間的なのは、冗長(回答あたりのトークン数が最も多かった)であり、テールが不安定(9秒のp95)だったためです。GPT-5.5は短い回答では最も機敏で、Opus 4.8はバランスの取れた中間、Fable 5は最も遅く最も高価で、トップの知能チャートの代償でした。 ボーナスラウンド:奇妙なものを描く コーディングは一つの軸です。空間的な想像力は別の軸です。各モデルに、意図的に奇妙なシーンの単一の手書きSVG(ラスターなし、ライブラリなし)を依頼しました。月面を歩く宇宙飛行士の背中に乗った馬です。役割の逆転、2つのキャラクター、1つのファイル。 Grok 4.5 GPT-5.5 Claude Opus 4.8 Claude Fable 5 生のSVG:Grok 4.5 · GPT-5.5 · Opus 4.8 · Fable 5 Fable 5がショーを盗みました。カウボーイハットをかぶった馬が「ギディアップ、人間!」と叫び、かがんだ宇宙飛行士が「ハフ…ハフ…」と喘いでいます。それは単なる絵ではなく、コメディです。GPT-5.5は、歓声を上げる馬が「ウィー!」と叫ぶという点で、僅差で2位でした。Grok 4.5は、カラフルで読みやすいシーンで、指示をきれいにこなしました。Opus 4.8もキャラクター性のある馬と宇宙飛行士の絵を描きましたが、生のSVGには厳密なSVGパーサーをトリップさせる重複属性が含まれていました(上の画像では寛容にレンダリングしました)。これは小さくも現実的な正確性の低下です。 評決 Grok 4.5は、速度と価値のモンスターです。素晴らしいブレイクアウトと洗練された重力シミュレーターをビルドし、フィールドの約2倍の速度でストリーミングし、実行コストは最も安価です。唯一の本当のミスは、最も難しいステートフルタスク(最初の試行で空白のキューブ、再試行で修正)でした。ワークロードが高頻度のコード生成で、レイテンシとコストが積み重なる場合、議論の余地はほとんどありません。Grok 4.5 vs GPT-5.5を参照してください。 Claude Opus 4.8とFable 5は、最も信頼性の高いビルダーです。彼らは最初の試行で3Dキューブを完成させた唯一の2つであり、Fableは最も面白いSVGを持っていました。その代償は、特にFableでは、レイテンシと価格で支払われます。Grok 4.5 vs Opus 4.8を参照してください。 GPT-5.5は、機敏なスタイリストです。最も美しい重力シミュレーター、最も高速な短い回答、しかしキューブは失敗しました。 正直な見出し:全く新しいローンチ日において、Grok 4.5は市場で最高のモデルと互角に戦い、速度とコストで圧倒的に勝利しました。 あなた自身のプロンプトで決着をつけたいですか?ここで紹介したすべてのモデルは、TryAIアカウントで、従量課金制で、サブスクリプションなしで実行できます。モデルを閲覧して、あなた自身のビルドオフを開始してください。 自分で試す ここで言及されているすべてのモデルは、1つのアカウントでTryAIで利用可能で、従量課金制で、サブスクリプションはありません。 無料で始める