HN 日本語サマリー

← 一覧へ戻る
AI・機械学習

"描画"するモナ・リザ:GPT-5.6、Claude、Gemini、GrokによるAI描画アリーナ

"Drawing" the Mona Lisa with GPT-5.6, Claude, Gemini, and Grok (tryai.dev)

238 pointsby hershyb_87 コメント

要約

この記事では、GPT-5.6 Sol、Claude Fable 5、Grok 4.5、Gemini 3.6 Flashの4つのAIモデルが、色鉛筆ツールセットを使用してモナ・リザや星月夜などの画像を生成する実験について報告しています。各モデルのツール使用法、コスト、描画品質、および自己評価のプロセスが分析され、特にGemini 3.6 Flashが客観的な類似性で最高スコアを記録したものの、最終的な描画は途中の最高パフォーマンスから低下する傾向が見られました。この実験は、AIの創造性や能力を評価するためのオープンエンドなタスクの有効性を示しています。

全文翻訳

描画アリーナを構築しました。モデルに白いキャンバスと色鉛筆ツールセットを与え、自由に描かせます。モデルは色、線の太さ、筆圧を設定し、ストロークを重ね、ぼかし、消しゴムを使い、view_canvasで自身の作業を確認して修正点を判断します。目標画像を再現するか、テキストプロンプトから描画します。 GPT-5.6 Sol、Claude Fable 5、Grok 4.5、Gemini 3.6 Flashの4つのビジョンモデルを使用し、2つの目標画像(モナ・リザとゴッホの星月夜、両方とも客観的に採点)と5つの自由形式プロンプトで、合計28枚の描画を行いました。ツールの使用法、コスト、出力、そしてモデルが実際に作業を改善したかどうかを、最後に私たちの意見を添えて解説します。 なぜこれらの実験を行うのか これらの実験を行う理由について簡単に触れておきます。以前の音楽ビデオ作成の実験では、モデルの創造性や芸術的能力を宣伝していると受け取った読者から活発な議論が巻き起こりました。これらはモデルの能力を客観的にテストするものではありません。意図的にオープンエンドで曖昧なタスクです。私たちが個人的にこれらの実験を続ける理由は以下の通りです。 楽しいですし、本当に有益です。モデルが曖昧でオープンエンドなタスクに取り組む様子を見ることは、単なるベンチマークの数値よりも、能力の視覚的な指標として興味深いです。 フロンティアモデルとオープンモデルのギャップを露呈させます。安価なオープンウェイトモデルは、多くの実行作業においてフロンティアモデルを完全に置き換えることができます。私たちは今後もその点を報告していきます。しかし、多くのベンチマーク過多な状況があり、このようなタスクはそれを切り抜けます。これらは真にフロンティアの能力を他のものから分離します。ご覧の通り、Grok 4.5はこの「基本的な」描画タスクでは非常に苦戦しました。試したオープンウェイトモデルは全く使えず、いくつかは空白のキャンバスを返しただけでした。(Kimi K3が完全にオープンソース化されたら報告する予定です。) 長期的なタスクが実際にかかるコストを示します。Claude Fable 5は、他のモデルよりもはるかに時間がかかり、はるかに高額でしたが、ここではより悪い結果を出しました。Fableは、音楽ビデオの課題を含む多くのタスクでGPT-5.6を上回ってきましたが、このタスクではより多くのオーバーヘッドで劣っていました。ユースケースによっては、そのトレードオフは重要です。 議論を楽しんでいます。議論は本当に興味深く、セットアップや新しいタスクの提案があれば、考慮に入れます。これらの実験は実行するのが楽しく、出力を見るのは非常にエキサイティングです。 ツール 全てのモデルは、全く同じ色鉛筆ツールセットを使用しました。 plan: ステップ間での思考と計画のためのノーオペレーションのスクラッチパッド。 view_target: 目標画像を再度確認する。 view_canvas: 現在のページを描画し、確認する。この時点で、描画を目標画像と比較して採点します。 set_color / set_brush / set_pressure: 現在の色、線の太さ、筆圧(0から1の不透明度、柔らかいトーンのために低い筆圧)。 draw: 一度の呼び出しで、一連のマーク(ストローク、線、形状のアウトライン、点)を描画する。塗りつぶしはなく、トーンと色は実際の鉛筆のように重ねることで構築されます。 smudge: ブレンディング stump のように、長方形の領域をぼかす/柔らかくする。 erase / clear_canvas: 領域を白に戻す / ページ全体をリセットする。 ハーネス全体は github.com/hershalb/canvas-arena でオープンソース化されています。目標画像またはテキストプロンプトを指定して、自分で実行できます。 2つの目標画像の再現 モデルは常に目標画像を見ることができ、構造的類似性(SSIM)に基づいて採点されました。SSIMスコアを以下に示します。 [画像:モナ・リザのターゲット画像と、GPT-5.6 Sol、Claude Fable 5、Grok 4.5、Gemini 3.6 Flashによる描画] [画像:星月夜のターゲット画像と、GPT-5.6 Sol、Claude Fable 5、Grok 4.5、Gemini 3.6 Flashによる描画] 全トランスクリプト: GPT-5.6 Sol · Claude Fable 5 · Grok 4.5 · Gemini 3.6 Flash 5つのプロンプト描画 目標はなく、スコアもなく、テキストの説明と空白のページだけです。 「年老いた漁師の風霜に満ちた顔、暖かい午後の日差し、深いしわと無精ひげ」 [画像:GPT-5.6 Sol、Claude Fable 5、Grok 4.5、Gemini 3.6 Flashによる描画] 全トランスクリプト: GPT-5.6 Sol · Claude Fable 5 · Grok 4.5 · Gemini 3.6 Flash 「穏やかな海に沈む美しい夕日、オレンジから紫の空、シルエットになった地平線」 [画像:GPT-5.6 Sol、Claude Fable 5、Grok 4.5、Gemini 3.6 Flashによる描画] 全トランスクリプト: GPT-5.6 Sol · Claude Fable 5 · Grok 4.5 · Gemini 3.6 Flash 「暗い背景にガラスの花瓶に入った一輪の赤いバラ、ドラマチックなレンブラント風のライティング」 [画像:GPT-5.6 Sol、Claude Fable 5、Grok 4.5、Gemini 3.6 Flashによる描画] 全トランスクリプト: GPT-5.6 Sol · Claude Fable 5 · Grok 4.5 · Gemini 3.6 Flash 「窓辺で丸まって眠る縞猫、午後の日差し」 [画像:GPT-5.6 Sol、Claude Fable 5、Grok 4.5、Gemini 3.6 Flashによる描画] 全トランスクリプト: GPT-5.6 Sol · Claude Fable 5 · Grok 4.5 · Gemini 3.6 Flash 「暖炉に火が灯った居心地の良いキャビンのインテリア、暖かい琥珀色の光と柔らかな影」 [画像:GPT-5.6 Sol、Claude Fable 5、Grok 4.5、Gemini 3.6 Flashによる描画] 全トランスクリプト: GPT-5.6 Sol · Claude Fable 5 · Grok 4.5 · Gemini 3.6 Flash ヘッドラインの数字 モデルごとの全7回の描画の平均と合計。 | Model | Drawings | Avg steps | Avg time | Total tokens | Est. token cost | Avg self-reviews | Total draw calls | |---|---|---|---|---|---|---|---| | GPT-5.6 Sol | 7 | 296.2 | 4.6 min | 3.4M | $7.74 | 6.0 | 116 | | Claude Fable 5 | 7 | 541.2 | 12.5 min | 14.6M | $160.58 | 15.6 | 207 | | Grok 4.5 | 7 | 994.8 | 4.8 min | 34.0M | $9.21 | 4.3 | 354 | | Gemini 3.6 Flash | 7 | 736.9 | 6.9 min | 27.7M | $12.87 | 22.6 | 190 | ツールの呼び出し 4つのモデルは、全く異なる方法で全く同じツールセットを使用しました。 | Model | set_color/brush/pressure | draw | smudge | erase | view_canvas | view_target | plan | |---|---|---|---|---|---|---|---| | GPT-5.6 Sol | 0% | 48% | 24% | 12% | 16% | 0% | 0% | | Claude Fable 5 | 12% | 26% | 38% | 10% | 14% | 0% | 0% | | Grok 4.5 | 65% | 16% | 10% | 5% | 4% | 0% | 0% | | Gemini 3.6 Flash | 0% | 31% | 14% | 10% | 33% | 12% | 0% | GPT-5.6 Solはset_color、set_brush、set_pressureを一度も呼び出さず、それらを各draw呼び出しでインライン設定したため、呼び出しのほとんどがdraw、smudge、view_canvasでした。Grok 4.5はその逆で、1,349回のツール呼び出しの65%がset_color / set_brush / set_pressureであり、これが1描画あたり平均99ステップとなった理由です。Claude Fable 5はsmudge(123回呼び出し)に頼り、頻繁に確認していました。Gemini 3.6 Flashは最も確認に執拗で、呼び出しの約3分の1がview_canvas(1描画あたり約23回の自己レビュー)であり、Solと同様にset_*ツールには一切触れませんでした。 コストとトークン Claude Fable 5の7回の描画にかかった推定コストは160ドルで、GPT-5.6 Sol(7.74ドル)、Grok 4.5(9.21ドル)、Gemini 3.6 Flash(12.87ドル)の約20倍でした。これは今更驚くことではないはずです。Grokは圧倒的に多くのトークン(34M)を使用しましたが、約98%が低レートのキャッシュ読み取りだったため安価に抑えられ、Grokのレートは4モデルの中で最も低いです。Geminiもキャッシュ読み取りに大きく依存していたため、27.7Mトークンでも控えめなコストでした。 モデルは実際に改善したのか? 全てのview_canvasはキャンバスを目標画像に対して再採点したため、実行中の進捗を追跡できました。両方の目標画像に共通する2つのパターンがありました。 第一に、早期にプラトーに達します。Claude Fable 5はモナ・リザを27回レビューしましたが、5回目のレビュー以降、類似性は実質的に横ばいでした。第二に、8回の目標画像実行全てにおいて、最終的な描画は実行途中の最高スコアを下回りました。GPT-5.6 Solのモナ・リザはSSIM 0.352でピークに達し、最終的に0.325となりました。星月夜は0.179でピークに達し、最終的に0.130となりました。Gemini 3.6 Flashは最も多くレビューし(1描画あたり約23回)、バッチ全体で最高の0.449をモナ・リザで記録しましたが、その後最終的には0.337まで低下しました。より多くのレビューが、より良い結果に繋がったわけではありません。モデルは自身の最高のパフォーマンスを超えて編集を続けました。 客観的類似性(目標実行) SSIMは0から1で、高いほど目標に近いことを示します。RMSEは0から255で、低いほど目標に近いことを示します。 | Model | Target | Steps | Time | Self-reviews | Final SSIM | Best SSIM | Final RMSE | |---|---|---|---|---|---|---|---| | GPT-5.6 Sol | Mona Lisa | 44 | 8m41s | 7 | 0.325 | 0.352 | 54.2 | | Claude Fable 5 | Mona Lisa | 86 | 18m58s | 27 | 0.286 | 0.289 | 56.9 | | Grok 4.5 | Mona Lisa | 106 | 4m30s | 5 | 0.151 | 0.152 | 95.6 | | Gemini 3.6 Flash | Mona Lisa | 60 | 5m31s | 22 | 0.337 | 0.449 | 51.1 | | GPT-5.6 Sol | Starry Night | 23 | 5m47s | 4 | 0.130 | 0.179 | 37.8 | | Claude Fable 5 | Starry Night | 43 | 11m30s | 12 | 0.153 | 0.176 | 40.9 | | Grok 4.5 | Starry Night | 58 | 5m51s | 3 | 0.039 | 0.039 | 104.9 | | Gemini 3.6 Flash | Starry Night | 74 | 6m36s | 24 | 0.172 | 0.190 | 42.8 | 生のSSIMでは、Gemini 3.6 Flashが両方の目標画像で最高スコアを記録し、最終スコアとピークスコアの両方で優れていましたが、最高のフレームと最終フレームの間で最も大きく変動しました。Gemini 3.6 Flashはまともな見た目でしたが、間違いなく...