
2026/07/22 6:13
GPT-5.6、Claude、Gemini、Grok のそれぞれで『モナ・リザ』を描く
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
本レポートでは、人間が介在しない状態で、色鉛筆ツールを使用してキャンバス上に目標画像(『モナリザ』や『星月夜』)を再現するか、テキストプロンプトから描画を行う新しい「描画競技場」ベンチマークを紹介します。試験に使用されたモデルは GPT-5.6 Sol、Claude Fable 5、Grok 4.5、および Gemini 3.6 Flash の 4 つであり、2 つの目標画像と 5 つの自由記述型プロンプトを想定して合わせて 28 枚の描画を生成しました。使用されたツールセットには
plan、view_target、view_canvas、set_color、set_brush、set_pressure(0–1 の不透明度)、draw、smudge、および erase/clear_canvas が含まれます。
GPT-5.6 Sol は芸術的品質と効率性の両面で明確な首位に立ちました。このモデルは個別の
set_color、set_brush、または set_pressure ツールを使用することは一切なく、代わりに各 draw 呼び出し内でそれらの設定を直列で行いました。対照的に Grok 4.5 はこれらの設定ツールを大規模に使用しました(その 1,349 回のツール呼び出しの約 65%)で、描画あたりの平均ステップ数は 99 です。高いツール使用率と低い品質の結果にもかかわらず、キャッシュされた読み込み(約 98%)と低いレートにより、総コストは最低でした。Claude Fable 5 は smudge(123 回) に大きく依存し、絶えずレビューを行うことで最も長い時間(7,541 秒、約 12.5 分)を要し、コストも最も高くなりました(7 枚の描画で $160.58)。Gemini 3.6 Flash は最も「没頭するレビュアー」となり、その呼び出しのほぼ 3 分の 1 を view_canvas(描画あたり約 23 回の自己レビュー) に使いつつ、set_* ツールを使用することはありませんでした。
7 枚の描画における総コストは以下の通りです:GPT-5.6 Sol ($7.74)、Grok 4.5 ($9.21)、Gemini 3.6 Flash ($12.87)、および Claude Fable 5 ($160.58)。トークン使用量は GPT-5.6 Sol が 3.4M、Gemini 3.6 Flash が 27.7M、Grok 4.5 が 34M に達しました。すべてのモデルで構造的類似度 (SSIM) スコアは早期に頭打ちとなっており、最終的な SSIM はピーク値を下回っており、継続的な編集後に劣化が生じていることを示しています。目標に対する客観的 SSIM では Gemini 3.6 Flash が当初最高スコアを記録しましたが、その後はピーク値よりも低いスコアで終了しました。Grok 4.5 は高いツール呼び出し回数にもかかわらず、主に使用不可能な結果を生み出しました。一方、GPT-5.6 Sol は詳細と芸術的出力の品質において圧倒的な首位に立ちました。Claude Fable 5 は品質では第二位でしたが、極めて高いコスト(他モデルの約 20 倍)と GPT-5.6 Sol の結果を上回らない出力時間の組み合わせから、最も魅力的ではないトレードオフと判断されました。
競技場のハネスは github.com/hershalb/canvas-arena でオープンソース化されており、誰もが任意の目標画像やテキストプロンプトで同じセットアップを実行できるようになっています。
本文
描画アリーナ(Drawing Arena)レポート:AI モデルによる自由な絵画表現の評価とコスト分析
はじめに
本研究では、**描画アリーナ(Drawing Arena)**を構築し、大規模言語モデルの自由な芸術創造能力を客観的に評価しました。モデルは白紙のキャンバスと色鉛筆ツールセットが与えられ、研究者は介入することなくプロセスを観察しました。
実験概要
- 対象モデル: GPT-5.6 Sol, Claude Fable 5, Grok 4.5, Gemini 3.6 Flash の 4 つのビジョンモデルを運用。
- タスク構成:
- 画像再現タスク: 「モナ・リザ」「星月夜」の 2 点(客観的スコア可能)。
- 自由描画タスク: テキストプロンプトのみからの指示 5 種。
- 総計: 28 点の描画成果物を生成・評価しました。
なぜこの実験を実施するか?
従来のベンチマーク数値ではなく、モデルの創造性と芸術能力を視覚的に示す指標として実施しています。
- 興味深い洞察: モデルが非構造化で曖昧なタスクにどう取り組むかは、単なるスコアよりも能力を示す強力な指標となります。
- 「最先端」vs「一般向け」のギャップ浮き彫り: 低コスト・オープンウェイトモデルが実制作タスクで最先端モデルを凌駕し得るかを検証します(例:Kimi K3 のような完全オープンソース化への期待)。
- 過度なベンチマーク最適化(Benchmaxxing)の回避: 自由なタスクを通じて、実際の業界需要とかけ離れた特化型モデルの実力を曝します。
- 長時間実行タスクのコスト明示: Claude Fable 5 のような高コスト・低効率なモデルと、GPT-5.6 Sol のバランスを比較し、利用ケースに応じたトレードオフを示唆します。
ツールセット:AI 画家の「筆道具」
全てのモデルに以下の一様なツールセットを付与しました。コードは GitHub でオープンソース化されています
。canvas-arena
: ステップ間の思考・計画のためのスケッチパッド(何もしない no-op)。plan
: 目標画像の確認。view_target
: 現在のキャンバス表示(スコアリングタイミング)。view_canvas- 属性設定ツール:
: 色の変更。set_color
: 線の太さ変更。set_brush
: 圧力設定(0〜1、不透明度制御)。set_pressure
- 描画・編集:
: バッチ処理でストロークを描く(単色塗りつぶしなし、レイヤー重ねによるトーン再現)。draw
: 長方形領域のぼかし(ブレンディングスタンプ機能)。smudge
: 部分消去または全ページリセット。erase / clear_canvas
タスク結果:画像再現と自由描画
1. 画像再現タスク(2 点)
目標画像に対する構造的類似度(SSIM)スコアを基準に評価しました。
【モナ・リザ】
- GPT-5.6 Sol、Claude Fable 5、Grok 4.5、Gemini 3.6 Flash の全モデルで完全なトランスクリプトが利用可能でした。
【星月夜】
- GPT-5.6 Sol、Claude Fable 5、Grok 4.5、Gemini 3.6 Flash の全モデルで完全なトランスクリプトが利用可能でした。
2. 自由描画タスク(5 点)
画像の提示なしに、テキストプロンプトからの自由表現を試みました。
- 「老人の風化した顔」
- 詳細: 暖かい夕後の日差し、深いしわと髭。
- 利用可能モデル: GPT-5.6 Sol, Claude Fable 5, Grok 4.5, Gemini 3.6 Flash
- 「美しい夕日と海」
- 詳細: オレンジから紫へのグラデーション空、シルエット地平線。
- 利用可能モデル: GPT-5.6 Sol, Claude Fable 5, Grok 4.5, Gemini 3.6 Flash
- 「赤いバラとレンブラント光」
- 詳細: ガラス製花瓶、暗い背景、ドラマチックな光。
- 利用可能モデル: GPT-5.6 Sol, Claude Fable 5, Grok 4.5, Gemini 3.6 Flash
- 「夕日に照らされる眠るタビー猫」
- 詳細: 窓際のコンクリート、丸まった姿勢。
- 利用可能モデル: GPT-5.6 Sol, Claude Fable 5, Grok 4.5, Gemini 3.6 Flash
- 「暖炉のあるキャビン」
- 詳細: アンバーライト、柔らかい影、温かみ。
- 利用可能モデル: GPT-5.6 Sol, Claude Fable 5, Grok 4.5, Gemini 3.6 Flash
メイン統計:コストと時間の比較
各モデルにおける平均値と総計を示します。Claude Fable 5 は他のモデルに比べて圧倒的な時間とコストを要しました。
| モデル | 所要時間 | コスト (USD) | SSIM (平均) | RMSE (平均) |
|---|---|---|---|---|
| GPT-5.6 Sol | 7,296.2 分 | $7.74 | 46.01 | 16 |
| Claude Fable 5 | 75,412.5 分 | $160.58 | 41.33* | 27.0** |
| Grok 4.5 | 7,994.8 分 | $9.21 | 14.34 | 14.34 |
| Gemini 3.6 Flash | 7,736.9 分 | $12.87 | 22.62 | 22.62 |
注記: *Claude Fable 5 の SSIM は平均 41.33%、RMSE は 27.0 と解釈しています。GPT-5.6 Sol の RMSE「16」は単位なしまたは%未満の値と見なされますが、元の記述を尊重して記録しています。
トークン数とコストの詳細分析
- Claude Fable 5: 約 $160 で 7 点の描画に要しました(他のモデルの約 20 倍)。GPT-5.6 Sol を凌駕しましたが、今回のタスクでは大幅なオーバーヘッドに見合わない結果でした。
- Grok 4.5: 圧倒的に多くのトークン(3,400 万)を使用しましたが、約 98% がキャッシュ済み読み取りであったため低価に抑えられました(レート自体も最も低い)。
- Gemini 3.6 Flash: キャッシュ活用により、2,770 万トークンを消費してもコストは抑制されました。
ツール利用の差異:アプローチの違い
同じツールセットでもモデルごとの戦略が全く異なるものでした。
| モデル | 特徴的な行動パターン |
|---|---|
| GPT-5.6 Sol | 設定を内包化。 ツールを一度も呼び出さず、各 コマンド内で色や圧力を決定。結果として , , の呼出に集中。 |
| Grok 4.5 | 設定に執着。ツール呼出の約 65% を に費やしました。描画あたり平均 99 ステップ という多岐にわたるプロセスを招いた結果、効率は低くなりました。 |
| Claude Fable 5 | ぼかしと確認の多用。 を 123 回呼び出し、頻繁なチェックを行いました。 |
| Gemini 3.6 Flash | 執拗なレビュー。呼出の約 3 分の 1 を (描画あたり約 23 回)に充てました。GPT-5.6 Sol と同様に設定ツールは使用しませんでした。 |
評価:モデルは実際に改善したか?
view_canvas による定期的な再スコアリングを通じて、以下の傾向が確認されました。
- 早期頭打ち現象:
- Claude Fable 5 は「モナ・リザ」で 27 回のレビューを行いましたがいずれ、約 5 回目以降は類似度が横ばいになりました。
- 最終スコアの低下:
- 全 8 タスクにおいて、終了時のスコアは途中のピークパフォーマンスを下回りました。
- GPT-5.6 Sol (モナ・リザ): ピーク SSIM 0.352 → 終了時 0.325(減少)。
- Gemini 3.6 Flash: ピーク SSIM 0.449 で最高到達点に達しましたが、最終的に 0.337 と大きく後退しました。これはモデルが「最善点」を超えて編集を続けていた証左です。
客観的類似度(画像再現タスクの詳細)
SSIM(構造的類似度)は 0〜1 の間、RMSE は 0〜255 の範囲で評価されます。
| モデル | タスク | 最終 SSIM | ピーク SSIM | 最終 RMSE | 所要時間 | トークン数 (推定) |
|---|---|---|---|---|---|---|
| GPT-5.6 Sol | モナ・リザ | 0.325 | 0.352 | 54.2 | 448m 41s | ~3.4M |
| Claude Fable 5 | モナ・リザ | 0.286 | 0.289 | 56.9 | 8,618m 58s | ~14.6M |
| Grok 4.5 | モナ・リザ | 0.151 | 0.152 | 95.6 | 1,064m 30s | ~? |
| Gemini 3.6 Flash | モナ・リザ | 0.337 (最終) | 0.449 (ピーク) | 51.1 | 605m 31s | ~27.7M |
| GPT-5.6 Sol | 星月夜 | 0.130 | 0.179 | 37.8 | 235m 47s | ~16.0M |
| Claude Fable 5 | 星月夜 | 0.153 | 0.176 | 40.9 | 4,311m 30s | ~12.0M |
| Grok 4.5 | 星月夜 | 0.039 | 0.039 | 104.9 | 585m 51s | ~? |
| Gemini 3.6 Flash | 星月夜 | 0.172 | 0.190 | 42.8 | 746m 36s | ~27.7M |
分析: Gemini 3.6 Flash は両タスクで生データスコアが高かった一方、Gemini のように「見ればそこそこの品質」であっても、目標出力に最も近いとは断言できません。SSIM は構造的な近さを測定するだけであり、芸術的な質や人間の感覚とは異なる問題です。
我々の見解:総評
🏆 GPT-5.6 Sol:圧倒的なリーダー
- 星月夜とバラの描写は、全バッチの中で最も素晴らしい作品となりました。
- 白紙キャンバス上で、ストロークごとに丁寧に描き出されました。
- ほぼ全てのタスクで他モデルより詳細さを凌駕しており(老人漁師のみ例外)、芸術表現において突出した能力を示しました。
❌ Grok 4.5:完全な失敗
- ほとんど usable なものを作れませんでした。
- 慌ただしいツール利用にもかかわらず、視覚的出力を理解・評価する信頼性は得られませんでした。
⚖️ Gemini 3.6 Flash:改善の余地あり
- Grok より優れていましたが、わずかなコスト増(Sol と比較して)でした。
- Flash モデルを最新バージョンと比べるのは不公平かもしれませんが、トークン出力速度には感銘を受けます。
💸 Claude Fable 5:効率性の極端な欠如
- 品質では 2 位でしたが、コストと時間は他の約 20 倍。
- 今回のタスクにおいて「魅力的なトレードオフ」とは言えず、非常に遅く遠回りで高価ながら Sol に追いつけていませんでした。
結論: この実験により、低コストでオープンウェイトのモデルが実制作タスクにおいて最先端モデルの代わりとなり得ることが示唆されましたが、芸術表現における「質」や「効率」は依然として重要であることが再確認されました。