GPT-5.6、Claude、Gemini、Grok のそれぞれで『モナ・リザ』を描く

2026/07/22 6:13

GPT-5.6、Claude、Gemini、Grok のそれぞれで『モナ・リザ』を描く

RSS: https://news.ycombinator.com/rss

要約

Japanese Translation:

本レポートでは、人間が介在しない状態で、色鉛筆ツールを使用してキャンバス上に目標画像(『モナリザ』や『星月夜』)を再現するか、テキストプロンプトから描画を行う新しい「描画競技場」ベンチマークを紹介します。試験に使用されたモデルは GPT-5.6 Sol、Claude Fable 5、Grok 4.5、および Gemini 3.6 Flash の 4 つであり、2 つの目標画像と 5 つの自由記述型プロンプトを想定して合わせて 28 枚の描画を生成しました。使用されたツールセットには

plan
view_target
view_canvas
set_color
set_brush
set_pressure
(0–1 の不透明度)、
draw
smudge
、および
erase
/
clear_canvas
が含まれます。

GPT-5.6 Sol は芸術的品質と効率性の両面で明確な首位に立ちました。このモデルは個別の

set_color
set_brush
、または
set_pressure
ツールを使用することは一切なく、代わりに各
draw
呼び出し内でそれらの設定を直列で行いました。対照的に Grok 4.5 はこれらの設定ツールを大規模に使用しました(その 1,349 回のツール呼び出しの約 65%)で、描画あたりの平均ステップ数は 99 です。高いツール使用率と低い品質の結果にもかかわらず、キャッシュされた読み込み(約 98%)と低いレートにより、総コストは最低でした。Claude Fable 5 は
smudge
(123 回) に大きく依存し、絶えずレビューを行うことで最も長い時間(7,541 秒、約 12.5 分)を要し、コストも最も高くなりました(7 枚の描画で $160.58)。Gemini 3.6 Flash は最も「没頭するレビュアー」となり、その呼び出しのほぼ 3 分の 1 を
view_canvas
(描画あたり約 23 回の自己レビュー) に使いつつ、
set_*
ツールを使用することはありませんでした。

7 枚の描画における総コストは以下の通りです:GPT-5.6 Sol ($7.74)、Grok 4.5 ($9.21)、Gemini 3.6 Flash ($12.87)、および Claude Fable 5 ($160.58)。トークン使用量は GPT-5.6 Sol が 3.4M、Gemini 3.6 Flash が 27.7M、Grok 4.5 が 34M に達しました。すべてのモデルで構造的類似度 (SSIM) スコアは早期に頭打ちとなっており、最終的な SSIM はピーク値を下回っており、継続的な編集後に劣化が生じていることを示しています。目標に対する客観的 SSIM では Gemini 3.6 Flash が当初最高スコアを記録しましたが、その後はピーク値よりも低いスコアで終了しました。Grok 4.5 は高いツール呼び出し回数にもかかわらず、主に使用不可能な結果を生み出しました。一方、GPT-5.6 Sol は詳細と芸術的出力の品質において圧倒的な首位に立ちました。Claude Fable 5 は品質では第二位でしたが、極めて高いコスト(他モデルの約 20 倍)と GPT-5.6 Sol の結果を上回らない出力時間の組み合わせから、最も魅力的ではないトレードオフと判断されました。

競技場のハネスは github.com/hershalb/canvas-arena でオープンソース化されており、誰もが任意の目標画像やテキストプロンプトで同じセットアップを実行できるようになっています。

本文

描画アリーナ(Drawing Arena)レポート:AI モデルによる自由な絵画表現の評価とコスト分析

はじめに

本研究では、**描画アリーナ(Drawing Arena)**を構築し、大規模言語モデルの自由な芸術創造能力を客観的に評価しました。モデルは白紙のキャンバスと色鉛筆ツールセットが与えられ、研究者は介入することなくプロセスを観察しました。

実験概要

  • 対象モデル: GPT-5.6 Sol, Claude Fable 5, Grok 4.5, Gemini 3.6 Flash の 4 つのビジョンモデルを運用。
  • タスク構成:
    • 画像再現タスク: 「モナ・リザ」「星月夜」の 2 点(客観的スコア可能)。
    • 自由描画タスク: テキストプロンプトのみからの指示 5 種。
  • 総計: 28 点の描画成果物を生成・評価しました。

なぜこの実験を実施するか?

従来のベンチマーク数値ではなく、モデルの創造性と芸術能力を視覚的に示す指標として実施しています。

  • 興味深い洞察: モデルが非構造化で曖昧なタスクにどう取り組むかは、単なるスコアよりも能力を示す強力な指標となります。
  • 「最先端」vs「一般向け」のギャップ浮き彫り: 低コスト・オープンウェイトモデルが実制作タスクで最先端モデルを凌駕し得るかを検証します(例:Kimi K3 のような完全オープンソース化への期待)。
  • 過度なベンチマーク最適化(Benchmaxxing)の回避: 自由なタスクを通じて、実際の業界需要とかけ離れた特化型モデルの実力を曝します。
  • 長時間実行タスクのコスト明示: Claude Fable 5 のような高コスト・低効率なモデルと、GPT-5.6 Sol のバランスを比較し、利用ケースに応じたトレードオフを示唆します。

ツールセット:AI 画家の「筆道具」

全てのモデルに以下の一様なツールセットを付与しました。コードは GitHub でオープンソース化されています

canvas-arena

  • plan
    : ステップ間の思考・計画のためのスケッチパッド(何もしない no-op)。
  • view_target
    : 目標画像の確認。
  • view_canvas
    : 現在のキャンバス表示(スコアリングタイミング)。
  • 属性設定ツール:
    • set_color
      : 色の変更。
    • set_brush
      : 線の太さ変更。
    • set_pressure
      : 圧力設定(0〜1、不透明度制御)。
  • 描画・編集:
    • draw
      : バッチ処理でストロークを描く(単色塗りつぶしなし、レイヤー重ねによるトーン再現)。
    • smudge
      : 長方形領域のぼかし(ブレンディングスタンプ機能)。
    • erase / clear_canvas
      : 部分消去または全ページリセット。

タスク結果:画像再現と自由描画

1. 画像再現タスク(2 点)

目標画像に対する構造的類似度(SSIM)スコアを基準に評価しました。

【モナ・リザ】

  • GPT-5.6 Sol、Claude Fable 5、Grok 4.5、Gemini 3.6 Flash の全モデルで完全なトランスクリプトが利用可能でした。

【星月夜】

  • GPT-5.6 Sol、Claude Fable 5、Grok 4.5、Gemini 3.6 Flash の全モデルで完全なトランスクリプトが利用可能でした。

2. 自由描画タスク(5 点)

画像の提示なしに、テキストプロンプトからの自由表現を試みました。

  1. 「老人の風化した顔」
    • 詳細: 暖かい夕後の日差し、深いしわと髭。
    • 利用可能モデル: GPT-5.6 Sol, Claude Fable 5, Grok 4.5, Gemini 3.6 Flash
  2. 「美しい夕日と海」
    • 詳細: オレンジから紫へのグラデーション空、シルエット地平線。
    • 利用可能モデル: GPT-5.6 Sol, Claude Fable 5, Grok 4.5, Gemini 3.6 Flash
  3. 「赤いバラとレンブラント光」
    • 詳細: ガラス製花瓶、暗い背景、ドラマチックな光。
    • 利用可能モデル: GPT-5.6 Sol, Claude Fable 5, Grok 4.5, Gemini 3.6 Flash
  4. 「夕日に照らされる眠るタビー猫」
    • 詳細: 窓際のコンクリート、丸まった姿勢。
    • 利用可能モデル: GPT-5.6 Sol, Claude Fable 5, Grok 4.5, Gemini 3.6 Flash
  5. 「暖炉のあるキャビン」
    • 詳細: アンバーライト、柔らかい影、温かみ。
    • 利用可能モデル: GPT-5.6 Sol, Claude Fable 5, Grok 4.5, Gemini 3.6 Flash

メイン統計:コストと時間の比較

各モデルにおける平均値と総計を示します。Claude Fable 5 は他のモデルに比べて圧倒的な時間とコストを要しました。

モデル所要時間コスト (USD)SSIM (平均)RMSE (平均)
GPT-5.6 Sol7,296.2 分$7.7446.0116
Claude Fable 575,412.5 分$160.5841.33*27.0**
Grok 4.57,994.8 分$9.2114.3414.34
Gemini 3.6 Flash7,736.9 分$12.8722.6222.62

注記: *Claude Fable 5 の SSIM は平均 41.33%、RMSE は 27.0 と解釈しています。GPT-5.6 Sol の RMSE「16」は単位なしまたは%未満の値と見なされますが、元の記述を尊重して記録しています。

トークン数とコストの詳細分析

  • Claude Fable 5: 約 $160 で 7 点の描画に要しました(他のモデルの約 20 倍)。GPT-5.6 Sol を凌駕しましたが、今回のタスクでは大幅なオーバーヘッドに見合わない結果でした。
  • Grok 4.5: 圧倒的に多くのトークン(3,400 万)を使用しましたが、約 98% がキャッシュ済み読み取りであったため低価に抑えられました(レート自体も最も低い)。
  • Gemini 3.6 Flash: キャッシュ活用により、2,770 万トークンを消費してもコストは抑制されました。

ツール利用の差異:アプローチの違い

同じツールセットでもモデルごとの戦略が全く異なるものでした。

モデル特徴的な行動パターン
GPT-5.6 Sol設定を内包化
set_*
ツールを一度も呼び出さず、各
draw
コマンド内で色や圧力を決定。結果として
draw
,
smudge
,
view_canvas
の呼出に集中。
Grok 4.5設定に執着。ツール呼出の約 65%
set_color/brush/pressure
に費やしました。描画あたり平均 99 ステップ という多岐にわたるプロセスを招いた結果、効率は低くなりました。
Claude Fable 5ぼかしと確認の多用
smudge
を 123 回呼び出し、頻繁なチェックを行いました。
Gemini 3.6 Flash執拗なレビュー。呼出の約 3 分の 1
view_canvas
(描画あたり約 23 回)に充てました。GPT-5.6 Sol と同様に設定ツールは使用しませんでした。

評価:モデルは実際に改善したか?

view_canvas
による定期的な再スコアリングを通じて、以下の傾向が確認されました。

  1. 早期頭打ち現象:
    • Claude Fable 5 は「モナ・リザ」で 27 回のレビューを行いましたがいずれ、約 5 回目以降は類似度が横ばいになりました。
  2. 最終スコアの低下:
    • 全 8 タスクにおいて、終了時のスコアは途中のピークパフォーマンスを下回りました
    • GPT-5.6 Sol (モナ・リザ): ピーク SSIM 0.352 → 終了時 0.325(減少)。
    • Gemini 3.6 Flash: ピーク SSIM 0.449 で最高到達点に達しましたが、最終的に 0.337 と大きく後退しました。これはモデルが「最善点」を超えて編集を続けていた証左です。

客観的類似度(画像再現タスクの詳細)

SSIM(構造的類似度)は 0〜1 の間、RMSE は 0〜255 の範囲で評価されます。

モデルタスク最終 SSIMピーク SSIM最終 RMSE所要時間トークン数 (推定)
GPT-5.6 Solモナ・リザ0.3250.35254.2448m 41s~3.4M
Claude Fable 5モナ・リザ0.2860.28956.98,618m 58s~14.6M
Grok 4.5モナ・リザ0.1510.15295.61,064m 30s~?
Gemini 3.6 Flashモナ・リザ0.337 (最終)0.449 (ピーク)51.1605m 31s~27.7M
GPT-5.6 Sol星月夜0.1300.17937.8235m 47s~16.0M
Claude Fable 5星月夜0.1530.17640.94,311m 30s~12.0M
Grok 4.5星月夜0.0390.039104.9585m 51s~?
Gemini 3.6 Flash星月夜0.1720.19042.8746m 36s~27.7M

分析: Gemini 3.6 Flash は両タスクで生データスコアが高かった一方、Gemini のように「見ればそこそこの品質」であっても、目標出力に最も近いとは断言できません。SSIM は構造的な近さを測定するだけであり、芸術的な質や人間の感覚とは異なる問題です。

我々の見解:総評

🏆 GPT-5.6 Sol:圧倒的なリーダー

  • 星月夜バラの描写は、全バッチの中で最も素晴らしい作品となりました。
  • 白紙キャンバス上で、ストロークごとに丁寧に描き出されました。
  • ほぼ全てのタスクで他モデルより詳細さを凌駕しており(老人漁師のみ例外)、芸術表現において突出した能力を示しました。

❌ Grok 4.5:完全な失敗

  • ほとんど usable なものを作れませんでした。
  • 慌ただしいツール利用にもかかわらず、視覚的出力を理解・評価する信頼性は得られませんでした。

⚖️ Gemini 3.6 Flash:改善の余地あり

  • Grok より優れていましたが、わずかなコスト増(Sol と比較して)でした。
  • Flash モデルを最新バージョンと比べるのは不公平かもしれませんが、トークン出力速度には感銘を受けます。

💸 Claude Fable 5:効率性の極端な欠如

  • 品質では 2 位でしたが、コストと時間は他の約 20 倍
  • 今回のタスクにおいて「魅力的なトレードオフ」とは言えず、非常に遅く遠回りで高価ながら Sol に追いつけていませんでした。

結論: この実験により、低コストでオープンウェイトのモデルが実制作タスクにおいて最先端モデルの代わりとなり得ることが示唆されましたが、芸術表現における「質」や「効率」は依然として重要であることが再確認されました。

同じ日のほかのニュース

一覧に戻る →

2026/07/22 6:09

ヤコビアン仮説の反例についての考察

## Japanese Translation: 元要約は明確で正確であり、主要な点と整合性が取られています。改善は必要ありません。 ## 概要: テキストは決定的に、ヤコビアン予想が三次元以上の次元では偽であることを述べており、$\mathbb{C}^n$ から $\mathbb{C}^n$ への写像で非ゼロ定数のヤコビアンを持つものがすべて全的に逆関数を持つというアイデアを反証することで、長年の数学的議論を解決します。研究者たちは、三次変数における次数七の多項式写像を構成することによってこれを証明しました。この写像は非ゼロ定数のヤコビアンを持ちながら全球的反関数を持たず、ヤコビアンの行列における巨大なキャンセル(非定数係数の消滅)に依存して局所的逆関性を維持しつつ全球的な有効性を回避しています。予想は二次元的には依然として未解決であり、一元的には自明に真です。幾何学的な再定式化により、$\mathbb{C}^n$ と同型なアフィン多様体 $X$ に対して、局所的単射(根解析を用いた証明で $\mathrm{PGL}_2$ ヨーブ変換とゼロでない結果ant を用いて確立)だが全球的には単射ではないような写像が存在することが示されます。ベクトル空間の対称化乗幂と低次数多項式の積(線形 × 二次 = 三次)に基づく構築では、五次元群作用による巨大な等変性を活用し、結果ant 条件を用いたスケーリング対称性を通じて正規化を行います。特定の三次元的アフィン切片による次元削減は、二次曲面の同型問題を回避しつつ主要な性質を保持し、原点ファイバーを除いて座標に対して三次方程式と二次方程式を解くことで双有理同値を可能にし、アフィン空間と同型のアフィン多様体を導きます。ビッグ-O 記法を用いた漸近解析は、全てのファイバー(極限ケースを含む)をカバーする全球的多項式パラメータ化を確認します。AI チャットボットを含む高度な計算ツールは、漸近成長率とファイバーパラメータ化に関わる複雑な計算を検証し、得られた写像是自明な変数変化を除いて元の反例と一致します。この画期的な進展により、分野の焦点は普遍的反證法の探求から、局所的性質が全球的な振る舞いを保証しない特定の実例への理解へとシフトしました。

2026/07/22 0:17

Gemini 3.6 Flash、3.5 Flash-Lite および 3.5 Flash Cyber

## Japanese 翻訳: 以下の改良版は、欠落していた価格データ、具体的なベンチマークハイライト、および販売チャネルを統合し、「要点リスト」への完全な忠実性を確保しています: ## 改善されたサマリー Google は正式に、AI エージェントの効率を大幅に向上させ、レイテンシを低減し、コストを削減することを目的とした 3 つの進化した Gemini モデル——3.6 Flash、3.5 Flash-Lite、および専門性の高い 3.5 Flash Cyber を紹介しました。**Gemini 3.6 Flash**は、トークン使用量を最大で 17%削減(入力トークンあたり$1.50 で提供)しながら、より高い精度を実現します。DeepSWE のようなベンチマークでは、先行する 3.5 Flash の 37% に対して 49% という成功率を達成し、ML リサーチおよびコンピューター使用に関する能力にも顕著な改善が見られます。**Gemini 3.5 Flash-Lite**はシリーズ内で最も高速なモデルとして際立っており、1 秒間に 350 以上の出力トークンを処理(入力トークンあたり$0.3 で提供)し、複数のコーディングベンチマークにおいて 3.5 Flash および 3 Flash を凌駕しています。 セキュリティニーズに応えるため、Google は CodeMender エコシステム内でのサイバーセキュリティ脆弱性の特定と是正に最適化された**3.5 Flash Cyber**バリアントをローンチしました。これらの技術の二重用途特性により、この特定のモデルは、限定されたパイロットプログラムを通じて検証済みの政府機関および信頼パートナーのみが利用可能です。すべての新モデルは直ちに Gemini API、Google AI Studio、Android Studio、およびその他の開発プラットフォーム経由で利用可能であり、すぐに Google Search への展開も始まっています。

2026/07/22 0:41

長らく死んだとみられていた西アフリカに、豊かなサンゴ礁が発見された。

## Japanese 翻訳: 1960 年代の初期調査で西アフリカベニン海岸沖の健康なサンゴ礁が存在しないと見落されていたものが、研究者によってついにその存在が確認され、世界中で半分以上の礁域が減少しているというグローバルなトレンドに抗した。水深 175 フィート(約 53 メートル)を超える深い海域においても、岩盤基質上に多様な生物が生息し、繁栄している。2025 年 1 月に National Geographic Explorers グランツから 2 万ドルの助成金を獲得した Gérard Zinzindohoué 氏を率いるチームは、高価なソナー費用が予算の大半を食い込み、欧州のサプライヤーとの銀行取引上の問題といった重大な物流上の課題を克服した。常設の研究船を持たないため、彼らはハイテクソナーを搭載したピロウで現地漁師に offshore へ運ばれ、海底を探測して撮影を行った。この探査では、軟体珊瑚 6 タイプ、黒珊瑚 2 タイプ、魚類 8 種を特定し、該地域を「中光層サンゴ生態系(mesophotic coral ecosystem)」に分類した——これはサンゴ礁形成の限界深度にある光依存型コミュニティである。地元研究者である Houangninan Midinoudewa 氏は、現在、稀有种類であるトゲメダイアザルシャーク、シルクイースカ、ブローンスケート、マーズレットエイを含む稀有な種々を守るため、「重要なエイとサメ地域(Important Shark and Ray Area)」としての指定を求めている。保存活動だけでなく、この未撹乱の生態系は、炭素年代測定や古気候学研究における独自の潜在力を提供し、広範な劣化に反して回復力ある天然資源を開示するとともに、科学発掘への新たな道を開く。

GPT-5.6、Claude、Gemini、Grok のそれぞれで『モナ・リザ』を描く | そっか~ニュース