
画像生成AIを選ぶ時、「どれが一番きれいか」という問いは役に立ちそうで、仕事では答えを出しにくいものです。
広告なら日本語の文字、ECなら商品の形と色、既存素材の修正なら変更していない部分の維持、連続投稿なら人物やキャラクターの一貫性が優先されます。
写実性が高いモデルでも、必要な文字を間違えれば採用できません。
OpenRouterは2026年8月21日、39の画像モデルを15の難しいプロンプトで比較するVisual Image Benchmarksを公開しました。
課題は7つの能力群に分かれ、各結果を価格と生成時間で並べ替えられます。
これは一つの点数で勝者を決めるランキングではなく、人が出力を見比べ、用途に必要な失敗を探すためのショーケースです。
本稿では39モデルを順番に紹介しません。
モデルは増え、名称も価格も変わるからです。
代わりに7分類を、文字入り広告、商品画像、既存画像編集、キャラクター連続生成、API量産へ翻訳します。
Nano Banana、GPT Image、FLUXなどの名前に引っ張られず、自分の仕事で合格率が高いモデルを選ぶ方法を整理します。
OpenRouterが用意した15プロンプトは、見栄えの良い作例を集めるためではありません。
満杯のワイングラス、閉じた傘、指やカードの数、長いポスター文字、鏡の反射、広告のないタイムズスクエア、参照画像から人物だけを消す編集など、生成AIが崩れやすい条件をあえて与えています。
7分類は、Improbable scenes、Counting、Text、Spatial relations、Negation、Editing、Consistencyです。
評価結果は瞬時に人間が確認できる設計で、例えばグラスが本当に縁まで満たされているか、指定した数が一致するか、削除対象以外が変わっていないかを見ます。
LLMによる自動採点より、人が気づく細部を直接比較する狙いです。
この仕組みの長所は、同じ入力に対する多数モデルの出力を一度に見られることです。
短所は、15プロンプトが自社のブランド、商品、日本語コピーを代表するわけではない点にあります。
ベンチマークで得意に見えたモデルを2〜4個へ絞り、その後に自分の入力で検証する二段階の使い方が適しています。
また、結果画像の価格と生成時間は、その時点の経路、モデル、設定に依存します。
OpenRouterの表示を各社公式APIの固定価格とみなさず、更新日、解像度、出力枚数、プロバイダーを確認してください。
生成時間もネットワーク、混雑、地域で変わるため、相対的な目安として使います。
文字入り広告ではTextだけでなく、Spatial relationsとEditingも必要です。
日本語コピーが正しくても、見出し、価格、CTAの階層が崩れれば使えません。
最初に完成稿の文字列を固定し、誤字数、文字欠落、改行、余白、修正指示への追従を採点します。
英字だけのサンプルで日本語バナーを判断しないことが肝心です。
商品画像ではConsistency、Counting、Spatial relationsが効きます。
商品のロゴ、ボタン数、縫い目、色、左右の向きが場面を変えても残るかを見ます。
参照画像に近い雰囲気だけでは不十分で、ECでは形状の誤りが返品や表示上の問題につながります。
正面・側面・使用場面の3条件で比較します。
編集ではMinimal diffs、つまり変える場所を限定できるかが中心です。
「背景だけ白に」「シャツだけ赤に」「人物を一人消す」と指示し、対象外の顔、商品、照明、解像感を比較します。
一度で完成しなくても、二回目の修正で前の変更を維持できるかが対話編集の実用性を左右します。
キャラクターの一貫性は、一枚の顔が似ているかだけでは測れません。
同じ人物を正面、横顔、遠景、別衣装、別照明で生成し、顔、髪、体格、小物、画風を別々に採点します。
Consistencyの課題を手掛かりに、実際のストーリーボード5場面へ展開してください。
否定表現も広告制作で重要です。
「ロゴなし」「文字なし」「人物なし」と書いても、学習上よくある要素を補ってしまうモデルがあります。
Negationの結果は、禁止要素の管理に向くかを判断する材料です。
最終公開前には目視だけでなく、ロゴや文字を拡大して確認します。
GoogleのGemini画像生成ドキュメントは、Gemini 3.1 Flash Image(Nano Banana 2)を性能、コスト、遅延の均衡、Flash Lite Imageを低遅延・低コスト、Gemini 3 Pro Imageをプロ向け制作と最大4Kとして案内しています。
旧Nano Bananaに当たるGemini 2.5 Flash Imageは速度と1024px出力が軸です。名称だけでなく世代と用途を確認します。
OpenAIのGPT Image系は、指示追従、文字描画、詳細な編集を候補に入れやすい系統です。
公式API料金は画像トークンを含む課金で、品質・解像度・入出力により費用が変わります。
「1枚いくら」と固定せず、実際のパラメータで見積もりを取ります。
Black Forest LabsのFLUX系は、FLUX.2で生成と編集、複数参照、高解像度を展開しています。
公式価格の例ではFLUX.2 kleinが1枚0.014ドルから、proが生成0.03ドルから、maxが0.07ドルから、flexが0.05ドルからです。
解像度に応じた課金なので、OpenRouter上の経路と公式APIで同じ条件かを確認します。
候補表は「この用途なら必ずこのモデル」という断定ではありません。
各社が更新を続け、OpenRouterの39モデルも入れ替わるからです。
文字なら日本語10件、商品なら参照3方向、編集なら最小差分10件、一貫性なら5場面を使い、採用率で比較します。
モデル名を減らす最初の基準は機能の有無です。
参照画像を複数渡せるか、編集入力を受けるか、必要解像度を出せるか、透明背景やベクターが必要かを確認します。
機能条件を満たさないモデルは、ベンチマーク画像が美しくても候補から外せます。
表示単価は比較の入口にすぎません。
1枚0.02ドルのモデルが採用まで5回必要なら0.10ドル、0.06ドルのモデルが一度で合格すれば後者の方が安くなります。
さらに誤字修正、切り抜き、色調整へ人が10分かかれば、API差より人件費が大きくなります。
実質コストは「API料金×平均生成回数+人の修正時間+失敗再試行+保管・配信費」で計算します。
商品画像なら100SKU、広告なら月間バナー数を置き、平均と繁忙月を分けます。
生成に成功してもブランド審査で落ちる画像は、採用率へ含めません。
速度は、量産と対話編集で価値が違います。
夜間に1000枚作るなら総スループットと失敗時の再試行が大切です。
デザイナーが画面で修正を繰り返すなら、一回の待ち時間が作業の流れを止めます。
OpenRouterの生成時間表示を参考にしつつ、自社の地域と時間帯でP50、P95を測ります。
テストでは各応答のmodel、provider、cost、latency、request_idを保存します。
OpenRouterは統一APIの利点がありますが、経路を自動選択するとプロバイダー差が混ざる可能性があります。
比較段階はモデルと経路を固定し、本番では価格・可用性のためのルーティングを検討します。
費用上限も設定してください。
1リクエストの画像枚数、解像度、最大再試行、1日予算を制限し、空出力やポリシー拒否を無限に再送しないようにします。
安価なプレビューで構図を決め、高品質モデルで最終出力する二段階も有効です。
最初にVisual Image Benchmarksで、自分の用途に近い分類を二つ選びます。
文字入り広告ならTextとEditing、商品撮影ならConsistencyとSpatial relationsです。
価格または生成時間で並べ替え、出力を目視して候補を3モデル程度へ絞ります。
次にOpenRouterのUnified Image APIまたはChatで、自分の入力を試します。
統一APIは複数プロバイダーの違いを吸収し、能力探索から実装へ移りやすくします。
ただしすべてのモデルが完全に同じパラメータを受けるわけではありません。
参照画像数、編集マスク、出力形式、解像度をモデルごとに確認します。
候補が絞れたら各社公式資料へ戻ります。
公式APIだけの先行機能、OpenRouter経由の価格差、保存期間、学習利用、ウォーターマーク、商用条件、禁止用途を照合します。
OpenRouterの利用規約と上流プロバイダーの条件の双方が関係する場合があります。
独自テストは、プロンプト、参照画像、設定、出力、採否理由を保存します。
採点項目は5つ以内にし、1〜5点と合否を併用します。
デザインの好みだけでなく、誤字、商品形状、禁止要素、編集範囲のように客観確認できる項目を入れます。
最後に、本番へ採用したモデルとフォールバックを決めます。
最高品質モデルが遅い時はプレビューを別モデルにし、障害時は最低限の品質を満たす第二候補へ切り替えます。
新モデルが追加されたら全39モデルを再評価せず、同じテストセットで候補だけを入れ替えれば更新できます。
OpenRouterのVisual Image Benchmarksは、2026年8月時点の39モデルを15プロンプト、7分類で見比べるための資料です。
総合順位を示すものではなく、文字、数、位置関係、否定、編集、一貫性など、仕事で失敗すると困る能力を探すために使います。
文字入り広告、商品画像、既存画像編集、キャラクター連続生成、API量産では、優先軸が違います。
Nano Banana、GPT Image、FLUXなどの系統名から選ぶ前に、必要な機能と合格基準を決めてください。
表示単価に再生成回数と修正時間を足すと、本当に安いモデルが見えてきます。
実践手順はベンチマークで3候補へ絞る、自分の入力で10〜100件試す、公式APIの価格・機能・規約を照合する、採用モデルとフォールバックを決める、の四段階です。
新モデルが出ても同じ評価セットを使えば、流行に振り回されず更新できます。

