更新日:
4/9/2026

画像生成AIはどれがいい?39モデルを文字・編集精度・料金・速度で比較

blog header image

目次

この記事のポイント

OpenRouterのVisual Image Benchmarksは2026年8月時点で39モデルを15の難問に通し、7分類の出力を価格・生成時間と並べて見る仕組みである。
「39モデル中の総合1位」を示すランキングではない。文字、数、位置関係、否定、編集、一貫性など、用途に必要な能力を選んで比較する。
表示単価だけでなく、採用画像までの再生成回数と人の修正時間を含めると、安いモデルが最安とは限らない。
OpenRouter経由と各社公式APIではモデル名、価格、パラメータ、保存条件、先行機能が異なる可能性がある。
導入時は5つの実務ケースから自分の2ケースを選び、同じ入力を10〜100件試して品質・速度・実質コストを測る。

画像生成AIを選ぶ時、「どれが一番きれいか」という問いは役に立ちそうで、仕事では答えを出しにくいものです。

広告なら日本語の文字、ECなら商品の形と色、既存素材の修正なら変更していない部分の維持、連続投稿なら人物やキャラクターの一貫性が優先されます。

写実性が高いモデルでも、必要な文字を間違えれば採用できません。

OpenRouterは2026年8月21日、39の画像モデルを15の難しいプロンプトで比較するVisual Image Benchmarksを公開しました。

課題は7つの能力群に分かれ、各結果を価格と生成時間で並べ替えられます。

これは一つの点数で勝者を決めるランキングではなく、人が出力を見比べ、用途に必要な失敗を探すためのショーケースです。

本稿では39モデルを順番に紹介しません。

モデルは増え、名称も価格も変わるからです。

代わりに7分類を、文字入り広告、商品画像、既存画像編集、キャラクター連続生成、API量産へ翻訳します。

Nano Banana、GPT Image、FLUXなどの名前に引っ張られず、自分の仕事で合格率が高いモデルを選ぶ方法を整理します。

Visual Image Benchmarksは何を測るのか

OpenRouterが用意した15プロンプトは、見栄えの良い作例を集めるためではありません。

満杯のワイングラス、閉じた傘、指やカードの数、長いポスター文字、鏡の反射、広告のないタイムズスクエア、参照画像から人物だけを消す編集など、生成AIが崩れやすい条件をあえて与えています。

7分類は、Improbable scenes、Counting、Text、Spatial relations、Negation、Editing、Consistencyです。

評価結果は瞬時に人間が確認できる設計で、例えばグラスが本当に縁まで満たされているか、指定した数が一致するか、削除対象以外が変わっていないかを見ます。

LLMによる自動採点より、人が気づく細部を直接比較する狙いです。

OpenRouterの7分類 何を試すか 実務へ置き換える例 見るべき失敗
Improbable scenes 学習データに少ない不自然な条件 特殊な商品配置、通常と逆の状態 勝手に一般的な構図へ戻す
Counting 指、カード、サイコロなどの個数 商品数、人物数、部品点数 数不足、重複、形の崩れ
Text 長い文字列、多言語 バナー、パッケージ、店頭POP 誤字、字体混在、文字欠落
Spatial relations 遮蔽、鏡像、位置関係 商品撮影、室内レイアウト 前後左右、反射、影の矛盾
Negation 「ない」を正しく反映 ロゴなし、人物なし、広告なし 禁止要素を勝手に追加
Editing 参照画像の最小変更・除去 商品色変更、背景差替、修正指示 触れていない領域まで変える
Consistency 商品や人物を別場面でも維持 連続広告、キャラクター、カタログ 顔、形、ロゴ、色の漂流

この仕組みの長所は、同じ入力に対する多数モデルの出力を一度に見られることです。

短所は、15プロンプトが自社のブランド、商品、日本語コピーを代表するわけではない点にあります。

ベンチマークで得意に見えたモデルを2〜4個へ絞り、その後に自分の入力で検証する二段階の使い方が適しています。

また、結果画像の価格と生成時間は、その時点の経路、モデル、設定に依存します。

OpenRouterの表示を各社公式APIの固定価格とみなさず、更新日、解像度、出力枚数、プロバイダーを確認してください。

生成時間もネットワーク、混雑、地域で変わるため、相対的な目安として使います。

7分類を実務タスクへ置き換える

文字入り広告ではTextだけでなく、Spatial relationsとEditingも必要です。

日本語コピーが正しくても、見出し、価格、CTAの階層が崩れれば使えません。

最初に完成稿の文字列を固定し、誤字数、文字欠落、改行、余白、修正指示への追従を採点します。

英字だけのサンプルで日本語バナーを判断しないことが肝心です。

商品画像ではConsistency、Counting、Spatial relationsが効きます。

商品のロゴ、ボタン数、縫い目、色、左右の向きが場面を変えても残るかを見ます。

参照画像に近い雰囲気だけでは不十分で、ECでは形状の誤りが返品や表示上の問題につながります。

正面・側面・使用場面の3条件で比較します。

編集ではMinimal diffs、つまり変える場所を限定できるかが中心です。

「背景だけ白に」「シャツだけ赤に」「人物を一人消す」と指示し、対象外の顔、商品、照明、解像感を比較します。

一度で完成しなくても、二回目の修正で前の変更を維持できるかが対話編集の実用性を左右します。

キャラクターの一貫性は、一枚の顔が似ているかだけでは測れません。

同じ人物を正面、横顔、遠景、別衣装、別照明で生成し、顔、髪、体格、小物、画風を別々に採点します。

Consistencyの課題を手掛かりに、実際のストーリーボード5場面へ展開してください。

否定表現も広告制作で重要です。

「ロゴなし」「文字なし」「人物なし」と書いても、学習上よくある要素を補ってしまうモデルがあります。

Negationの結果は、禁止要素の管理に向くかを判断する材料です。

最終公開前には目視だけでなく、ロゴや文字を拡大して確認します。

文字・商品・編集・一貫性で候補を選ぶ

GoogleのGemini画像生成ドキュメントは、Gemini 3.1 Flash Image(Nano Banana 2)を性能、コスト、遅延の均衡、Flash Lite Imageを低遅延・低コスト、Gemini 3 Pro Imageをプロ向け制作と最大4Kとして案内しています。

旧Nano Bananaに当たるGemini 2.5 Flash Imageは速度と1024px出力が軸です。名称だけでなく世代と用途を確認します。

OpenAIのGPT Image系は、指示追従、文字描画、詳細な編集を候補に入れやすい系統です。

公式API料金は画像トークンを含む課金で、品質・解像度・入出力により費用が変わります。

「1枚いくら」と固定せず、実際のパラメータで見積もりを取ります。

Black Forest LabsのFLUX系は、FLUX.2で生成と編集、複数参照、高解像度を展開しています。

公式価格の例ではFLUX.2 kleinが1枚0.014ドルから、proが生成0.03ドルから、maxが0.07ドルから、flexが0.05ドルからです。

解像度に応じた課金なので、OpenRouter上の経路と公式APIで同じ条件かを確認します。

用途 優先する評価軸 候補に入れるモデル系統 テスト方法
文字入り広告 正確な文字、階層、余白、修正性 Gemini画像系、GPT Image系、FLUX.2 flexなど 同じ日本語コピーを10回生成
商品画像 参照保持、材質、色、構図 複数参照対応モデル、FLUX.2系、Recraft系 ロゴと形状を伏せ字なしで照合
既存画像編集 最小差分、マスク、再編集 GPT Image系、Gemini画像系、FLUX編集系 一箇所だけ変更し他領域を比較
キャラクター連続生成 顔、衣装、小物、画風の維持 参照画像・スタイル参照対応モデル 5場面を連続生成し漂流を採点
API量産 単価、P50時間、失敗率、再試行 低遅延モデル、FLUX.2 kleinなど 100件で成功率と実質単価を計測

候補表は「この用途なら必ずこのモデル」という断定ではありません。

各社が更新を続け、OpenRouterの39モデルも入れ替わるからです。

文字なら日本語10件、商品なら参照3方向、編集なら最小差分10件、一貫性なら5場面を使い、採用率で比較します。

モデル名を減らす最初の基準は機能の有無です。

参照画像を複数渡せるか、編集入力を受けるか、必要解像度を出せるか、透明背景やベクターが必要かを確認します。

機能条件を満たさないモデルは、ベンチマーク画像が美しくても候補から外せます。

料金・速度・再生成率で実質コストを出す

表示単価は比較の入口にすぎません。

1枚0.02ドルのモデルが採用まで5回必要なら0.10ドル、0.06ドルのモデルが一度で合格すれば後者の方が安くなります。

さらに誤字修正、切り抜き、色調整へ人が10分かかれば、API差より人件費が大きくなります。

実質コストは「API料金×平均生成回数+人の修正時間+失敗再試行+保管・配信費」で計算します。

商品画像なら100SKU、広告なら月間バナー数を置き、平均と繁忙月を分けます。

生成に成功してもブランド審査で落ちる画像は、採用率へ含めません。

コスト項目 計算方法 改善策
表示単価 1回または1枚のAPI料金 0.04ドル/枚 解像度とモデル階層を分ける
再生成費 表示単価×平均生成回数 3回なら0.12ドル 失敗パターンをプロンプトへ反映
人の修正 修正時間×人件費 誤字修正、切り抜き、色補正 編集精度の高いモデルを選ぶ
待ち時間 生成時間×件数×待機影響 対話編集と夜間バッチで価値が異なる プレビューと本番生成を分離
失敗処理 APIエラー、拒否、空出力の再試行 100件中の失敗数で把握 フォールバックと上限を設定

速度は、量産と対話編集で価値が違います。

夜間に1000枚作るなら総スループットと失敗時の再試行が大切です。

デザイナーが画面で修正を繰り返すなら、一回の待ち時間が作業の流れを止めます。

OpenRouterの生成時間表示を参考にしつつ、自社の地域と時間帯でP50、P95を測ります。

テストでは各応答のmodel、provider、cost、latency、request_idを保存します。

OpenRouterは統一APIの利点がありますが、経路を自動選択するとプロバイダー差が混ざる可能性があります。

比較段階はモデルと経路を固定し、本番では価格・可用性のためのルーティングを検討します。

費用上限も設定してください。

1リクエストの画像枚数、解像度、最大再試行、1日予算を制限し、空出力やポリシー拒否を無限に再送しないようにします。

安価なプレビューで構図を決め、高品質モデルで最終出力する二段階も有効です。

OpenRouterで比較し、公式APIと照合する

最初にVisual Image Benchmarksで、自分の用途に近い分類を二つ選びます。

文字入り広告ならTextとEditing、商品撮影ならConsistencyとSpatial relationsです。

価格または生成時間で並べ替え、出力を目視して候補を3モデル程度へ絞ります。

次にOpenRouterのUnified Image APIまたはChatで、自分の入力を試します。

統一APIは複数プロバイダーの違いを吸収し、能力探索から実装へ移りやすくします。

ただしすべてのモデルが完全に同じパラメータを受けるわけではありません。

参照画像数、編集マスク、出力形式、解像度をモデルごとに確認します。

候補が絞れたら各社公式資料へ戻ります。

公式APIだけの先行機能、OpenRouter経由の価格差、保存期間、学習利用、ウォーターマーク、商用条件、禁止用途を照合します。

OpenRouterの利用規約と上流プロバイダーの条件の双方が関係する場合があります。

独自テストは、プロンプト、参照画像、設定、出力、採否理由を保存します。

採点項目は5つ以内にし、1〜5点と合否を併用します。

デザインの好みだけでなく、誤字、商品形状、禁止要素、編集範囲のように客観確認できる項目を入れます。

最後に、本番へ採用したモデルとフォールバックを決めます。

最高品質モデルが遅い時はプレビューを別モデルにし、障害時は最低限の品質を満たす第二候補へ切り替えます。

新モデルが追加されたら全39モデルを再評価せず、同じテストセットで候補だけを入れ替えれば更新できます。

OpenRouterのVisual Image Benchmarksは、2026年8月時点の39モデルを15プロンプト、7分類で見比べるための資料です。

総合順位を示すものではなく、文字、数、位置関係、否定、編集、一貫性など、仕事で失敗すると困る能力を探すために使います。

文字入り広告、商品画像、既存画像編集、キャラクター連続生成、API量産では、優先軸が違います。

Nano Banana、GPT Image、FLUXなどの系統名から選ぶ前に、必要な機能と合格基準を決めてください。

表示単価に再生成回数と修正時間を足すと、本当に安いモデルが見えてきます。

実践手順はベンチマークで3候補へ絞る、自分の入力で10〜100件試す、公式APIの価格・機能・規約を照合する、採用モデルとフォールバックを決める、の四段階です。

新モデルが出ても同じ評価セットを使えば、流行に振り回されず更新できます。

他の記事も読む

X account logo
Xアカウントをフォロー!
最新の情報をいち早くゲット!
フォローする
back to article page
記事一覧に戻る
シェア
share link icon
‍無料会員登録
支持投票やブックマークなど、すべての機能にアクセスできます。
登録はほんの数秒で完了します!
無料会員登録
ログイン