更新日:
9/8/2026

【2026年8月最新】MiniMax H3の必要スペックは?VRAM 8GB・12GB・16GB・24GB別に解説

blog header image

目次

この記事のポイント

MiniMaxとComfyUIは、MiniMax H3の公式最低VRAMを公表していない。8GBや12GBの成功例は最低保証ではない
ComfyUI公式のT2V・I2V向け軽量構成は約42.5GB。初心者はpruned INT8+NVFP4/AWQ Text Encoderから検討しやすい
8GB・12GBは強いオフロードが前提。16GBは試行錯誤が現実的になり、24GB以上では待ち時間と設定の余裕が増える
RAMは32GBでぎりぎり、64GBが現実的な基準。BF16や複雑なR2Vを検証するなら96~128GB以上も候補になる
ローカルで公開されているH3-Baseは標準768p。公式品質の2Kや低頻度利用ではAPIの方が合理的な場合がある

「MiniMax H3はVRAM 8GBでも動く」という情報がある一方で、100GBを超えるシステムRAMを用意した検証や、RTX 5090でもBF16の読み込みに失敗したという報告もあります。

これでは、自分のPCで使えるのか判断しにくいのも無理はありません。

結論から言えば、MiniMax H3の必要スペックはVRAM容量だけでは決まりません。

選ぶモデル形式、出力解像度、動画時間、T2V・I2V・R2Vの違い、CPUオフロード、システムRAM、SSD、GPU世代の組み合わせで、起動の可否と生成時間が大きく変わります。

さらに、「一度だけ生成に成功した」と「何度も設定を変えながら安定運用できる」は別の基準です。

本記事では、前者を最低動作、後者を実用と呼び分けます。MiniMax H3の概要やローカル導入手順、2K・音声同時生成の仕組みは、既存記事のMiniMax H3の機能とローカル導入方法で確認してください。

ここではPCスペック、モデル形式、メモリ、生成速度に絞ります。

最初に結論:MiniMax H3の必要スペック早見表

MiniMaxもComfyUIも、2026年8月9日時点で「最低VRAMは何GB」とする保証値を示していません。

ComfyUIはDynamic VRAMオフロードと軽量モデルを組み合わせ、RTX 3060のようなGPUでも動かせると説明していますが、これは最低動作保証ではなく、最適化後の実行例です。

以下は、MiniMax公式モデルカードComfyUI公式ワークフロー、公式配布ファイル、公開された実機情報を基にした参考構成です。

PCを新規購入する場合は最低動作ではなく、「初心者向けの現実的な構成」以上を基準にしてください。

本記事では、配布元のモデルカード・ドキュメント・ファイル一覧を「公式情報」、個人が公開した結果を「実機報告」、両者から導いた構成を「編集上の目安」として区別します。

実機報告は条件が揃った範囲だけを記載し、不明な項目は推測で補いません。

目的 GPUの目安 VRAM システムRAM 空きストレージ モデル形式 解像度・動画時間の出発点 オフロード 初心者への推奨度
最低動作を試す RTX 3060 12GB、8GB級RTXは実験扱い 8~12GB 32~64GB 70GB以上 pruned INT8+NVFP4/AWQ TE 0.4MP前後、約480p、3~5秒 必須 低い
初心者向けの現実的な構成 RTX 4060 Ti 16GB、RTX 4070 Ti SUPER、RTX 5070 Ti 16GB 64GB 100GB以上 pruned INT8+NVFP4/AWQ TE 480pから開始、安定後に768p、3~5秒 原則必要 高い
生成時間と安定性を重視 RTX 3090・4090 24GB 64~128GB 120GB以上 pruned INT8またはFP8。環境によりpruned BF16を検証 768p、5~10秒から 残る 高い
BF16や高負荷ワークフローを検証 RTX 5090 32GB、RTX PRO 6000 Blackwell 96GB、複数GPU 32GB以上 128GB以上 150~300GB以上 pruned BF16またはfull BF16 条件を固定し段階的に拡張 32GBでも必要になり得る 研究・検証向け

16GB VRAMは「全部がGPUに収まる容量」ではありません。軽量構成でもダウンロード容量は約42.5GBあるため、Text Encoderや生成モデルの重みをVRAMとRAMの間で入れ替えながら処理します。

ただし、8GBや12GBよりVRAMへ置ける範囲が広く、設定変更と再生成を繰り返しやすくなるため、個人向けの現実的な基準になります。

VRAM・システムRAM別の動作目安

MiniMax H3はなぜ重いのか

MiniMax H3の中心には、33B(約330億パラメータ)のH3-Omni-Transformerがあります。

公式説明では約13BがAdaLN関連の分岐にあり、推論専用のpruned版ではこの部分を削減できます。

それでも、映像と音声の長い潜在表現を同じ生成処理で扱うため、一般的な画像生成モデルより計算量とメモリ転送量が大きくなります。

モデル本体だけをダウンロードしても動きません。

文章や参照素材を解釈するQwen3-VL-32B系Text Encoder、映像を圧縮・復元するVideo VAE、ステレオ音声を処理するAudio VAEが必要です。

ComfyUI公式の軽量構成では、生成モデルが21GB、Text Encoderが15.7GB、2種類のVAEが合計約5.8GBあります。

負荷は生成モードでも変わります。T2Vはテキストだけを条件にしますが、I2Vは開始画像や終了画像を追加で符号化します。

R2Vは最大9枚の画像、3本の動画、3本の音声を参照でき、参照素材の解像度や長さが増えるほど前処理とメモリ使用量が増加します。

R2VではT2V・I2V用のfl2vaとは別に、ref2va生成モデルも必要です。

動画はフレーム数が増えるほど処理対象が長くなります。ComfyUIの公式テンプレートは24fpsで、長さを17フレーム単位のブロックに合わせます。

解像度と動画時間を同時に上げると、画素数だけでなく処理するフレームも増えるため、必要メモリと時間が急増します。

図解候補2の挿入位置
「SSD上のモデルファイル → システムRAM/ページキャッシュ → VRAM → 生成中の映像・音声latent」という流れを示し、VRAM不足時にRAM、RAM不足時にSSD上の仮想メモリへ退避するほど遅くなる関係を図解する。

VRAM 8GB・12GB・16GB・24GB・32GB以上で何ができるか

図解候補1の挿入位置
VRAM 8GB・12GB・16GB・24GB・32GB以上について、「試せるモデル形式」「現実的な解像度」「オフロード量」「用途」を一枚で比較する。

VRAM 動作の位置づけ 選びやすい形式 最初に試す条件 RAMの目安 主な制約
8GB コミュニティの動作例がある実験域 pruned INT8+NVFP4/AWQ TE 低解像度、短時間、T2Vまたは単純なI2V 64GBを優先 強いオフロード、長い待ち時間、R2Vの余裕が小さい
12GB 最低動作を試しやすい pruned INT8+NVFP4/AWQ TE 832×480前後、約5秒 32GB最低、64GB推奨 768pや長尺で待ち時間が増え、環境差も大きい
16GB 個人利用の現実的な出発点 pruned INT8中心。GPU世代によりFP8も比較 0.4MP・5秒から768pへ段階的に拡張 64GB推奨 モデル全体は収まらず、オフロードは残る
24GB 量子化モデルを扱いやすい pruned INT8/FP8。pruned BF16は検証用 768p・5~10秒から 64~128GB full BF16は収まらず、高解像度・長尺は依然重い
32GB以上 オフロード削減と高負荷検証 INT8/FP8/pruned BF16 768pから条件を上げる 96~128GB以上 32GBでもfull BF16一式は収まらない

VRAM 8GB:生成例はあるが、快適動作の基準ではない

8GB VRAMでも生成した公開例はあります。

RTX 4070 8GB、RAM 64GBで832×640を920秒かけて生成した報告があり、別のRTX 4060 Ti 8GBユーザーからも成功例が出ています。

ただし、モデル形式、Steps、オフロード設定、動画時間の全条件が揃っていない報告も多く、公式推奨スペックにはできません。

8GBでは、21GBのpruned INT8モデルも15.7GBのText Encoderも単体でVRAMに収まりません。

Dynamic VRAMで必要な重みだけを順次VRAMへ載せ、残りをRAMやSSD側から供給するため、システムRAMとNVMe SSDの速度への依存が強くなります。

最初は0.4MP以下、3~5秒、参照素材の少ないT2VまたはI2Vに絞るのが安全です。

「一度完成した」ことと、プロンプトやseedを変えながら何十回も試せることは分けて考えてください。

1本に15~20分以上かかるなら、用途によってはAPIの方が安く、作業も早く終わります。

VRAM 12GB:RTX 3060 12GBは試験運用の代表例

ComfyUI公式ブログは、軽量構成とDynamic VRAMを組み合わせればRTX 3060のようなGPUでローカル実行できると説明しています。

また、RTX 3060 12GB、RAM 32GB、NVMe SSD、8bit weights、832×480・124フレームで10分未満という開発段階の報告も共有されました。

もっとも、Stepsなどの条件が欠けているため、他のGPUと比較するベンチマークには使えません。

12GBはT2Vを試すには有力ですが、I2Vでは入力画像、R2Vでは画像・動画・音声の参照処理が加わります。

RTX 3060 12GBだから必ず生成できるわけではなく、ComfyUI、PyTorch、CUDA、ドライバーの組み合わせにも左右されます。

RAM 32GBは最低ラインと考え、増設できるなら64GBを選ぶ方が安定させやすい構成です。

VRAM 16GB:INT8を中心に試行錯誤しやすい

16GBでは、ComfyUI公式のpruned INT8生成モデルとNVFP4/AWQ Text Encoderを使う構成が現実的です。

両方を同時にVRAMへ置くことはできませんが、Text Encoderでプロンプトを処理した後に生成モデルへ入れ替え、Dynamic VRAMで重みを段階的に読み込めます。

RTX 4070 Ti SUPER 16GB、RAM 32GBの実例では、pruned INT8と量子化Text Encoderを用い、約0.7MP・5.17秒・20 StepsのI2Vを5分14秒~5分58秒で生成しています。

一方、RTX 5070 Ti 16GB、RAM 48GBの別報告では、公式I2Vテンプレートの0.4MP・5秒・20 Stepsを155秒で完了しました。

後者はWindows環境のクラッシュを回避するため、--disable-async-offload --disable-pinned-memoryを付けた結果です。

GPUだけでなくソフトウェア構成でも速度と安定性が変わることが分かります。

768pは利用範囲に入りますが、最初から約1344×768・15秒・多数の参照素材を選ぶと、原因の切り分けが難しくなります。

5秒・0.4MPで一度通し、解像度、時間、参照数を一つずつ上げてください。

VRAM 24GB:RTX 3090・4090でもBF16は別問題

RTX 3090や4090の24GBは、量子化モデルでVRAMに置ける重みが増え、8~16GBよりオフロード回数を抑えやすい構成です。

ただし、pruned BF16生成モデルだけで40.2GB、full BF16は66.3GBあります。

Text EncoderのBF16版も51.5GBなので、「24GBならBF16を完全にGPUへ読み込める」とは言えません。

24GBでまず選ぶならpruned INT8またはFP8です。

BF16はRAM 128GB級を用意し、モデルロードとオフロードを含む検証として扱う方が安全です。

RTX 30世代とRTX 40世代では利用できる低精度演算のハードウェアが異なるため、容量だけでなくComfyUI、PyTorch、CUDA、量子化カーネルの組み合わせも確認してください。

VRAM 32GB以上:オフロードは減るが、full BF16の全常駐には足りない

RTX 5090 32GBは、量子化モデルやpruned BF16の一部をより多くVRAMへ置けるため、生成速度と設定の余裕を得やすいGPUです。

Blackwell世代はNVFP4をハードウェアで扱える点も利点になります。

ただし、full BF16生成モデル66.3GBとBF16 Text Encoder 51.5GBを同時に載せることはできません。

BF16をGPU中心で検証するなら、96GBのRTX PRO 6000 Blackwellや複数GPUが候補です。

それでも解像度、15秒のフレーム列、VAE、参照素材の中間データが加わるため、VRAM容量だけで上限は決まりません。

RTX 5090を選ぶ価値は「オフロードがゼロになる」ことではなく、退避量と待ち時間を減らせる点にあります。

システムRAMはどのくらい必要か

MiniMax H3では、VRAMに収まらない重みをシステムRAMへ置き、必要な部分をGPUへ転送します。

さらに、OS、ComfyUI、モデルロード、ページキャッシュ、入力素材、VAEの処理、一時データもRAMを使います。

VRAMだけ増やしてもRAMが足りなければ、ページファイルやswapへ退避し、SSDへの読み書きで大幅に遅くなります。

システムRAM 位置づけ 向く構成 起こりやすいこと 判断
32GB 最低動作を試す容量 pruned INT8、低解像度、短時間 ページファイル使用、アプリ併用で不足、長いロード 既存PCで試す範囲。新規購入の推奨ではない
64GB 量子化モデルの現実的な基準 8~24GB VRAM、T2V・I2V中心 R2Vや高解像度では余裕が減る 初心者に推奨しやすい
96GB 高負荷条件の余裕を確保 16~32GB VRAM、R2V、長めの動画 モデルの切替や複数アプリにも対応しやすい 継続利用やPC新調で有力
128GB以上 BF16・研究用途 pruned/full BF16、複数モデル、参照素材が多いR2V RAMが多くてもVRAM転送は残り、速度保証にはならない 検証者向け

実測例では、RTX 5070 Ti 16GBとRAM 125GBの環境で、pruned INT8構成のComfyUI RSSピークが通常起動で45.4GiB、システム全体では51.0GiBでした。

同じ処理に--fast-diskを付けるとComfyUI RSSは12.6GiBへ下がり、約41.5GiBがページキャッシュに回っています。

これは、RAMを不要にする設定ではありません。

再利用可能なページキャッシュへ重みを置き、メモリ圧迫時にOSが破棄してNVMeから読み直せるようにする仕組みです。

--fast-diskは2026年8月時点のComfyUIで利用できます。

高速なNVMe SSDがあり、RAM不足がモデルロードの障害になっている場合に候補になりますが、SSDからの再読込が増えれば速度は下がります。

--cache-noneはノード出力のキャッシュ設定であり、モデル重みの常駐量を直接減らす設定ではありません。

仮想メモリやWindowsのページファイルは、RAM不足時のクラッシュを避ける保険にはなります。

しかし、SSDはRAMより遅く、頻繁な退避が起きるとGPUがデータ待ちになります。

32GB RAM+大きなページファイルを、64GBや128GBの物理RAMと同等とは考えないでください。

PC全体のVRAM・RAM・SSDの選び方は、ローカルLLM用PCのおすすめスペックも参考になります。

LLMと動画生成では負荷の中身が異なりますが、「ファイル容量」「実行時メモリ」「速度」を分ける考え方は共通しています。

モデルファイル・量子化・VAEの選び方

必要なストレージ容量とモデルファイル一覧

ComfyUI公式が案内するT2V・I2V向けの最小構成は約42.5GBです。

R2Vを追加する場合は、FL2VAとは別の21GBのRef2VAモデルが必要になり、モデルだけで合計約63.5GBになります。

ダウンロード中の一時ファイル、ComfyUI本体、出力動画、ページファイル、キャッシュを考えると、T2V・I2Vだけでも空き70~100GB、R2V併用なら100~150GBを確保した方が扱いやすくなります。

T2V・I2Vで使う公式ファイル

正確なファイル名 配布元 サイズ 用途 保存フォルダ ワークフロー
minimax_h3_fl2va_pruned_int8_convrot.safetensors Comfy-Org/MiniMax-H3 21GB T2V、開始/終了フレームI2Vの生成モデル ComfyUI/models/diffusion_models/ T2V・I2V
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors Comfy-Org/MiniMax-H3 15.7GB プロンプトと画像条件を処理するText Encoder ComfyUI/models/text_encoders/ T2V・I2V・R2V
minimax_h3_video_vae_fp16.safetensors Comfy-Org/MiniMax-H3 5.21GB 映像の符号化・復号 ComfyUI/models/vae/ T2V・I2V・R2V
minimax_h3_audio_vae_fp32.safetensors Comfy-Org/MiniMax-H3 605MB 32kHzステレオ音声の符号化・復号 ComfyUI/models/vae/ 音声付きT2V・I2V・R2V
video_minimax_h3_t2v.json Comfy-Org/workflow_templates 41.2KB 公式T2Vテンプレート 任意。ComfyUIへ読み込む T2V
video_minimax_h3_i2v.json Comfy-Org/workflow_templates 43.6KB 公式I2Vテンプレート 任意。ComfyUIへ読み込む I2V

R2Vで追加する公式ファイル

正確なファイル名 配布元 サイズ 用途 保存フォルダ ワークフロー
minimax_h3_ref2va_pruned_int8_convrot.safetensors Comfy-Org/MiniMax-H3 21GB 画像・動画・音声参照を使うR2V生成モデル ComfyUI/models/diffusion_models/ R2V
video_minimax_h3_r2v.json Comfy-Org/workflow_templates 26.9KB 公式R2Vテンプレート 任意。ComfyUIへ読み込む R2V

R2Vは上記に加えて、参照する画像・動画・音声の保存容量を使います。

動画の読み込みや最終MP4への結合で、利用するノードやOS環境によってffmpegが必要になる場合もあります。

公式テンプレートが動かないときは、モデル不足だけでなく、ComfyUI 0.30.0以降、動画デコード環境、ffmpegのパス、入力形式も確認してください。

配布リポジトリ全体は465GBで、すべてをダウンロードする必要はありません。

用途と数値形式を決め、必要なファイルだけを取得します。

また、表示されるダウンロード容量はVRAMやRAMの必要量ではありません。

圧縮された重みを実行時に展開する処理や中間データがあるため、同じ数字にはならない点に注意が必要です。

精度を変更するときの公式代替ファイル

以下はComfy-Org公式配布に含まれる生成モデルとText Encoderの全選択肢です。

サイズはHugging Faceが表示する10進表記で、保存先は生成モデルがComfyUI/models/diffusion_models/、Text EncoderがComfyUI/models/text_encoders/です。

正確なファイル名 サイズ 対象・形式
minimax_h3_fl2va_bf16.safetensors 66.3GB T2V・I2V/full BF16
minimax_h3_fl2va_int8_convrot.safetensors 34.0GB T2V・I2V/full INT8 ConvRot
minimax_h3_fl2va_pruned_bf16.safetensors 40.2GB T2V・I2V/pruned BF16
minimax_h3_fl2va_pruned_fp8_scaled.safetensors 21.0GB T2V・I2V/pruned FP8 scaled
minimax_h3_fl2va_pruned_int8_convrot.safetensors 21.0GB T2V・I2V/pruned INT8 ConvRot
minimax_h3_ref2va_bf16.safetensors 66.3GB R2V/full BF16
minimax_h3_ref2va_int8_convrot.safetensors 34.0GB R2V/full INT8 ConvRot
minimax_h3_ref2va_pruned_bf16.safetensors 40.2GB R2V/pruned BF16
minimax_h3_ref2va_pruned_fp8_scaled.safetensors 21.0GB R2V/pruned FP8 scaled
minimax_h3_ref2va_pruned_int8_convrot.safetensors 21.0GB R2V/pruned INT8 ConvRot
qwen3vl_32b_minimax_h3_bf16.safetensors 51.5GB Text Encoder/BF16
qwen3vl_32b_minimax_h3_int8_convrot.safetensors 27.1GB Text Encoder/INT8 ConvRot
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors 15.7GB Text Encoder/NVFP4+AWQ

INT8・FP8・BF16・NVFP4の違い

MiniMax H3では、生成モデル本体とText Encoderに別々の量子化形式があります。

ComfyUI公式の初心者向け構成は、生成モデル本体にpruned INT8、Text EncoderにNVFP4+AWQを使います。

「NVFP4版H3モデル」や「INT4版H3」と一括りにすると、どの部品を指すのか分からなくなります。

形式 対象と公式ファイル容量 必要VRAM・RAM 速度の傾向 画質への影響 対応GPU・注意点 初心者への推奨度
pruned INT8 ConvRot 生成モデル21GB。INT8 TEは27.1GB 32GBで試行、64GBが現実的。強いオフロードが必要 対応カーネルでは有利。GPU世代とCUDAで変化 BF16と完全一致とは限らない RTX 30以降で候補。fallback経路では遅延・不具合報告あり 高い
pruned FP8 scaled 生成モデル21GB 32GBで試行、64GBが現実的。実行時の使用量はINT8と別 Ada/Blackwellで高速化しやすいが常に最速ではない 量子化誤差があり、条件ごとの確認が必要 RTX 40・50世代はFP8 Tensor Coreを利用可能。実装依存 中~高
pruned BF16 生成モデル40.2GB 24~32GB VRAMでもオフロードが必要 転送が多い環境では遅くなる 公開形式の中では量子化を避けやすい RAM 96~128GB以上を検討 低い
full BF16 生成モデル66.3GB、TE 51.5GB 1タスク分でVAE込み約123.6GB 大容量GPU/複数GPU向け 基準となる精度 24GB・32GB GPUへの全常駐は不可 検証者向け
NVFP4+AWQ Text Encoder 15.7GB 軽量生成モデルと合わせ、RAM 32GBで試行、64GBを推奨 BlackwellとCUDA 13.0で高速化しやすい。非対応環境ではFP8より遅い場合もある Text Encoderの量子化。生成モデル本体の4bit化ではない NVIDIAのNVFP4ハードウェア対応はBlackwell。ComfyUIでは他世代でも展開して動かす経路がある 高い

INT8とFP8はどちらも8bitですが、整数と浮動小数点で表現方法が異なります。

INT8 ConvRotはComfyUIがH3向けに用意したカーネルと組み合わせる構成です。

FP8はRTX 40シリーズのAda以降でハードウェア対応が強化されていますが、モデルの形状、カーネル、CUDA、PyTorch次第ではINT8より速いとは限りません。

NVFP4は4bit浮動小数点形式で、一般的なINT4とは別物です。2026年8月9日時点のComfy-Org公式配布には、H3生成モデル本体のINT4ファイルはありません。

NVFP4+AWQはQwen3-VL-32B系Text Encoderを15.7GBへ抑えるための形式です。

RTX 50シリーズのBlackwellはNVFP4をハードウェアで処理できますが、ComfyUI公式情報ではNVFP4高速化にCUDA 13.0版PyTorchが重要とされ、環境が合わなければ動作してもFP8より遅くなる場合があります。

画質についても「INT8ならまったく低下しない」とは断定できません。

ComfyUIはpruned化した変調重みを機能的に等価なルックアップテーブルへ置き換え、出力品質を保つと説明していますが、量子化形式間の差はプロンプト、動き、顔、文字、seedによって見え方が変わります。

まず量子化版で構図を詰め、必要なカットだけBF16で再検証する使い方が現実的です。

Video VAEとAudio VAE、Text Encoderの役割

VAEは、動画や音声を生成モデルが扱いやすい圧縮表現へ変換し、最後に人が見聞きできる形式へ戻す部品です。

MiniMax H3は映像と音声を同時に生成しますが、映像と音声ではデータの性質が異なるため、Video VAEとAudio VAEを分けています。

Video VAEは映像を圧縮・復元する

minimax_h3_video_vae_fp16.safetensorsは5.21GBあり、映像フレームを潜在表現へ変換し、生成後の潜在表現をフレームへ復元します。

T2Vでは主に復号、I2V・R2Vでは入力素材の符号化と出力の復号に関わります。

保存先はComfyUI/models/vae/です。

ファイル名のFP16は半精度浮動小数点を示します。

Video VAEは容量と計算量が大きく、デコード時にVRAMやRAMのピークが発生することがあります。

Windows環境では、pinned memoryやasync offloadとの組み合わせでVAE decodeがクラッシュしたIssueもあるため、最新版へ更新してから再現条件を確認してください。

Audio VAEはステレオ音声を復元する

minimax_h3_audio_vae_fp32.safetensorsは605MBで、32kHzステレオ音声の潜在表現を処理します。

FP32は32bit浮動小数点で、Video VAEのFP16より1要素当たりのデータ量が大きい形式です。

ただしモデル自体が小さいため、ファイル容量はVideo VAEより小さくなっています。

映像だけ欲しい場合でも、公式ワークフローでは生成中に映像と音声のlatentを一緒に扱います。

Audio VAEのデコードを省けば最終的な音声復元やmuxを省略できますが、H3本体の音声latent計算がすべて消えるとは限りません。

Text Encoderはプロンプトと参照素材を理解する

MiniMax H3のH3-EncoderはQwen3-VL-32Bの重みを使います。

ComfyUIではqwen3vl_32b_minimax_h3_nvfp4_awq.safetensorsComfyUI/models/text_encoders/へ保存します。

生成モデルとは別ファイルであり、NVFP4/AWQ版でも15.7GBあるため、低VRAM環境ではText Encoder処理だけでVRAMをほぼ使い切る場合があります。

VAEを取り違えると、テンソル形状やdtypeの不一致、映像・音声のデコードエラー、ノイズ出力、クラッシュにつながります。まずファイル名と保存フォルダを確認し、それでも直らなければ不完全なダウンロードを疑います。Hugging Face表示のファイルサイズとローカルのサイズを比較し、可能ならSHA-256やsafetensorsの読み込み検証を行ってください。実際に、不完全なVideo VAEで末尾がゼロ埋めになり、再取得後に検証をやり直したGitHub報告があります。

GPU別の参考構成と生成時間

GPU別の参考構成

次の表は動作保証ではありません。VRAMとGPU世代、公式配布形式、条件が確認できる公開報告を基に、「最初に選ぶ設定」を編集上の目安として整理しています。実機情報の条件が不足するGPUは、速度を推測で埋めていません。

GPU VRAM 推奨する出発点 RAM 現実的な初期設定 オフロード 想定用途・注意点
RTX 3060 12GB pruned INT8+NVFP4/AWQ TE 32GB最低、64GB推奨 832×480前後、約5秒、T2V 必須 ComfyUI公式が実行可能な例として言及。快適性は保証されない
RTX 4060 Ti 8GB 8GB pruned INT8+NVFP4/AWQ TE 64GB優先 低解像度・3~5秒 強く必要 成功報告はあるが条件が不完全。購入候補としては16GB版を優先
RTX 4060 Ti 16GB 16GB pruned INT8+NVFP4/AWQ TE 64GB 0.4MP・5秒から 必要 R2V成功例あり。ただし10秒で1時間超の報告もあり、参照条件に左右される
RTX 4070 Ti SUPER 16GB pruned INT8+NVFP4/AWQ TE 32~64GB 約0.7MP・5秒 必要 20 Steps・音声decodeなしで5~6分の実例あり
RTX 4080 16GB pruned INT8またはFP8+量子化TE 64GB 0.4MP・5秒から 必要 H3について条件の揃った速度報告を確認できず。AdaのFP8対応は利点
RTX 4090 24GB pruned INT8/FP8 64~128GB 768p・5秒から 残る full BF16は全常駐不可。H3単独で条件の揃った速度報告はまだ限定的
RTX 5070 Ti 16GB pruned INT8+NVFP4/AWQ TE 64GB推奨 0.4MP・5秒 必要 155~160秒級の実例あり。cu130、pinned memory周辺の相性に注意
RTX 5080 16GB pruned INT8/FP8+NVFP4/AWQ TE 64GB推奨 0.4MP・5秒から 必要 16GBの容量上限は5070 Tiと同じ。Text Encoder読込のWindows Issueあり
RTX 5090 32GB INT8/FP8、pruned BF16を段階検証 96~128GB以上 768p・5秒から 高負荷では必要 NVFP4対応。32GBでもfull BF16一式は収まらない

RTX 4080やRTX 5080は演算性能が高くてもVRAMは16GBです。

RTX 4060 Ti 16GBより速く生成できる可能性は高い一方、どのモデルを丸ごと収められるかという容量上限は変わりません。

PC購入ではGPU名だけでなく、VRAM、RAM、NVMe SSD、CUDA環境を一組で確認してください。

生成時間はどのくらいか

MiniMax H3の生成時間は、GPU名だけでは比較できません。

解像度、フレーム数、Steps、T2V・I2V・R2V、量子化、SageAttention、音声デコード、オフロード、初回ロードか連続実行かで結果が変わるためです。

条件を比較的確認しやすい公開例を整理すると、次のようになります。

順位表ではなく、それぞれ独立した実行例として見てください。

GPU・RAM モデル形式 条件 Steps オフロード・高速化 生成時間 情報源
RTX 3060 12GB・RAM 32GB 8bit weights(詳細不明) 832×480、124フレーム、約5.17秒 未記載 Dynamic VRAM、NVMe 10分未満 ComfyUI開発者発言の共有。条件不足のため参考値
RTX 4070 Ti SUPER 16GB・RAM 32GB pruned INT8+NVFP4/AWQ TE I2V、1056×672、124フレーム、5.17秒、音声decodeなし 20 INT8-Fast、KJNodes SageAttention、Dynamic VRAM 5分58秒 Reddit実機報告
RTX 4070 Ti SUPER 16GB・RAM 32GB 同上 I2V、736×960、124フレーム、5.17秒、音声decodeなし 20 同上 5分14秒 Reddit実機報告
RTX 5070 Ti 16GB・RAM 48GB pruned INT8+NVFP4/AWQ TE+両VAE 公式I2V、0.4MP 16:9(約864×480)、5秒 20 --disable-async-offload --disable-pinned-memory 155秒 ComfyUI GitHub Issue #15337

SageAttentionはComfyUI公式ドキュメントで最大約2倍の高速化候補として紹介されていますが、すべての層が対応するわけではありません。

2026年8月にはBlackwellの一部カーネルで長いシーケンスがノイズ化するIssueも確認されています。

KJNodesでpv_fp16系の実装を選ぶ回避例はあるものの、速度だけを見てグローバル設定を追加せず、同じseedで映像と音声を比較してください。

EasyCacheなどStepsを飛ばす高速化も、映像が近く見えても音声の低域や音量が変化した報告があります。

H3は映像と音声を同時に扱うため、映像だけの類似度では品質を評価し切れません。

高速化前後で、口の動き、効果音の同期、会話、BGMまで確認する必要があります。

ローカルとAPIの選び方・動作条件

ローカルとAPIのどちらを選ぶべきか

ローカル実行は、生成ごとのAPI料金を気にせず試せ、素材をPC外へ送らずに処理しやすい点が魅力です。

一方、42.5GB以上のモデル取得、ComfyUI更新、CUDA・PyTorch・カーネルの整合、ストレージ管理、長い生成時間を自分で引き受けます。

比較項目 ローカル MiniMax API
初期費用 高性能GPU、RAM、SSDが必要 PCのGPU購入は不要
導入難易度 モデル配置、ComfyUI、CUDA、依存関係を管理 APIキーとリクエスト実装が中心
生成速度 GPU、オフロード、設定に依存 サーバー側で処理。ローカルPC性能に依存しない
2K 公開H3-Base単独は標準768p。公式Regenerate-2Kは未公開 2Kを公式に提供
プライバシー H3-Base処理を端末内に置ける 素材をサービスへ送信する
料金 電気代と機材費。生成回数による従量課金なし 768pは1秒0.08ドル、2Kは1秒0.13ドル
メンテナンス 更新、不具合対応、容量管理が必要 モデル運用は提供側が担当
高性能GPU 必要 不要
低頻度利用 機材費を回収しにくい 従量課金と相性がよい
大量生成 安定環境を作れば費用を平準化しやすい 本数に比例して費用が増える

2026年8月9日時点の公式料金では、10秒動画は768pで0.80ドル、2Kで1.30ドルです。

768pから2KへのRegenerationは1秒0.05ドルで、元の入力素材が再課金される条件もあります。

料金は改定され得るため、公開前と利用前にMiniMax公式Pay as You Go料金を確認してください。

既に16GB以上のNVIDIA GPUと64GB RAMを持ち、毎週何十本も試作するなら、まずローカルを整える価値があります。

8GB GPUで1本ごとの待ち時間が長い、数本だけ生成したい、公式品質の2Kが必要、CUDAの不具合対応を避けたい場合はAPIが合理的です。

機密素材を扱う場合はローカルが候補になりますが、利用ライセンスと、使用するカスタムノードが外部通信しないかも確認してください。

導入前に確認したいライセンスと動作条件

MiniMax H3は、MITやApache 2.0ではなく、独自の「MiniMax H3 Community License Agreement」で公開されています。

適用地域は世界のうち除外地域を除く範囲で、米国、EU、英国、韓国は除外地域です。

日本は除外地域に含まれていませんが、利用目的、配布、商用サービス、表示義務、Acceptable Use Policyなどの条件は別途守る必要があります。

年間売上が2,000万米ドルを超える商用製品・サービスには事前の書面承認が必要とされ、商用サービスのUIへ「MiniMax H3」を目立つ形で表示する条件もあります。

生成物の利用を含め、公開前にMiniMax H3公式ライセンスの原文と更新日を確認してください。

これは法的助言ではありません。

ローカルで公開されているのはH3-BaseのFL2VAとRef2VAです。

H3-Context-IRは複数のホスト型モデルとサービスを使うため公開部分に含まれず、H3-Regenerate-2Kも2026年8月9日時点では未公開です。

公式と同じ2Kワークフローは、ローカルH3-BaseとMiniMax APIを組み合わせる構成か、API内で完結する構成になります。

各段階の役割は、既存記事のMiniMax H3の2K・音声同時生成の仕組みで解説しています。

ComfyUIは0.30.0以降が必要です。

NVIDIA GPUでもRTX 30・40・50シリーズで同じ速度やカーネルが使えるわけではなく、FP8、NVFP4、INT8 ConvRotの対応はGPU世代、PyTorch、CUDAに依存します。

MacやAMD GPUについて、ComfyUI自体はMetalやROCmに対応しますが、MiniMax H3の量子化カーネルと速度はNVIDIA CUDAと同条件ではありません。

AMD RX 7900 XTXで公式テンプレートがノイズ化したIssueもあり、購入判断にはまだ慎重さが必要です。

MiniMax H3の必要スペックは、VRAMの数字だけでは決められません。

初心者が最初に確認したいのは、pruned INT8生成モデルとNVFP4/AWQ Text Encoderを使えるか、RAM 64GBと空き100GB前後のNVMe SSDを用意できるか、5秒・0.4MPから試せるかの3点です。

8GBと12GBは生成例があるものの、強いオフロードと長い待ち時間を受け入れる最低動作寄りの構成です。

16GBはモデル全体を収める容量ではありませんが、個人が設定を変えながら使う現実的な出発点になります。

24GBや32GBでは量子化モデルが扱いやすくなる一方、full BF16一式をGPUへ完全常駐させられるわけではありません。

まず公式テンプレートを量子化モデル、低解像度、短時間で一度完走させ、解像度、秒数、参照素材を一項目ずつ増やしてください。

公式品質の2Kが必要、利用頻度が低い、PC更新費用や保守時間が見合わない場合は、API料金と比較してから判断する方が無理がありません。

他の記事も読む

X account logo
Xアカウントをフォロー!
最新の情報をいち早くゲット!
フォローする
back to article page
記事一覧に戻る
シェア
share link icon
‍無料会員登録
支持投票やブックマークなど、すべての機能にアクセスできます。
登録はほんの数秒で完了します!
無料会員登録
ログイン