
LTX-2.5をローカルで動かしたい人にとって、最も知りたいのは「自分のGPUでどこまで実用になるか」です。
ところが、22Bというモデル規模だけを見ても答えは出ません。
LTX-2.5は動画本体のTransformerだけで完結せず、Gemma 4 12Bベースのテキストエンコーダ、Video VAE、音声を使う場合のAudio VAE、二段階生成で使うアップスケーラなど複数コンポーネントで構成されています。
Lightricks公式のLTX-2.5配布では、Distilled/DevのBF16に加えて、ComfyUI向けINT8とNVFP4のTransformerが用意されています。
つまり、同じLTX-2.5でも「どの重みを使うか」で必要メモリと速度が大きく変わります。
一方で、公式は「RTX 3060なら何GB必要」「16GBなら必ず動く」といった一律の最低VRAMを提示していません。
そこで本記事では、公式に確認できる構成とファイル形式を土台にしつつ、VRAM帯ごとの目安は編集上の運用目安として分けて整理します。
LTX-2.5はLightricksが公開する音声・動画対応の生成モデルです。
公式モデルカードでは22BのTransformerが用意され、DistilledとDevの二系統があります。
Distilled版は固定8ステップ、CFG=1で使う設計が示され、Devはフル版として二段階生成などに使われます。
公式GitHubのQuick Startでは、LTX-2.5の推奨構成としてDistilled Transformer、Gemma 4 12Bテキストエンコーダ、Video VAE、Audio VAE、Spatial Upscalerを取得する例が示され、その一式はおよそ66GiBと説明されています。
これはダウンロード容量の目安であり、そのままGPU VRAMへ同時常駐するという意味ではありません。
Video VAEにも2種類あり、公式GitHubではDiffusion Decoder版は品質向上と引き換えにデコード時間とVRAMが増えると説明されています。
軽量なConvolutional Decoderも用意されているため、GPUが厳しい環境ではVAE選択も影響します。
BF16は品質評価の基準にしやすい一方、22B Transformerをそのまま扱うため必要メモリは大きくなります。
LTX-2.5ではテキストエンコーダも別に存在するため、「22B×2byteだから約44GBで終わり」と単純計算しない方が安全です。
推論中には中間テンソル、VAE、キャッシュ、ComfyUI自体の使用分も加わります。
INT8はBF16より重みを圧縮でき、ComfyUI向けのconvrot版が公式モデルカードに明記されています。
ただし、このINT8ファイルはComfyUI専用で、LTXのPyTorchパイプラインへそのまま持ち込む前提ではありません。
利用環境ごとに対応ファイルを選ぶ必要があります。
NVFP4はさらにメモリ効率を狙える選択肢ですが、「NVIDIA GPUならどれでも使える」わけではありません。
公式モデルカードでは、ComfyUIまたはltx-pipelinesでのNVFP4 prequant利用が示され、Blackwellとltx-kernelsの条件が明記されています。
RTX 30/40シリーズ利用者は、NVFP4前提の必要VRAM表をそのまま自分のGPUへ当てはめないでください。
量子化は容量だけでなく、対応ハード、実装、品質、速度の組み合わせで選びます。
特に動画生成では1回の処理時間が長いため、VRAMを減らした結果オフロードが増え、かえって生成時間が大幅に伸びることがあります。
以下はLightricksが公式に保証する最低条件ではなく、モデル構成と一般的なオフロード挙動を踏まえた編集上の運用目安です。
生成解像度、フレーム数、VAE、使用ノード、ComfyUIの実装更新で結果は変わります。
RTX 3060 12GBや4060 Ti 16GBで気になるのは「起動するか」ですが、実際には1本生成するまでの待ち時間を見た方が判断しやすくなります。
CPUオフロードを多用すればロード自体は可能でも、GPUとRAM間の転送がボトルネックになる場合があります。
RTX 4090の24GBはローカルAI動画では依然強力ですが、LTX-2.5のBF16一式を余裕を持って全常駐できる容量ではありません。
INT8やオフロードを組み合わせ、解像度とフレーム数を調整する使い方が現実的です。
RTX 5090の32GBでは余裕が増えますが、NVFP4を使えるBlackwell世代である点も大きな違いです。
単純に「VRAMが8GB増えた」と見るだけでなく、対応する低精度実装も含めて比較する必要があります。
LTX-2.5ではシステムRAMが重要です。
公式コードにはテキストエンコーダを8bit化してVRAMを節約する仕組みもあり、その説明では「ホストRAMと引き換えにVRAMをおよそ半分にする」方向性が示されています。
つまり、VRAM不足をRAMで補うほど、システム側の余裕も必要になります。
16GB VRAM級で試すなら、32GB RAMは最低限の検証ライン、64GB以上は現実的な余裕として考えたいところです。
複数コンポーネントの読み込みやモデル切り替えを行う場合は、さらに大容量RAMが有利です。
SSDは公式Quick StartのBF16構成だけでおよそ66GiBあります。INT8やNVFP4、DevとDistilledを並行保存するなら100GBを簡単に超えます。
ComfyUIの他モデルも併用するなら、LTX-2.5専用に150〜200GB程度の空きを見込んでおくと管理しやすくなります。
解像度と動画長も負荷に直結します。動画生成はフレーム数が増えるほど中間表現が増え、VAEデコードにも時間とメモリがかかります。
まず短尺・低解像度でワークフローを通し、問題がなければ段階的に解像度とフレーム数を上げる方が、OOM原因を特定しやすくなります。
音声を同時生成する場合はAudio VAEも関わります。
映像だけでぎりぎりの構成に音声を足すと余裕がなくなるため、音声あり/なしを同じ「必要VRAM」でまとめない方が安全です。
ComfyUI公式ワークフローページにはLTX-2.5のText to Video、Image to Video、FLF2Vなどのテンプレートが掲載されています。
初回は非公式ワークフローを継ぎ足すより、公式テンプレートでモデルの読み込みと基本生成を確認してから拡張する方がトラブルを切り分けやすくなります。
12〜16GB GPUでは、INT8やオフロードでローカル実行を試す価値はあります。
ただし、毎回長時間待つならクラウドGPUや公式サービスを使う方が制作効率は高い場合があります。
ローカルの利点は従量課金を気にせず何度も試せること、データを手元に置けること、ワークフローを細かく制御できることです。
クラウドの利点は、大容量GPUを必要な時間だけ使えることと、重いモデルを手元へ保存・更新する手間を減らせることです。
月数本だけ生成する人と、毎日大量に生成する人では損益分岐が大きく変わるため、GPU価格だけで結論を出さない方がよいでしょう。
商用利用ではライセンスも確認が必要です。
LTX-2 Community Licenseは広い利用を認めていますが、年商1,000万ドル以上の事業体について、商用利用には有償ライセンスが必要とする条項があります。
売上規模や利用主体によって条件が変わるため、法人利用では公開時点のLICENSE本文を確認してください。
LTX-2.5の必要スペックは「最低VRAM何GB」と一つに決めるより、どの量子化、どのGPU世代、どの解像度・動画長で使うかから逆算する方が正確です。
12〜16GBではINT8とCPUオフロードを使った検証、24GBではローカル運用の現実的な入口、32GBではBlackwell世代のNVFP4も含めて選択肢が広がり、48GB以上になるとBF16やDevを扱いやすくなります。
ただし、どの帯でも「動いた」という報告だけでGPU購入を決めるのは早計です。
1本あたりの生成時間、解像度、音声の有無、再生成回数、電力、ストレージ、商用ライセンスまで含めて判断すると、ローカルとクラウドのどちらが合うかが見えやすくなります。

