更新日:
25/8/2026

LTX-2.5をローカル実行する必要スペック:ComfyUIのBF16・INT8・NVFP4を比較

blog header image

目次

この記事のポイント

LTX-2.5は22Bの動画生成モデルで、DistilledとDev、BF16・INT8・NVFP4など複数の実行形態が用意されている。
公式は「最低VRAM」を一つの数字で示しておらず、量子化、VAE、テキストエンコーダ、解像度、動画長、オフロード条件で必要量が変わる。
ComfyUI向けINT8はComfyUI専用の配布があり、NVFP4はBlackwell系など対応条件を確認する必要がある。
12〜16GB級GPUでは「起動できるか」より、オフロード時の待ち時間と生成解像度を含めて実用性を判断したい。
商用利用ではLTX-2 Community Licenseの年商1,000万ドル以上に関する有償ライセンス条件を確認する必要がある。

LTX-2.5をローカルで動かしたい人にとって、最も知りたいのは「自分のGPUでどこまで実用になるか」です。

ところが、22Bというモデル規模だけを見ても答えは出ません。

LTX-2.5は動画本体のTransformerだけで完結せず、Gemma 4 12Bベースのテキストエンコーダ、Video VAE、音声を使う場合のAudio VAE、二段階生成で使うアップスケーラなど複数コンポーネントで構成されています。

Lightricks公式のLTX-2.5配布では、Distilled/DevのBF16に加えて、ComfyUI向けINT8とNVFP4のTransformerが用意されています。

つまり、同じLTX-2.5でも「どの重みを使うか」で必要メモリと速度が大きく変わります。

一方で、公式は「RTX 3060なら何GB必要」「16GBなら必ず動く」といった一律の最低VRAMを提示していません。

そこで本記事では、公式に確認できる構成とファイル形式を土台にしつつ、VRAM帯ごとの目安は編集上の運用目安として分けて整理します。

LTX-2.5のモデル構成とDistilled/Dev

LTX-2.5はLightricksが公開する音声・動画対応の生成モデルです。

公式モデルカードでは22BのTransformerが用意され、DistilledとDevの二系統があります。

Distilled版は固定8ステップ、CFG=1で使う設計が示され、Devはフル版として二段階生成などに使われます。

公式GitHubのQuick Startでは、LTX-2.5の推奨構成としてDistilled Transformer、Gemma 4 12Bテキストエンコーダ、Video VAE、Audio VAE、Spatial Upscalerを取得する例が示され、その一式はおよそ66GiBと説明されています。

これはダウンロード容量の目安であり、そのままGPU VRAMへ同時常駐するという意味ではありません。

構成 特徴 主な用途 メモリ面の見方
Distilled BF16 固定8ステップ、CFG=1 高速な標準生成 高精度だがTransformer自体が重い
Dev BF16 フル版、二段階系で利用 品質重視・高度なパイプライン Distilled同様に大容量VRAM向け
ComfyUI INT8 ComfyUI専用量子化 VRAM節約 BF16より軽くしやすい
NVFP4 低精度フォーマット 対応GPUでの高速・省メモリ化 Blackwell系など対応条件を確認

Video VAEにも2種類あり、公式GitHubではDiffusion Decoder版は品質向上と引き換えにデコード時間とVRAMが増えると説明されています。

軽量なConvolutional Decoderも用意されているため、GPUが厳しい環境ではVAE選択も影響します。

BF16・INT8・NVFP4の違い

BF16は品質評価の基準にしやすい一方、22B Transformerをそのまま扱うため必要メモリは大きくなります。

LTX-2.5ではテキストエンコーダも別に存在するため、「22B×2byteだから約44GBで終わり」と単純計算しない方が安全です。

推論中には中間テンソル、VAE、キャッシュ、ComfyUI自体の使用分も加わります。

INT8はBF16より重みを圧縮でき、ComfyUI向けのconvrot版が公式モデルカードに明記されています。

ただし、このINT8ファイルはComfyUI専用で、LTXのPyTorchパイプラインへそのまま持ち込む前提ではありません。

利用環境ごとに対応ファイルを選ぶ必要があります。

NVFP4はさらにメモリ効率を狙える選択肢ですが、「NVIDIA GPUならどれでも使える」わけではありません。

公式モデルカードでは、ComfyUIまたはltx-pipelinesでのNVFP4 prequant利用が示され、Blackwellとltx-kernelsの条件が明記されています。

RTX 30/40シリーズ利用者は、NVFP4前提の必要VRAM表をそのまま自分のGPUへ当てはめないでください。

量子化は容量だけでなく、対応ハード、実装、品質、速度の組み合わせで選びます。

特に動画生成では1回の処理時間が長いため、VRAMを減らした結果オフロードが増え、かえって生成時間が大幅に伸びることがあります。

VRAM 12・16・24・32・48GB別の現実的な考え方

以下はLightricksが公式に保証する最低条件ではなく、モデル構成と一般的なオフロード挙動を踏まえた編集上の運用目安です。

生成解像度、フレーム数、VAE、使用ノード、ComfyUIの実装更新で結果は変わります。

VRAM 現実的な使い方 候補 注意点
12GB 低負荷設定と積極的なCPUオフロードで検証 INT8中心 生成時間とRAM消費が大きくなりやすい
16GB INT8+オフロードで実験しやすい帯 Distilled INT8 高解像度・長尺では余裕が小さい
24GB ローカル運用の現実的な入口 INT8、条件次第でBF16の一部オフロード VAEやテキストエンコーダの同時常駐に注意
32GB より高い解像度や余裕あるノード構成 INT8中心、BF16検証 BF16全構成の完全常駐を保証する容量ではない
48GB以上 BF16やDevを含む本格運用に近づく BF16、Dev 二段階生成や高解像度ではなお追加余裕が必要

RTX 3060 12GBや4060 Ti 16GBで気になるのは「起動するか」ですが、実際には1本生成するまでの待ち時間を見た方が判断しやすくなります。

CPUオフロードを多用すればロード自体は可能でも、GPUとRAM間の転送がボトルネックになる場合があります。

RTX 4090の24GBはローカルAI動画では依然強力ですが、LTX-2.5のBF16一式を余裕を持って全常駐できる容量ではありません。

INT8やオフロードを組み合わせ、解像度とフレーム数を調整する使い方が現実的です。

RTX 5090の32GBでは余裕が増えますが、NVFP4を使えるBlackwell世代である点も大きな違いです。

単純に「VRAMが8GB増えた」と見るだけでなく、対応する低精度実装も含めて比較する必要があります。

CPUオフロード、RAM、SSD、解像度・動画長の影響

LTX-2.5ではシステムRAMが重要です。

公式コードにはテキストエンコーダを8bit化してVRAMを節約する仕組みもあり、その説明では「ホストRAMと引き換えにVRAMをおよそ半分にする」方向性が示されています。

つまり、VRAM不足をRAMで補うほど、システム側の余裕も必要になります。

16GB VRAM級で試すなら、32GB RAMは最低限の検証ライン、64GB以上は現実的な余裕として考えたいところです。

複数コンポーネントの読み込みやモデル切り替えを行う場合は、さらに大容量RAMが有利です。

SSDは公式Quick StartのBF16構成だけでおよそ66GiBあります。INT8やNVFP4、DevとDistilledを並行保存するなら100GBを簡単に超えます。

ComfyUIの他モデルも併用するなら、LTX-2.5専用に150〜200GB程度の空きを見込んでおくと管理しやすくなります。

解像度と動画長も負荷に直結します。動画生成はフレーム数が増えるほど中間表現が増え、VAEデコードにも時間とメモリがかかります。

まず短尺・低解像度でワークフローを通し、問題がなければ段階的に解像度とフレーム数を上げる方が、OOM原因を特定しやすくなります。

音声を同時生成する場合はAudio VAEも関わります。

映像だけでぎりぎりの構成に音声を足すと余裕がなくなるため、音声あり/なしを同じ「必要VRAM」でまとめない方が安全です。

ComfyUI導入とローカル/クラウドの判断

ComfyUI公式ワークフローページにはLTX-2.5のText to Video、Image to Video、FLF2Vなどのテンプレートが掲載されています。

初回は非公式ワークフローを継ぎ足すより、公式テンプレートでモデルの読み込みと基本生成を確認してから拡張する方がトラブルを切り分けやすくなります。

12〜16GB GPUでは、INT8やオフロードでローカル実行を試す価値はあります。

ただし、毎回長時間待つならクラウドGPUや公式サービスを使う方が制作効率は高い場合があります。

ローカルの利点は従量課金を気にせず何度も試せること、データを手元に置けること、ワークフローを細かく制御できることです。

クラウドの利点は、大容量GPUを必要な時間だけ使えることと、重いモデルを手元へ保存・更新する手間を減らせることです。

月数本だけ生成する人と、毎日大量に生成する人では損益分岐が大きく変わるため、GPU価格だけで結論を出さない方がよいでしょう。

商用利用ではライセンスも確認が必要です。

LTX-2 Community Licenseは広い利用を認めていますが、年商1,000万ドル以上の事業体について、商用利用には有償ライセンスが必要とする条項があります。

売上規模や利用主体によって条件が変わるため、法人利用では公開時点のLICENSE本文を確認してください。

LTX-2.5の必要スペックは「最低VRAM何GB」と一つに決めるより、どの量子化、どのGPU世代、どの解像度・動画長で使うかから逆算する方が正確です。

12〜16GBではINT8とCPUオフロードを使った検証、24GBではローカル運用の現実的な入口、32GBではBlackwell世代のNVFP4も含めて選択肢が広がり、48GB以上になるとBF16やDevを扱いやすくなります。

ただし、どの帯でも「動いた」という報告だけでGPU購入を決めるのは早計です。

1本あたりの生成時間、解像度、音声の有無、再生成回数、電力、ストレージ、商用ライセンスまで含めて判断すると、ローカルとクラウドのどちらが合うかが見えやすくなります。

他の記事も読む

X account logo
Xアカウントをフォロー!
最新の情報をいち早くゲット!
フォローする
back to article page
記事一覧に戻る
シェア
share link icon
‍無料会員登録
支持投票やブックマークなど、すべての機能にアクセスできます。
登録はほんの数秒で完了します!
無料会員登録
ログイン