
DGX Sparkに64GB版が加わった。
従来の128GB版と同じGB10 Grace Blackwellを使いながらメモリを半分にし、米国では4,999ドルから。
NVIDIAは単体で最大100B、2台を組み合わせれば最大200Bのモデルを扱えるとしている。
数字だけを見ると「128GBの半額版」に見えるが、購入判断はそれほど単純ではない。
AI推論ではモデル本体だけがメモリを使うわけではなく、OS、推論ランタイム、KVキャッシュ、長いコンテキスト、エージェントが併用するモデルやツールにも余白が必要になる。
一方で、27Bや32B級の量子化モデルを中心に使うなら128GBを持て余すケースもある。
64GB版の価値は「最大何Bか」ではなく、自分が日常的に動かすモデルとコンテキストがどこまで収まるかで決まる。
NVIDIAは2026年10月2日、64GBのコヒーレント統合メモリを搭載するDGX Sparkの新構成を発表した。
10月23日からAcer、ASUS、Dell、Gigabyte、HP、MSIが販売し、開始価格は4,999ドル。
64GB版はNVIDIA Founders Editionではなくメーカー各社から提供される。
メモリ以外の中核は128GB版と共通だ。
GB10 Grace Blackwell Superchip、DGX OS、CUDAを含むNVIDIA AIソフトウェアスタックを備え、ローカル推論、エージェント、ファインチューニング、データサイエンスを想定する。
NVIDIAは64GB単体で最大100Bパラメータのモデルをサポートすると説明する。
ただしパラメータ数は「ロードできる可能性」を示す目安で、生成速度やコンテキスト長まで保証する指標ではない。
最も大きな差は統合メモリ容量だ。
128GB版はCPUとGPUが128GBを共有し、NVIDIA公式は最大200Bモデルの推論と最大70Bモデルのローカルファインチューニングを掲げてきた。
64GB版は最大100Bをうたう。
64GB版は「演算チップを落とした廉価版」ではないため、メモリ内に収まる処理では128GB版に近い計算基盤を使える。
差が表面化しやすいのは、大型モデル、長いコンテキスト、複数モデルの同時利用だ。
モデルが必要とするメモリはパラメータ数と量子化方式で大きく変わる。
概算では32Bを4bitで保持するモデル重量は16GB前後、70Bなら35GB前後になるが、実際には量子化メタデータ、ランタイム、KVキャッシュなどが上乗せされる。
そのため27B・32B級は64GBで余白を確保しやすく、70B級も4bit系なら候補になる。
ただし長いコンテキストや並列リクエストを増やすと余白は急速に減る。
100B級は強い量子化を使って「載る」構成があっても、快適性を別途測る必要がある。
NVIDIAも64GB版を紹介する際、モデル効率化によりQwen 3.8 27Bなど有力なオープンモデルがより小さいメモリで動くようになった点を背景に挙げている。
購入前には自分が使うモデルの実ファイル容量と推論エンジンの必要メモリを確認したい。
100Bという数字だけで購入すると、期待と実測がずれる可能性がある。
パラメータ数が同じでもMoEかDenseか、量子化方式、コンテキスト長、推論エンジンによって必要メモリと速度が変わるからだ。
特に「ロードできる」と「毎秒十分なトークンを出せる」は別問題になる。
対話なら初回トークンまでの待ち時間と生成速度、コーディングエージェントなら長いプロンプト処理とツール実行、RAGなら埋め込みモデルやベクトルDBとの同時利用まで見る必要がある。
NVIDIAの最大モデル規模は製品能力の目安として使い、購入判断では自分のモデル・量子化・コンテキストでのベンチマークを優先したい。
モデル本体を読み込んだ後も、推論中にはKVキャッシュが増える。
これは過去のトークンに関する情報を保持し、次のトークン生成を高速化するための領域だ。
コンテキストを長くするほどKVキャッシュは大きくなる。
64GBへ70B級モデルをぎりぎり載せた状態では、短い会話は動いても、大量のコードや数百ページの文書を渡したときに余裕がなくなることがある。
エージェント用途ではさらに、埋め込み、音声、画像、ツール実行など別モデルを同時に使う可能性がある。
64GBを選ぶなら「モデルが入るか」ではなく「普段の最大コンテキストでも余白が残るか」を見る。
64GB版は2台をConnectX-7の200GbEで直結し、NVIDIA Sync Cluster Assistantで128GBのメモリプールとして構成できる。
NVIDIAはQwen 3.8 27Bのテストで、64GB×2が単体システム比で最大1.7倍の性能を示したとしている。
ただし2台の64GBが「1台の128GBと完全に同じメモリ」になるわけではない。
モデル分割、ノード間通信、推論ソフトの対応が必要で、ワークロードによって通信オーバーヘッドも変わる。
NVIDIAには2台のSparkを接続する公式手順があり、QSFPケーブルと200GbEを使う。
最初は64GBで始め、必要になったら2台目を足せる点は魅力だが、最初から128GBを頻繁に使うなら単体128GBの方が運用を単純化できる場合がある。
DGX SparkはArmベースのLinux環境で、NVIDIAはローカルAI向けにOllamaやvLLMなどの実行環境・プレイブックを提供している。
LM StudioもDGX Sparkを早期採用例としてNVIDIAが紹介してきた。
ただし一般的なx86 Windows PCと同じ感覚で、任意のバイナリがそのまま動くとは限らない。
Arm64対応、CUDA対応、モデル形式、特定拡張機能のビルド可否を確認する必要がある。
普段使っているツールが一つに決まっている人は、購入前にそのツールのDGX Spark/Linux Arm対応ページとIssueを確認する方が安全だ。
Mac Studioも大容量ユニファイドメモリを選べるため、ローカルLLM用途では比較対象になる。
macOSの使いやすさや日常アプリとの一体感を重視するならMacが有利なケースがある。
DGX Sparkの強みはCUDAとNVIDIAのAIソフトウェア環境を小型筐体で持てることだ。
研究コード、CUDA前提のライブラリ、NVIDIA NIM、vLLMなどを使う開発では環境差が効く。
RTXワークステーションは離散GPUのVRAM帯域や交換・増設の自由度で優位になる構成がある一方、大容量VRAMを積むほど価格や電力、筐体も大きくなる。
単純なtokens/secだけでなく、必要メモリ、互換性、消費電力、設置性を同時に比較する。
NVIDIA日本公式Marketplaceでは従来の128GB DGX Sparkと国内の認定チャネル・OEM製品が案内されている。
一方、10月2日の64GB版発表はグローバルに10月23日、4,999ドルからと案内しており、2026年10月4日時点で日本の64GB版の統一的な円価格は公式ページ上で確認できない。
64GB版はOEMパートナー製品なので、SSD容量、保証、販売時期、価格がメーカーごとに異なる可能性がある。
米国価格をそのまま円換算して予算を確定しない方がよい。
国内購入では、Acer、ASUS、Dell、Gigabyte、HP、MSI各社の日本向け製品ページと販売店保証を確認する。
27B・32B級を中心にローカルで動かし、必要なときだけクラウドを併用するなら64GB版は有力だ。
CUDA環境を小さな専用機に切り出したい開発者にも合う。
70B級を長いコンテキストで常用する、複数エージェントやモデルを同時に動かす、ファインチューニングの余白を重視するなら128GBの価値が上がる。
100B級を「動かせればよい」のか、日常的に快適に使いたいのかも分けて考える。
将来2台へ拡張する案は柔軟だが、2台分の費用、ケーブル、電力、ネットワーク、分散対応を含めると、単体128GBより安いとは限らない。
DGX Spark 64GB版は、128GB版から演算基盤を大幅に落とした製品ではない。
同じGB10とDGX OSを維持し、メモリを64GBへ絞ることでローカルAIの入口を増やした構成だ。
その一方、ローカルLLMではメモリ容量がモデル選択の自由度に直結する。
最大100Bという数字より、普段使う量子化モデル、コンテキスト、KVキャッシュ、同時実行するツールまで含めた余白を見るべきだ。
64GBで十分なら小型CUDAマシンとして魅力がある。
70B以上を長文で常用したいなら128GBを優先し、2台構成は分散実行の手間と実測性能を確認してから選ぶ。
日本では64GB版の各社価格と発売条件が揃ってから、総費用で比較するのが現実的だ。

