
ローカルLLMは、専用GPUがないパソコンでもCPUとシステムRAMだけで動かせます。
ただし「起動できる」と「快適に会話できる」は同じではありません。
GPUなしではモデルの計算をCPUが担当するため、回答が始まるまでの時間や1秒あたりの生成量で不利になります。
結論として、普通のWindows PCで試すならGGUF形式のQ4量子化を選び、RAM 16GBでは1B〜3B、32GBでは7B〜8Bを中心に始めるのが安全です。
14B以上も容量上は読み込める場合がありますが、CPUとメモリ帯域によっては待ち時間が長くなります。
この記事では、GPUなしで動く仕組み、必要RAM、選びやすいモデル規模、LM Studio・Ollamaの設定、GPUを追加すべき判断基準を説明します。
ローカルLLMの推論はCPUでも実行できます。
多くのGGUFモデルで使われるllama.cppは、CPU、Metal、CUDA、ROCm、Vulkanなど複数の実行方式へ対応しています。
llama.cppの公式Feature matrixでも、CPUのAVX・AVX2環境でK量子化モデルなどを実行できることが示されています。
また、CPUとGPUへモデルを分けるハイブリッド推論にも対応しています。
GPUがなくても動く理由は、モデルの重みをシステムRAMへ読み込み、CPUが順番に計算できるからです。
ただしCPUは、LLMの大量の行列計算を並列処理する点で専用GPUより不利です。
CPU運用が向くのは、次のような用途です。
反対に、長い文書を頻繁に読み込む、画像を解析する、複数人が同時に使う、回答をすぐ表示したい場合はGPUの効果が大きくなります。
GPUなしでは、モデル本体を主にシステムRAMへ読み込みます。
したがって、RAM容量がモデルファイルと実行時の追加領域より大きい必要があります。
ただしPCのRAMすべてをモデルへ使えるわけではありません。
WindowsやmacOS、ブラウザ、常駐アプリが先に数GBを使用します。
32GB搭載PCでも、モデルへ安全に使える容量はそれより少なくなります。
Q4は、モデルの精度をある程度保ちながら容量を減らす4bit量子化の代表的な選択肢です。
Q2やQ3まで下げればさらに小さくできますが、回答品質が落ちやすくなります。
CPUでは、まずQ4_K_Mなど一般的なK量子化から試す方が扱いやすいでしょう。
コンテキスト長を増やすとKVキャッシュが大きくなり、モデル本体以外のメモリ消費も増えます。
最初は4K〜8K程度から始め、必要な場合だけ増やします。
CPUだけで使う場合は、性能ランキングの高い大型モデルより、少ないメモリで一定の回答品質を得られる小型モデルが向きます。
RAM 16GB前後の一般PCで始めやすい範囲です。
短い要約、分類、文章の言い換え、定型的な質問に向きます。
Qwen3.5-0.8B、MiniCPM5-2B、Granite 4.2 3BなどのGGUF版が候補です。
RAM 16GBでは余裕が少なく、32GBあると扱いやすくなります。
回答品質は上がりますが、CPUだけでは生成待ちが目立つ場合があります。
MiMo-V2.6-Distill-Qwen-9Bなどを試す場合は、Q4と短いコンテキストから始めます。
32GB以上のRAMで読み込める場合がありますが、CPUだけで日常的に会話するには遅くなりやすい範囲です。
夜間の一括要約など、即時性を求めない処理に向きます。
モデルごとの必要容量は、ファイルサイズだけでなくアーキテクチャやKVキャッシュでも変わります。
一般PC向けの候補は、一般PCで使いやすいローカルLLMおすすめモデルも参照してください。
LM Studioの公式要件では、Windows x64でAVX2対応CPUが必要で、16GB以上のRAMが推奨されています。
8GB環境では小型モデルと短いコンテキストが前提です。
Ollamaは対応モデルをコマンドで取得して実行できます。
GPUを利用できない環境ではCPUへ処理が割り当てられます。
最初は小さいモデルを選び、タスクマネージャーやアクティビティモニタでRAM使用量を確認してください。
どちらのアプリでも、モデルを読み込めない場合は、より小さいパラメータ数、低い量子化、短いコンテキストへ変更します。
SSDへのスワップが始まると極端に遅くなるため、空きRAMを残すことが重要です。
CPUだけで遅い場合、すぐにPCを買い替える前に設定を見直します。
LM Studioの公式CLI文書では、モデル読み込み時にコンテキスト長やGPUオフロードを設定し、読み込み前にメモリ使用量を見積もれると案内されています。
専用GPUを検討する基準は、モデルが動くかどうかより、待ち時間を許容できるかです。
毎日長文を処理する、14B以上を常用する、画像理解を使う、複数の処理を並行する場合はGPUの効果が大きくなります。
反対に、短い要約や分類を1日に数回行うだけなら、CPU運用でも目的を達成できる可能性があります。
先に手持ちPCで小型モデルを試し、不足しているのが容量か速度かを確認してから購入してください。
ローカルLLMはGPUなしでも動きます。
CPUとRAMだけで始める場合は、GGUFのQ4量子化と1B〜3Bモデルから試すのが安全です。
RAM 32GBなら7B〜8B、条件次第で14Bも候補になりますが、メモリへ収まることと快適に生成できることは分けて考える必要があります。
モデルを小さくし、コンテキスト長を下げても待ち時間が長い場合は、専用GPU搭載PCを検討します。
購入前に、まずLM StudioやOllamaで手持ちPCの限界を確認する方法が最も無駄がありません。

