更新日:
4/10/2026

ローカルLLMはGPUなしで動く?CPUだけで使えるモデルと必要メモリを解説

blog header image

目次

この記事のポイント

●
ローカルLLMはGPUなしでも実行できますが、専用GPUを使う場合より生成速度は遅くなります。
●
CPUだけで使う場合は、GGUFのQ4量子化と1B〜8B程度の小型モデルから始めるのが現実的です。
●
RAM 16GBは1B〜3B、32GBは7B〜14B、64GBは20B以上も候補ですが、容量と快適さは別です。
●
LM StudioではGPUオフロードを0にし、コンテキスト長を短くするとメモリ不足を避けやすくなります。
●
文章要約や短い質問ならCPU運用でも可能ですが、長文・画像・複数ユーザー運用にはGPUが有利です。

ローカルLLMは、専用GPUがないパソコンでもCPUとシステムRAMだけで動かせます。

ただし「起動できる」と「快適に会話できる」は同じではありません。

‍

GPUなしではモデルの計算をCPUが担当するため、回答が始まるまでの時間や1秒あたりの生成量で不利になります。

‍

結論として、普通のWindows PCで試すならGGUF形式のQ4量子化を選び、RAM 16GBでは1B〜3B、32GBでは7B〜8Bを中心に始めるのが安全です。

‍

14B以上も容量上は読み込める場合がありますが、CPUとメモリ帯域によっては待ち時間が長くなります。

PCメモリ 始めやすいモデル規模 量子化 主な用途
16GB 1B〜3B Q4 短い要約、分類、文章補助
32GB 3B〜8B、条件次第で14B Q4・Q5 日常的な質問、要約、軽いコード補助
64GB 8B〜20B以上 Q4中心 精度重視、長めの資料、実験用途

この記事では、GPUなしで動く仕組み、必要RAM、選びやすいモデル規模、LM Studio・Ollamaの設定、GPUを追加すべき判断基準を説明します。

ローカルLLMはGPUなしでも動く

ローカルLLMの推論はCPUでも実行できます。

‍

多くのGGUFモデルで使われるllama.cppは、CPU、Metal、CUDA、ROCm、Vulkanなど複数の実行方式へ対応しています。

‍

llama.cppの公式Feature matrixでも、CPUのAVX・AVX2環境でK量子化モデルなどを実行できることが示されています。

また、CPUとGPUへモデルを分けるハイブリッド推論にも対応しています。

‍

GPUがなくても動く理由は、モデルの重みをシステムRAMへ読み込み、CPUが順番に計算できるからです。

ただしCPUは、LLMの大量の行列計算を並列処理する点で専用GPUより不利です。

‍

CPU運用が向くのは、次のような用途です。

  • ローカルLLMを費用をかけずに試す
  • 短い文章の要約や分類を行う
  • 機密性のある文章をオフラインで処理する
  • 回答速度より、手元で動くことを優先する
  • 小型モデルをバックグラウンド処理に使う

‍

反対に、長い文書を頻繁に読み込む、画像を解析する、複数人が同時に使う、回答をすぐ表示したい場合はGPUの効果が大きくなります。

CPUだけで使う場合の必要RAMとモデル容量

GPUなしでは、モデル本体を主にシステムRAMへ読み込みます。

したがって、RAM容量がモデルファイルと実行時の追加領域より大きい必要があります。

‍

ただしPCのRAMすべてをモデルへ使えるわけではありません。

‍

WindowsやmacOS、ブラウザ、常駐アプリが先に数GBを使用します。

‍

32GB搭載PCでも、モデルへ安全に使える容量はそれより少なくなります。

RAM 現実的な開始点 挑戦できる範囲 注意点
8GB 0.5B〜1Bの小型モデル 3Bの低量子化 OS使用分が大きく、メモリ不足になりやすい
16GB 1B〜3B Q4 7B〜8B Q4 コンテキスト長を短くする
32GB 7B〜8B Q4・Q5 14B Q4 速度はCPUとメモリ帯域に左右される
64GB 14B〜20B Q4 27B〜32Bの量子化 容量が足りても生成が遅い場合がある

Q4は、モデルの精度をある程度保ちながら容量を減らす4bit量子化の代表的な選択肢です。

‍

Q2やQ3まで下げればさらに小さくできますが、回答品質が落ちやすくなります。

CPUでは、まずQ4_K_Mなど一般的なK量子化から試す方が扱いやすいでしょう。

‍

コンテキスト長を増やすとKVキャッシュが大きくなり、モデル本体以外のメモリ消費も増えます。

最初は4K〜8K程度から始め、必要な場合だけ増やします。

GPUなしPCで選びやすいモデル

CPUだけで使う場合は、性能ランキングの高い大型モデルより、少ないメモリで一定の回答品質を得られる小型モデルが向きます。

‍

1B〜3Bクラス

RAM 16GB前後の一般PCで始めやすい範囲です。

‍

短い要約、分類、文章の言い換え、定型的な質問に向きます。

Qwen3.5-0.8B、MiniCPM5-2B、Granite 4.2 3BなどのGGUF版が候補です。

‍

7B〜9Bクラス

RAM 16GBでは余裕が少なく、32GBあると扱いやすくなります。

回答品質は上がりますが、CPUだけでは生成待ちが目立つ場合があります。

‍

MiMo-V2.6-Distill-Qwen-9Bなどを試す場合は、Q4と短いコンテキストから始めます。

‍

14B以上

32GB以上のRAMで読み込める場合がありますが、CPUだけで日常的に会話するには遅くなりやすい範囲です。

夜間の一括要約など、即時性を求めない処理に向きます。

‍

モデルごとの必要容量は、ファイルサイズだけでなくアーキテクチャやKVキャッシュでも変わります。

一般PC向けの候補は、一般PCで使いやすいローカルLLMおすすめモデルも参照してください。

LM Studio・OllamaでCPU実行する方法

LM Studioの場合

  1. LM Studio公式サイトから対応OS版をインストールする
  2. モデル検索でGGUF形式の小型モデルを選ぶ
  3. 最初はQ4量子化をダウンロードする
  4. モデル読み込み設定でGPUオフロードを0またはCPU中心にする
  5. コンテキスト長を4K〜8K程度へ下げて読み込む
  6. 短い質問で応答時間とRAM使用量を確認する

LM Studioの公式要件では、Windows x64でAVX2対応CPUが必要で、16GB以上のRAMが推奨されています。

8GB環境では小型モデルと短いコンテキストが前提です。

‍

Ollamaの場合

Ollamaは対応モデルをコマンドで取得して実行できます。

‍

GPUを利用できない環境ではCPUへ処理が割り当てられます。

最初は小さいモデルを選び、タスクマネージャーやアクティビティモニタでRAM使用量を確認してください。

‍

どちらのアプリでも、モデルを読み込めない場合は、より小さいパラメータ数、低い量子化、短いコンテキストへ変更します。

‍

SSDへのスワップが始まると極端に遅くなるため、空きRAMを残すことが重要です。

CPU運用が遅い場合の改善方法とGPUを買う基準

CPUだけで遅い場合、すぐにPCを買い替える前に設定を見直します。

  1. モデルを1段階小さくする
  2. Q5・Q8からQ4へ変更する
  3. コンテキスト長を短くする
  4. ブラウザや画像編集ソフトを閉じる
  5. 不要な同時生成数を1へ下げる
  6. 一部だけでも内蔵GPU・専用GPUへオフロードできるか確認する

‍

LM Studioの公式CLI文書では、モデル読み込み時にコンテキスト長やGPUオフロードを設定し、読み込み前にメモリ使用量を見積もれると案内されています。

‍

専用GPUを検討する基準は、モデルが動くかどうかより、待ち時間を許容できるかです。

‍

毎日長文を処理する、14B以上を常用する、画像理解を使う、複数の処理を並行する場合はGPUの効果が大きくなります。

‍

反対に、短い要約や分類を1日に数回行うだけなら、CPU運用でも目的を達成できる可能性があります。

先に手持ちPCで小型モデルを試し、不足しているのが容量か速度かを確認してから購入してください。

ローカルLLMはGPUなしでも動きます。

‍

CPUとRAMだけで始める場合は、GGUFのQ4量子化と1B〜3Bモデルから試すのが安全です。

‍

RAM 32GBなら7B〜8B、条件次第で14Bも候補になりますが、メモリへ収まることと快適に生成できることは分けて考える必要があります。

‍

モデルを小さくし、コンテキスト長を下げても待ち時間が長い場合は、専用GPU搭載PCを検討します。

‍

購入前に、まずLM StudioやOllamaで手持ちPCの限界を確認する方法が最も無駄がありません。

他の記事も読む

X account logo
Xアカウントをフォロー!
最新の情報をいち早くゲット!
フォローする
back to article page
記事一覧に戻る
シェア
share link icon
‍無料会員登録
支持投票やブックマークなど、すべての機能にアクセスできます。
登録はほんの数秒で完了します!
無料会員登録
ログイン