VRAM 8GB・12GB
2bit・3bitで試すことは可能です。ただし、日常利用を目的にGPUを買い替える前に、クラウド利用の費用も比較してください。

先に結論を示すと、Qwen3.8-27BをローカルLLMとして比較的快適に使うなら、VRAM 24GB前後とRAM 64GBが有力な構成です。
VRAM 16GBは4bit量子化を試せる境界ですが、約15.7GBの軽量な4bit版でも、モデル以外に必要な実行領域を考えるとVRAM内へ完全には収まりません。
標準的なQ4_K_Mは約17.1GBあるため、GPUとRAMを併用する部分オフロードが必要です。
VRAM 8GB・12GBでも、モデルの一部をRAM側で処理すれば起動できる可能性はあります。
ただし、生成速度、コンテキスト長、画像入力などに制約が生じるため、「起動できる」と「日常的に使える」は分けて判断しなければなりません。
RAMは32GBが最低ラインに近く、CPUオフロード、画像入力、長文処理、ほかのアプリとの同時利用まで考えるなら64GBが望ましいでしょう。
なお、Qwenチームは個人向けPCの公式最低要件を公表していません。
本記事のVRAM・RAM表は、GGUFファイルの容量、KVキャッシュ、OS使用量、画像処理用データ、実行ソフトのオーバーヘッドから算出したAI TOP TIER編集部の目安です。

ローカルLLMそのものの仕組みを先に確認したい場合は、ローカルLLMとは?仕組み・導入方法・必要なものも参考にしてください。
Qwen3.8-27Bは、AlibabaのQwenチームが公開した270億パラメーターのDenseモデルです。
Denseとは、推論時に基本的にすべてのパラメーターを使用する構造を指します。
公式モデルカードでは、画像や動画を理解するビジョンエンコーダーを備えた、ネイティブなVision-Languageモデルと説明されています。
文章生成だけでなく、文書画像の読み取り、図表の分析、動画内容に関する質問にも対応する設計です。
Thinkingモードは標準で有効になっており、回答前に推論を生成します。用途に応じて無効化できるほか、推論の深さをxhigh、medium、lowから選ぶreasoning_effortも用意されています。
ただし、ローカル実行ソフトによっては、これらの設定を同じ形で操作できない場合があります。
ネイティブコンテキスト長は262,144トークンで、YaRNによる拡張を使えば最大100万トークンまで対応可能とされています。
100万トークンはメモリ消費が非常に大きく、家庭用PCでモデルカード記載の最大値をそのまま利用できるという意味ではありません。
ライセンスはApache License 2.0です。商用利用、改変、再配布が広く認められていますが、ライセンス文や著作権表示の保持などの条件があります。
生成物の適法性、商標、個人情報、第三者の権利まで自動的に保証するライセンスではありません。Apache License 2.0原文
Qwen3.8-2.4T-A95Bは総パラメーター2.4兆、推論時に稼働するパラメーターが950億のMixture of Expertsモデルです。
27B版とは必要な設備が大きく異なり、家庭用PC向けではありません。Qwen3.8-2.4T-A95B公式モデルカード
2026年8月16日時点でQwen3.8-MaxはQwen Cloudに掲載されていますが、Qwen3.8-27Bの公式ホスト版はモデルカード上で「coming soon」とされています。
両者を混同しないよう注意が必要です。
量子化とは、モデル内部の数値精度を下げて、ファイル容量と必要メモリを削減する技術です。
一般にビット数が低いほど省メモリになりますが、文章品質、推論、コーディング、画像理解などの精度が落ちる可能性があります。
以下は、Unslothが配布しているQwen3.8-27B GGUFファイルの容量です。
Qwen公式のPC最低要件ではなく、第三者による量子化ファイルの実容量を整理しています。Unsloth Qwen3.8-27B-GGUF
ファイル容量が15.7GBだからといって、VRAM 16GBで完全に動作するとは限りません。
推論時には、過去の会話情報を保持するKVキャッシュ、コンテキスト処理、CUDAなどのランタイム、画像・動画用のビジョンエンコーダー、バッチ処理用バッファーもメモリを使います。
Thinkingによって出力が長くなれば、保持するコンテキストも増えます。
Ollamaの公式qwen3.8:27bでは、Q4_K_Mのモデル本体が約17GB、画像用プロジェクターが約931MBです。
これだけでも16GB VRAMへ完全には収まりません。
容量が許すなら4bitを基準にし、足りなければ3bitへ下げる考え方が現実的です。
2bitは「モデルを起動する」目的には有効ですが、複雑な推論やコード生成を重視する場合は、元の質問に正しく答えられるかを実データで検証してください。
次の表はAI TOP TIER編集部の目安です。
実際の速度はGPU、CPU、メモリ帯域、量子化方式、実行ソフト、コンテキスト長によって変わります。
VRAM 8GBでは、最小の2bit GGUFでも約9GBあるため、GPUだけでは保持できません。
VRAM 12GBはRTX 3060 12GBが代表例で、2bitならGPUへ多くを載せられますが、3bitでは部分オフロードが現実的です。
VRAM 16GBではQ3_K_Mなどの3bit版なら比較的余裕を残せます。
IQ4_XSは約15.7GBですが、KVキャッシュや実行領域を含めると完全GPUオフロードは困難です。
VRAM 24GBでは4bitをGPUへ載せながら作業領域を確保しやすく、5bitも選択肢に入ります。
NVIDIAの公式仕様では、RTX 5070 TiとRTX 5080はいずれも16GB、RTX 5090は32GBです。
RTX 4090は24GB、RTX 4060 Tiには16GB版があります。
ローカルLLMでは、新しいGPUほど必ず使いやすいとは限りません。
RTX 5080はRTX 4090より新しい世代ですが、VRAMは16GB対24GBです。
モデルをGPU内へ収められるかという点では、RTX 4090のほうがQwen3.8-27Bに適しています。
RAM 32GBは、4bitモデルを扱うPCの最低ラインに近い容量です。
VRAMへモデルの大部分を載せられる場合は動かせますが、16GB VRAM以下で多くをRAMへオフロードするなら64GBが安心です。
Apple Silicon搭載Macでは、CPUとGPUが同じユニファイドメモリを共有します。
専用GPUのVRAMとPCのRAMを分けて考える必要がなく、大きなモデルを扱いやすい構造です。
Apple Siliconのユニファイドメモリアーキテクチャ
ただし、搭載メモリの全量をモデルへ使えるわけではありません。
macOS、実行ソフト、ブラウザ、KVキャッシュ、画像処理も同じ領域を使用します。
32GB MacはQwen3.8-27Bの4bit版を試す現実的な入口です。
64GBでは5bitや6bitを選びやすくなり、画像入力や長い文書も扱いやすくなります。
96GB以上ならBF16も視野に入りますが、262,144トークンや100万トークンを常に利用できるとは限りません。
Qwen3.8-27B以外の候補も含めてPC構成を検討する場合は、家庭用PCで使えるローカルLLM比較とローカルLLM向けPCスペック解説も確認してください。
LM Studioは、モデル検索、ダウンロード、読み込み、チャットをGUIで進められます。
Qwen3.8-27Bのモデルページも公開されており、初めてローカルLLMを試す人には最も分かりやすい選択です。
VRAM 16GB以下では、GPUオフロード率とコンテキスト長を自動設定のまま使わず、読み込み前の推定メモリを確認してください。
Ollamaはターミナル操作やローカルAPIとの連携に向いています。
2026年8月16日時点では、公式ライブラリにqwen3.8:27bが掲載されています。
ollama run qwen3.8:27b
公式タグは約18GBあるため、VRAM 16GB環境ではRAM併用になる可能性が高い点に注意してください。
独自GGUFを使う場合は、OllamaのGGUFインポート手順に従ってModelfileを作成できます。
llama.cppは、GPUへ載せるレイヤー数、コンテキスト長、CPUとの分担を細かく調整したい人向けです。
CUDA、Apple Metal、Vulkanなどに対応し、VRAMへ収まらないモデルをCPUとGPUで分担できます。
Unsloth配布ページで確認できる実行例は次の通りです。
llama-cli -hf unsloth/Qwen3.8-27B-GGUF:UD-Q4_K_XL
UD-Q4_K_XLは約17.9GBあるため、16GB GPU向けの例ではありません。
容量が足りない環境では3bit版を選び、GPUオフロード率とコンテキスト長を調整する必要があります。
Qwenチームが掲載したベンチマークでは、Qwen3.8-27BがQwen3.6-27BやMuse Glimmer-30Bを上回る項目があります。
これらはQwen側が公表した結果であり、独立した第三者による再検証ではありません。
評価環境やハーネスも項目ごとに異なるため、特定用途での優劣を保証する数値ではなく、導入テストを始める根拠として捉えるのが適切です。
日本語については、モデルカードに日本語専用ベンチマークや明確な言語一覧が掲載されていません。
日本語での対話や文章生成には利用できますが、敬語、固有名詞、専門文書、3bit以下の量子化による品質変化は実データで確認すべきです。
Qwen3.8-27Bの価値は、27Bというローカル運用可能な規模で、画像・動画理解、Thinking、長いコンテキスト、エージェント機能をまとめて利用できる点にあります。
VRAM 24GBのGPUや64GB Macをすでに所有している人にとっては、追加のAPI料金を気にせず、機密文書や社内コードを端末内で処理できる有力なモデルです。
モデル自体の利用に従量課金はありませんが、PC購入費、電力、保存容量、更新や運用にかかる時間は必要です。
一方、Qwen3.8-27Bのためだけに高価なGPUを購入する場合、利用頻度によってはクラウドAPIのほうが安くなります。
公式Qwen Cloudの27B版は現時点で提供前なので、急がなければ料金と提供条件が公開されてから比較するのも合理的です。
法人利用では、ローカル実行だから自動的に安全になるわけではありません。
モデルファイルの入手元、実行ソフトの通信設定、利用者権限、会話ログ、生成物の確認手順まで含めて運用を設計する必要があります。
Qwen3.8-27Bを導入するかどうかは、モデルを起動できるかではなく、必要な量子化と速度で継続利用できるかを基準に判断すべきです。
既存環境でVRAM 24GB前後、または64GB以上のApple Silicon搭載Macを持っているなら、4bit・5bitを中心にローカル運用を試す価値があります。
VRAM 16GBでは3bitか部分オフロードを前提にし、VRAM 8GB・12GBでは検証用途と割り切るほうが現実的です。
これから高価なPCを購入する場合は、公式Qwen Cloud版の提供条件や利用頻度も比較してください。
機密情報を端末内へ残したい、API料金を固定化したい、量子化や実行環境を自分で管理したいという明確な理由がある人ほど、Qwen3.8-27Bのローカル運用から得られる価値は大きくなります。

