ローカルAI用自作PC|必要なスペックとパーツの選び方
ローカルAIは、自分のパソコンなどでAIモデルを動かして処理する方法です。インターネットを通じて外部サーバー上で処理するクラウドAIとは、処理を行う場所が違います。ローカルAI用の自作PCは、使用するAIモデルと実行ソフトを先に決め、その条件に合わせてパーツを選びます。
グラフィックボードはVRAM容量と実行ソフトへの対応、メモリやSSDは使用するAIモデルや保存量、電源やケースは取り付けるグラフィックボードに合わせて選びます。現在のPCを活用する場合についても、使用するAIモデルに必要なスペックと現在の構成を照らし合わせ、パーツごとに交換または増設が必要かを判断するポイントを解説します。
この記事では、主にローカルLLMの推論に使う自作PCについて、必要なスペックの見積もり方と、各パーツを選ぶ順序を解説します。
この記事でわかること
- 4bit量子化したAIモデルをGPU中心で動かす場合は、7B~8B級ならVRAM 8GB以上、12B~14B級なら12GB以上、27B~32B級なら24GB前後を目安にグラフィックボードを選ぶ。
- 軽量なAIモデルを少数試すならメモリ16GB以上、ほかのアプリも一緒に使うなら32GB以上を目安にし、SSDは保存するAIモデル・実行ソフト・生成物の合計から必要容量を決める。
- 候補のグラフィックボードが推奨する電源容量を満たさない場合は電源も見直し、カード寸法がケースの搭載可能寸法を超える場合は、収まるグラフィックボードまたはケースを選ぶ。
目次
ローカルAI用自作PCのスペックを決める前提
ローカルAIには、文章生成や要約を行うローカルLLM、指示文から画像を生成する画像生成AI、音声を文字へ変換する音声認識AIなどがあります。必要なパーツとスペックは、使用するAIの種類やAIモデルによって変わります。
本記事では、文章生成に使うローカルLLMを主に扱います。
AI PCとローカルAIは同じ意味ではない
「AI PC」は、NPUなどのAI処理向け機能を備えたパソコンに使われる呼称です。一方、ローカルAIは、AIモデルを自分のパソコンなどのローカル環境で動かす仕組みです。AI PCと呼ばれていないGPU搭載PCでも、使用するAIモデルと実行ソフトの条件を満たせば、ローカルLLMや画像生成AIなどを動かせます。
クラウドAI・ローカルAIの特徴とAI PCの選び方は、下記のページで解説しています。
話題のAI PCとは?AIパソコンの解説とおすすめPCラインアップ
ローカルLLMでは「学習」で作られたAIモデルが「推論」で回答を生成する
AIモデルは、多くのデータを使った「学習」によって作られます。学習を終えたAIモデルには、文章や画像の特徴を表す多数の数値が保存されています。
ローカルLLMを利用する場合は、配布されている学習済みのAIモデルをPCへ保存し、実行ソフトで読み込みます。そのAIモデルへ質問や指示を入力し、回答を生成させる処理が「推論」です。チャット、要約、翻訳、コード生成などが推論にあたります。
AIモデルを一から作る学習や、既存のAIモデルを追加データで調整するファインチューニングは、推論とは必要なスペックが違います。学習やファインチューニングには、一般的に推論より多くのVRAM、メモリ、処理時間が必要です。本記事では、配布されている学習済みのAIモデルを使って推論する場合のスペックを扱います。
AIモデルをPCで動かすには実行ソフトが必要
ローカルLLMでは、Llama、Qwen、Gemmaなどの学習済みモデルをPCへ保存して使用します。ただし、AIモデルは文章生成に必要な数値データを持つファイルであり、モデル単体ではチャットや要約を実行できません。
AIモデルをPC上で動かすには、モデルを読み込んで推論を実行するソフトが必要です。Ollama、LM Studio、llama.cppなどがあり、対応するモデルを読み込んで、チャット、要約、翻訳、コード生成などを行います。
モデルと実行ソフトは、どの組み合わせでも利用できるわけではありません。使用するモデルの配布形式を実行ソフトが読み込めるか、使用するOSやGPUで動作するかを、実行ソフトの公式情報で調べます。
ローカルLLMは、PC内に保存した資料を回答へ反映させる使い方にも利用できます。その代表的な仕組みが「RAG(検索拡張生成)」です。RAGでは、質問に関連する箇所を資料から検索し、その内容を質問と一緒にLLMへ渡します。資料を使ってモデル自体を学習し直すのではなく、回答するときに必要な情報を追加する仕組みです。
モデルの規模と設定によって必要な容量が変わる
LLMの規模は「パラメータ数」で表されます。パラメータは、AIモデルが学習によって得た多数の数値で、7Bは約70億、14Bは約140億のパラメータを持つモデルであることを示します。一般的にパラメータ数が多いモデルほど、保存や実行に必要な容量も大きくなります。
AIモデルは、学習によって得た多数の数値を保持しています。この数値を、より少ないビット数で表してモデル容量を小さくする方法が「量子化」です。量子化すると必要なVRAMを抑えられますが、方式や量子化の程度によって生成品質や速度への影響が異なります。
さらに、LLMが一度に参照できる文章量を「コンテキスト長」と呼びます。コンテキスト長を長くすると、より長い文書や会話を参照できますが、処理中に必要なメモリも増えます。
そのため、使用するモデルを決めたら、パラメータ数、量子化方式、コンテキスト長を確認し、モデル本体と処理中のデータに必要なVRAM容量を見積もります。次の章では、これらの情報をグラフィックボード選びへつなげる方法を解説します。
画像生成AI
Stable Diffusion系などの画像生成モデルも、自作PC内のローカル環境で実行できます。入力した指示文をもとに画像を生成し、モデルや追加データを切り替えることで、画風や被写体、生成方法を調整できます。
画像サイズ、同時に生成する枚数、使用するモデル、追加モデル、ワークフローによってVRAM使用量が変わります。LLMと共通してGPU・VRAMが重要ですが、必要容量をLLMのパラメータ数だけで判断することはできません。利用する画像生成ソフト、モデル、解像度、拡張機能を組み合わせて確認します。
Stable Diffusionなどの画像生成AIに適したPCは、下記の記事で解説しています。
画像生成AI(Stable Diffusion)推奨PCの選び方|快適さはVRAM容量で変わる
GPUとVRAMが重要な理由
ローカルAIの推論でGPUが重要な理由
AIモデルの推論では、多数の計算を繰り返します。GPUは多くの計算を同時に処理しやすいため、利用条件を満たす実行ソフトを使えば、CPUだけで処理するより生成を高速化しやすくなります。このため、ローカルLLM用の自作PCでは、使用するモデルに対応するGPUと、必要なデータを収めるVRAM容量がパーツ選びの中心になります。
GPUでローカルLLMを動かすには、実行ソフトがGPUを認識し、モデルの計算をGPUへ割り当てられる必要があります。GPUを利用できない構成では、CPUで処理されるか、モデルを実行できない場合があります。
モデルの重みと処理中のデータをVRAMへ置く
GPUでLLMを動かすときは、モデルが学習によって獲得した数値データである「重み」を、主にVRAMへ読み込みます。推論中は重みに加えて、入力した文章と生成済みの文章を参照し続けるためのデータもVRAMに保持します。この保存領域を「KVキャッシュ」と呼びます。
さらに、計算途中の一時データや実行ソフトウェアが使う領域も必要です。そのため、ダウンロードしたモデルファイルがVRAM容量内に収まっていても、そのままGPUだけで動かせるとは限りません。
KVキャッシュの使用量は、一度に参照する文章量、モデルの構造、データの精度、同時に処理する件数などで変わります。長い文章を入力・生成するほど、同じモデルでも必要なVRAMが増える場合があります。
VRAMに収まらないモデルも動かせる場合がある
LLMの実行方法によっては、モデル全体をVRAMへ読み込まず、一部をVRAM、残りをパソコンのメモリ(RAM)へ置いて処理できます。llama.cppを利用するソフトウェアなどが対応している方法です。
この方法では、VRAMに割り当てた部分をGPUが処理し、RAMに置いた部分をCPUが処理します。そのため、VRAM容量を超えるモデルでも実行できる可能性がありますが、モデル全体をGPUで処理する場合より生成速度は低下します。このようにモデルの処理をGPUとCPUへ振り分けることを「オフロード」と呼びます。
さらにRAMも不足すると、Windowsの仮想メモリなどを介してSSDが使われる場合があります。SSDはRAMより低速なため、生成速度が大きく低下したり、モデルを読み込めなかったりする原因になります。RAMの増設は実行できるモデルの範囲を広げる手段ですが、VRAMを増やす場合と同じ速度を得られるわけではありません。
VRAM容量やGPU価格だけでは決められない
VRAM容量が増えると選べるモデルや設定の幅が広がります。一方、生成速度にはGPUの演算性能やメモリ帯域も影響します。また、GPUをAIの計算に利用するには、OS、ドライバー、実行ソフト、GPUの処理基盤が対応している必要があります。
先に「何を、どのソフトで、どのOS上で動かすか」を決め、その条件を満たすGPUからVRAM容量と価格を比較します。
GPU・VRAMは使いたいモデルとソフトウェアから選ぶ
- 用途を決める
文章生成、画像生成、音声認識など、ローカル環境で実行したい処理を決めます。 - モデルと実行ソフトを決める
使用するモデルの規模と形式、実行ソフト、OSを組み合わせて考えます。 - 対応するGPUを絞り込む
実行ソフトの公式情報から、利用できるGPUメーカー・製品・処理方式を調べます。 - 必要なVRAM容量を見積もる
モデル本体だけでなく、処理中に使用する領域と余裕を含めます。 - 価格と搭載条件を比較する
処理性能、価格、消費電力、電源、カード寸法を比較し、現在のPCへ組み込める候補を選びます。
AIモデル規模別のスペック目安
ローカル環境では、モデル内の数値を簡略化してファイル容量と必要メモリを減らした「量子化モデル」がよく使われます。次の表は、その代表例である4bit量子化モデルを、自分のPCで1回に1人が文章生成へ使う場合の目安です。
表の「Q4重みの概算」は、モデルの数値を主に4bitで保持した場合の単純計算を基にしています。実際のファイル容量は量子化方式やモデル構造によって変わり、実行時にはKVキャッシュなどの領域も加わります。表の数値は動作保証ではなく、候補となる構成を絞り込むための目安として使用してください。
| モデル規模 | Q4重みの概算 | GPU中心で動かす場合 | RAMを併用する場合 | 用途の目安 |
|---|---|---|---|---|
| 7B~8B級 | 約4~5GB+付加データ | VRAM 8GB以上から検討 | メモリ16GB以上から試せる構成がある | チャット、要約、軽量なコード支援 |
| 12B~14B級 | 約6~8GB+付加データ | VRAM 12GB以上から検討 | メモリ32GB以上を目安に余裕を確認 | 軽量モデルより精度を求める文章生成 |
| 27B~32B級 | 約14~18GB+付加データ | VRAM 24GB前後が検討しやすい | メモリ64GB以上を目安にオフロードを検討 | より大きなモデル、複雑な指示やコード支援 |
| 70B級 | 約35~45GB+付加データ | 48GB以上のVRAMを持つ構成など | メモリ64GBでは条件が厳しく、128GB級も検討 | 個人PCでは量子化・速度・費用の検討が必要 |
※上記は製品やモデルの動作保証ではありません。モデルの形式、量子化方式、コンテキスト長、GPUへ載せるレイヤー数、OS・常駐アプリの使用量で変わります。
SSD容量はモデルファイルの合計から決める
SSDには、モデル本体、実行ソフト、生成物、追加モデルや埋め込みモデルなどを保存します。1モデルのサイズだけでなく、比較のために残す量子化違い、更新前後のモデル、画像生成用モデルも含めて見積もります。
軽量なLLMを少数試すだけなら数十GBの空き容量から始められますが、複数のLLMや画像生成AIを併用すると数百GBを使う場合があります。必要なSSD容量は、保存するモデルファイルの合計に、ダウンロードや更新、生成物を保存するための空き容量を加えて決めます。
パーツ別の選び方
グラフィックボードはVRAMとソフトウェア対応を確認する
まず、実行ソフトの公式情報から、使用するGPUとOSで動作するかを調べます。ここで調べられるのは、主に利用できるGPU製品、OS、CUDAやROCmなどの処理基盤です。必要なVRAM容量は、使用するモデルのファイル容量やコンテキスト長から別に見積もります。候補が複数ある場合は、演算性能、メモリ帯域、消費電力、価格を比較します。
GPUをAIの計算に使うには、実行ソフトからGPUへ計算を割り当てるための「処理基盤」が必要です。処理基盤は、実行ソフトとGPUの間をつなぎ、GPUへ計算内容を伝える仕組みです。CUDAは、NVIDIA製GPUをAIなどの計算に利用するための開発・実行基盤で、多くのAIソフトウェアが利用しています。
AMD製GPUでは、AI計算向けのROCmや、幅広いGPUで計算処理に利用できるVulkanなどが使われます。CUDA、ROCm、Vulkanでは利用できるGPU製品やOSが異なるため、使用するグラフィックボード、OS、実行ソフトの組み合わせを公式情報で調べます。
VRAM・処理性能・価格のバランスからグラフィックボードを比較する
ローカルAI向けのグラフィックボードは、使いたいモデルに必要なVRAM容量を確保したうえで、実行ソフトへの対応、処理性能、消費電力、価格のバランスから選びます。
たとえば、VRAM 12GBを搭載するRadeon RX 9070 GREは、一部の12B~14B級量子化モデルを検討できる候補の一つです。ただし、利用できるかはOSと実行ソフトの対応状況も確認します。
Radeon RX 9070 GRE搭載グラフィックボードを見る
メモリはモデルとOS・アプリの合計で決める
メインメモリは、CPU推論、GPUへ載せきれない部分のオフロード、モデル読み込み時の処理などに使われます。必要容量を考えるときは、モデルだけでなくOS、ブラウザー、開発環境、RAG用アプリなどの使用分も残します。
7B~8B級を軽く試す構成では16GBから動く場合がありますが、ほかのアプリを併用するなら32GBのほうが余裕を確保しやすくなります。27B~32B級のオフロードや複数アプリの併用では64GB以上も検討します。容量を増やす前に、マザーボードの最大容量、空きDIMMスロット、CPUの対応規格、既存メモリとの組み合わせを確認します。
メモリ容量別の動かし方は、下記の記事で解説しています。
SSDは容量を優先し、読み込み時間も考慮する
SSDの速度は、モデルの初回読み込みや切り替えに影響します。一方、生成中の主なボトルネックはGPU・VRAM・メモリなどであり、NVMe SSDを高速な世代へ交換すれば生成速度そのものが比例して上がるわけではありません。
まず必要容量と増設可否を決め、SATA SSDかNVMe SSDか、M.2スロットの対応規格と空き、発熱対策、モデル保存先を確認します。複数モデルを保持するなら、OS用とは別にAIモデル用SSDを増設すると容量管理や移行がしやすくなります。
CPUはGPUへ載せない処理とPC全体の操作性に関わる
GPUへモデル全体を載せる構成でも、モデルの読み込み、トークン処理の一部、RAGの前処理、アプリの実行などでCPUを使います。CPU推論や大きなCPUオフロードを行う場合は、コア数、メモリ帯域、対応する命令セットも速度に影響します。
ただし、GPU推論が中心なら、CPUだけを上位製品へ交換してもVRAM不足は解消しません。現在のCPU使用率や実行方法を確認してから交換を判断します。
電源・マザーボード・ケース・冷却もGPU交換前に確認する
| パーツ・条件 | 調べる内容 | 選定・対応 |
|---|---|---|
| 電源ユニット | GPU・カードメーカーの推奨容量、補助電源端子、指定されたケーブルの接続方法、電源の経年劣化 | 容量や端子が不足する場合は、GPUと同時に電源の交換も検討する |
| マザーボード | PCIe x16スロット、GPU装着時に塞がるスロット、M.2・DIMMの空き | GPUを装着でき、増設予定のSSDやメモリ用スロットも残る構成にする |
| PCケース | GPUの長さ・厚さ・高さ、電源ケーブルを曲げる空間、ドライブやファンとの干渉 | カードメーカーの寸法とケースの搭載可能寸法を照合し、余裕を確保する |
| 冷却 | ケースの吸気・排気、連続推論時のGPU・CPU温度と騒音 | 温度が高い場合は、ケースファンの数や配置、ケーブルの取り回しを見直す |
現在のPCを交換・増設する際の確認方法
- 用途と実行ソフトを決める
チャット、要約、コード生成などの目的と、推論か学習かを分け、Ollama、LM Studioなど使用予定のソフトを決めます。 - モデルファイルと設定を決める
使用するモデルのパラメータ数と量子化方式を選び、ダウンロードするモデルファイルの容量を調べます。長文を扱う場合は、使用するコンテキスト長も決めます。 - 現在のGPU・VRAM・メモリ・空き容量を確認する
Windowsではタスクマネージャーの「パフォーマンス」でGPUの専用メモリとメモリ容量を確認できます。SSDの空き容量はエクスプローラーから確認します。 - GPUの利用条件を公式情報で調べる
実行ソフトの公式情報で、GPU製品、OS、必要なドライバーと処理基盤を調べます。モデルを実行した後は、タスクマネージャーや実行ログを見て、計算がGPUへ割り当てられているかを確かめます。 - 交換・増設の成立条件を確認する
グラフィックボードなら電源・補助電源・ケース内寸、メモリなら規格・最大容量・空きスロット、SSDなら接続規格・空きスロットを確認します。
| 不足・症状 | 調べ方と対応 |
|---|---|
| モデルがVRAMへ収まらない | 小さいモデルや量子化を選ぶ、コンテキスト長を抑える、RAMへ一部オフロードする、より大容量VRAMのGPUへ交換する |
| 生成速度が遅い | タスクマネージャーや実行ログで、計算がGPUとCPUのどちらへ割り当てられているかを調べる。CPUで処理されている場合はドライバー・処理基盤・実行ソフトの設定を見直し、GPUで処理しても遅い場合は小さいモデルや量子化方式への変更を検討する |
| メモリが不足する | 常駐アプリを減らす、モデルを小さくする、マザーボードの対応範囲内でメモリを増設・交換する |
| SSD容量が不足する | 不要モデルを整理する、保存先を変更する、対応するSSDを増設または大容量品へ交換する |
| 新しいGPUを搭載できない | 候補GPUの電源容量・端子・カード寸法と現在のPC構成を照合し、不足する場合は電源やケースを含めて構成を見直す |
不足箇所が複数ある場合、グラフィックボードだけ交換しても電源やケースが対応せず、結果的に構成全体の見直しが必要になることがあります。購入前に交換後の構成を一式で確認します。
まとめ
ローカルAI用自作PCは、使用するモデルの規模、量子化方式、コンテキスト長、実行ソフトを先に決めます。そのうえで、モデルの重みと処理中のデータが収まるVRAM容量を見積もり、必要なメモリとSSD容量、CPUを組み合わせます。
グラフィックボードを選ぶときは、VRAM容量と実行ソフトへの対応に加えて、電源容量、補助電源、ケース内に取り付けられるスペース、冷却も確認します。現在のPCを活用する場合は、不足しているパーツと交換・増設の成立条件を確認してから購入候補を絞り込みましょう。
必要な構成を整理したら、グラフィックボード・メモリ・SSDの候補を確認できます。
よくあるご質問(FAQ)
-
Q1ゲーミング用のグラフィックボードでもローカルAIを動かせますか?
実行ソフトが使用するGPUとOSで動作し、モデルと処理中のデータがVRAMへ収まれば利用できます。実行ソフトの公式情報でGPU・OS・処理基盤を調べたうえで、必要なVRAM容量をモデルと設定から見積もります。 -
Q2自作PCでローカルAIを使うためにNPUは必要ですか?
ローカルLLMや画像生成AIをGPUで動かす構成では、NPUは必須ではありません。NPUを使えるかはモデルとソフトウェア側の対応によります。Copilot+ PCの要件と、任意のローカルAIを動かすための要件は分けて考えます。 -
Q3メモリを増やせばVRAM不足を補えますか?
利用する実行ソフトによっては、モデルの一部をメインメモリへ置いて動かせます。ただし、GPUのVRAM内で完結する場合より遅くなりやすく、メモリ増設がVRAM増設と同じ効果になるわけではありません。 -
Q4NVIDIAとAMDのどちらがローカルAIに向いていますか?
メーカー名だけでは決まりません。NVIDIAはCUDAを利用するソフトが多く、AMDではROCmやVulkanを利用する方法があります。使用する実行ソフトの公式情報で、OSとGPU型番を利用できるか調べ、必要なVRAM容量と価格を比較します。 -
Q5高速なSSDへ交換するとAIの生成速度も上がりますか?
モデルの読み込みや切り替えは速くなる場合がありますが、生成中の速度は主にGPU、CPU、メモリ構成などに左右されます。SSDの世代だけを上げても、トークン生成速度や画像生成速度が比例して向上するとは限りません。 -
Q6グラフィックボードを2枚にすればVRAM容量を単純に合算できますか?
すべてのソフトウェアで自動的に合算できるわけではありません。複数GPUへのモデル分割に対応する実行環境と設定が必要で、GPU間の通信やPCIeレーン、電源、冷却も性能と安定性に影響します。
あわせて読みたい関連記事・特集一覧
メモリ32GBでローカルAIはどこまで動く?必要な容量の目安
メモリ64GBは必要?ローカルAIで70Bモデルを動かすための目安
