ローカルLLMを回すVPS

最終更新: 2026-07-30

「7Bモデルを動かしたい」と言われても、量子化の有無で必要メモリは3倍変わります。まず現実的な数字から。

当サイトは各VPS事業者のアフィリエイトプログラムに参加しており、リンク経由でのお申し込みにより報酬を受け取る場合があります。ただし掲載順位・評価・実測データは編集方針と計測結果のみに基づいており、報酬額による優遇は一切行いません。日本リージョンが無い事業者や、報酬が発生しない事業者も同じ基準で掲載しています。

必要メモリの現実

「7Bモデル」という表現だけでは必要スペックは決まりません。量子化の有無で3倍変わります。

モデル4bit量子化8bit量子化FP16(量子化なし)
3B約2.5GB約4GB約7GB
7B / 8B約5.5GB約9GB約15GB
13B約9GB約15GB約26GB
32B約20GB約35GB約64GB
70B約42GB約75GB約140GB

これに OS・コンテキストウィンドウ・その他プロセスで2〜4GB を足したものが、必要なRAMです。

CPU推論は実用になるか

なります。ただし用途を選びます

GPUなしのVPSで7B/4bit量子化を動かした場合、生成速度はおおむね毎秒3〜10トークン程度です。vCPU数とメモリ帯域に依存します。

用途CPU推論で実用か
バッチでの要約・分類◎ 十分実用的
非同期のテキスト処理◎ 問題なし
RAGの埋め込み生成○ 遅いが待てる
対話・チャット△ 待ち時間が苦痛
コード補完✕ 遅すぎる

「待てる処理」なら CPU推論で十分というのが結論です。裏でキューを回す用途なら、GPUに金を払う必要はありません。

選択肢

大容量RAMを最安で — Contabo

この用途でのコスパは圧倒的です。

プランvCPURAM月額動かせる目安
Cloud VPS 548GB€4.997B/4bit
Cloud VPS 10616GB€8.9913B/4bit、7B/8bit
Cloud VPS 20824GB€14.9932B/4bit
Cloud VPS 301248GB€26.9970B/4bit

48GB RAMが月€26.99(約4,500円)で、70Bクラスの4bit量子化まで載ります。他社で同じRAMを確保しようとすると数倍かかります。東京リージョンがあるのも利点です。

ContaboPR48GB RAMが€26.99。大容量メモリの単価では他社が追いつけない
公式で料金を見る

速度が要るなら — Vultr のGPUプラン

NVIDIA A100 / L40S などのGPUインスタンスが借りられます。ただし価格帯は格安VPSとは別物で、時間あたり数百円〜数千円です。

常時稼働させると月数万円〜になるため、必要なときだけ起動する運用が前提になります。Vultrは時間単位課金なので、この使い方と相性が良いです。

日本リージョンが不要なら — Hetzner

ARM64の CAX31(8vCPU / 16GB / €12.49)などが候補です。ARM64でもOllamaは動きます。ただし最寄りがシンガポール(実測68ms)なので、対話的に使うには遠いです。

バッチでモデルを回して結果だけ取りに行く運用なら、距離は問題になりません。

構成のポイント

ディスクを多めに取る

モデルファイルは大きいです。

  • 7B/4bit: 約4GB
  • 13B/4bit: 約8GB
  • 32B/4bit: 約19GB
  • 70B/4bit: 約40GB

複数のモデルを試すなら、100GB以上を見ておくべきです。25GBのプランではモデル2つで埋まります。

スワップは効かない

メモリ不足をスワップで補おうとしても、推論速度が実用外まで落ちます。モデルは全体がメモリに載っている必要があるため、RAMをケチる意味はありません。素直に上のプランを選んでください。

転送量に注意

モデルのダウンロードで数十GBを消費します。Contaboの東京リージョンは転送量無制限なのでここでも有利です。転送量が従量課金の会社では、モデルを何度も入れ直すと請求が膨らみます。

# Ollama の導入
curl -fsSL https://ollama.com/install.sh | sh

# メモリに載るか確認してから引く
ollama pull llama3.1:8b-instruct-q4_K_M
ollama run llama3.1:8b-instruct-q4_K_M

PR

大容量RAMならContaboが最安

48GB RAMが月€26.99。東京リージョンがあり転送量も無制限なので、モデルの入れ替えが多いローカルLLM用途に最も向いています。

  • 日本リージョン: 東京
  • 最安 €4.99〜 / 月単位(時間課金なし)
  • スペック単価が圧倒的。8GB RAMが€4.99から

上記は広告リンクです。価格・特典は公式サイトの表示が最新です。

よくある質問

CPUだけでローカルLLMは実用になりますか

モデルサイズと用途によります。7Bクラスの4bit量子化モデルなら、CPU推論でも毎秒数トークン程度は出ます。バッチ処理や非同期の要約なら十分実用的ですが、対話用途としては待ち時間が長すぎると感じるはずです。

7Bモデルに必要なメモリはどれくらいですか

4bit量子化なら約5〜6GB、8bit量子化なら約9GB、量子化なし(FP16)なら約15GBが目安です。加えてOSとコンテキスト用に数GB必要なので、4bit量子化なら8GB、FP16なら24GBのプランを選んでください。

格安VPSでGPUは使えますか

VultrとDigitalOceanにGPUプランがありますが、時間あたり数百円〜数千円と格安VPSの価格帯ではありません。常時稼働させると月数万円になるため、必要なときだけ時間課金で起動する使い方が現実的です。

ContaboとHetznerのどちらがいいですか

日本リージョンが必要ならContabo東京一択です。不要ならHetznerのARM64も選択肢ですが、大容量RAMプランの単価ではContaboが有利です。

Contabo: €4.99〜PR・アフィリエイトリンク
公式を見る