研究報告書、実験データ、ソースコードなどを生成AIで扱いたい一方、外部サービスへ送信できない情報もあります。そのような用途で注目されているのが、PCや社内サーバー上でモデルを実行するローカルLLMです。

ローカルLLMは、データの保存場所やモデルの版を自分で管理しやすく、研究開発向けの検証環境を作るのに適しています。一方、ローカルで実行するだけで回答が正確になったり、セキュリティ対策が不要になったりするわけではありません。

結論から言えば、最初は小型モデル、公開情報または疑似データ、限定された用途から始め、必要メモリ、回答精度、外部通信、ログ、アクセス権を確認しながら段階的に広げる方法が現実的です。

この記事では、ローカルLLMの仕組み、必要スペック、量子化、実行環境、Ollamaを使った導入手順、RAGとの連携、セキュリティ、評価方法を研究者向けに解説します。さらに、架空の材料科学文書を使ったローカル実測結果も紹介します。

Contents
  1. ローカルLLMとは
  2. 研究開発でローカルLLMを使う利点
  3. ローカルLLMとクラウドLLMの違い
  4. ローカルLLMでできること
  5. 必要スペックを決める4つの要素
  6. モデル規模別のメモリ目安
  7. 量子化とは
  8. ローカルLLMの実行環境を選ぶ
  9. 2026年10月時点のモデル選定例
  10. Ollamaを使った導入手順
  11. ローカルLLMとRAGを組み合わせる
  12. 材料科学のローカル実測例
  13. ローカルLLMを評価する指標
  14. ローカルだから安全とは限らない
  15. 個人検証から組織導入へ進める手順
  16. よくある質問
  17. まとめ
  18. 参考文献・公式資料

ローカルLLMとは

ローカルLLMとは、クラウド上のAPIへ質問を送るのではなく、自分のPC、ワークステーション、または組織内のサーバーへモデルを保存して実行する構成です。

一般的には、次の要素で構成されます。

  • モデルの重みファイル
  • Ollamaやllama.cppなどの推論エンジン
  • CPU、GPU、メモリ、ストレージ
  • チャット画面またはAPI
  • 必要に応じてRAG、計算ツール、認証機能

モデルの重みが公開されていても、利用条件がすべて自由とは限りません。「オープンウェイト」「オープンソース」「商用利用可能」は同じ意味ではないため、モデルカードとライセンスを個別に確認します。

研究開発でローカルLLMを使う利点

データの保存場所を管理しやすい

入力、取得文書、回答を管理対象の端末やサーバー内で処理できます。未公開の実験結果や技術文書を扱う場合、どこへデータが送られ、どこに保存されるかを自分たちで設計できます。

モデルと実行条件を固定しやすい

モデルファイル、量子化、プロンプト、temperature、seed、実行環境を保存すれば、同じ構成を再利用しやすくなります。クラウドサービスの内部更新による変化を避けたい検証にも向きます。

用途に合わせて構成を変更できる

社内文書を検索するRAG、PythonやRによる計算、データベース検索、画像解析などを組み合わせられます。モデル単体の性能だけでなく、業務に必要な処理を一つのシステムとして設計できます。

利用量によっては費用を管理しやすい

APIの従量課金はありませんが、PCやGPUの購入、電力、保守、バックアップ、担当者の工数が発生します。利用頻度と同時利用者数を含めた総費用で比較します。

ローカルLLMとクラウドLLMの違い

項目ローカルLLMクラウドLLM
導入モデルと実行環境の構築が必要アカウントやAPIから始めやすい
モデル性能手元の計算資源に依存大規模な高性能モデルを利用しやすい
データ管理保存場所と通信を自分で設計契約、設定、保持方針の確認が必要
再現性モデルファイルを固定しやすい提供側の更新を受ける場合がある
初期費用PC・GPU・サーバー費用小さく始めやすい
継続費用電力、保守、運用工数月額またはAPI従量課金
拡張性自分で構築・管理する提供サービスの機能を利用
複数人利用認証、負荷分散、監視が必要提供側の管理機能を利用しやすい

どちらか一方に統一する必要はありません。機密度、必要性能、利用頻度に応じて、ローカルとクラウドを使い分ける方法もあります。

ローカルLLMでできること

  • 技術報告書や議事録の要約
  • 実験条件、物性値、試料情報の抽出
  • 社内文書を対象にしたRAG
  • 文書分類、タグ付け、表形式への変換
  • Python・R・SQLコードの下書き
  • 研究計画や確認項目の整理
  • オフライン環境でのチャット
  • MCPやAIエージェントを使ったツール連携

数値計算や統計処理は、言語モデルの文章生成だけで確定せず、PythonやRなどの決定論的なツールで実行します。研究者向けの全体的な使い分けは、研究者の生成AI活用ガイドで解説しています。

必要スペックを決める4つの要素

1.モデルのパラメータ数

3B、8B、32BなどのBは、概ね10億単位のパラメータ数を表します。一般に大きいモデルほど多くのメモリを必要とします。ただし、MoEモデルでは総パラメータ数と、1回の推論で使用するアクティブパラメータ数が異なる場合があります。

2.量子化

モデルの重みをFP16から8bitや4bitへ変換すると、必要メモリを減らせます。単純な重み容量の概算は次の式です。

重み容量 ≒ パラメータ数 × 量子化ビット数 ÷ 8

例えば8Bモデルを4bitで保存する場合、重みだけなら概算4GBです。ただし、実行にはKVキャッシュ、内部バッファ、推論エンジン、OSなどのメモリも必要です。ファイルが4GBだから4GBのメモリで必ず動くわけではありません。

3.コンテキスト長

長い論文や大量の検索結果を一度に入力すると、KVキャッシュなどのメモリ使用量が増えます。モデルが128Kや256Kへ対応していても、手元のPCで最大長を使う必要はありません。まずは4K~16K程度から、用途とメモリ使用量を確認します。

4.同時利用者数と速度

個人が一問ずつ使う場合と、複数人が同時に利用する場合では必要性能が大きく異なります。組織利用では、モデルを読み込めるかだけでなく、同時要求数、応答時間、タイムアウト、利用上限も評価します。

モデル規模別のメモリ目安

以下は4bit量子化モデルを一人で利用する場合の概算です。モデル構造、推論エンジン、コンテキスト長によって変わるため、余裕を持たせます。

モデル規模4bit重みの概算快適に試すメモリの目安主な用途
1B~4B約0.5~2GB8GB前後以上動作確認、分類、短い要約
7B~9B約3.5~4.5GB12~16GB以上文書整理、軽量RAG
14B約7GB16~24GB以上より複雑な抽出・要約
20B~32B約10~16GB24~32GB以上推論、コード、専門タスク
70B前後約35GB48~64GB以上高品質な生成、サーバー運用

CPUだけでも実行できますが、生成速度は遅くなりやすいため、まず小型モデルで操作と評価方法を確立するのがおすすめです。GPUではVRAM、Apple SiliconではCPUとGPUが共有するユニファイドメモリが重要になります。

LM Studioの公式要件では、Apple Silicon Macは16GB以上のメモリが推奨され、8GBでは小型モデルと控えめなコンテキストが案内されています[1]。

量子化とは

量子化は、モデルの重みを表す数値精度を下げ、容量と計算負荷を小さくする方法です。llama.cppでは1.5bitから8bitまで複数の量子化方式が提供されており、低ビット化によって推論の高速化とメモリ削減が期待できます[2]。

形式の例特徴向いている場面
FP16・BF16精度を保ちやすいが容量が大きい十分なGPU、基準評価
Q8比較的品質を保ちながら軽量化メモリに余裕があるローカル実行
Q5容量と品質のバランス日常的な利用
Q4大きく軽量化できる一般的なPC、モデル比較
Q2・Q3さらに小さいが品質低下を確認する必要メモリ制約が厳しい場合

最小ファイルを選ぶのではなく、実際の質問セットで元モデルまたは高精度版との差を評価します。量子化方式も再現条件として保存します。

ローカルLLMの実行環境を選ぶ

実行環境特徴向いている利用者
Ollamaモデル取得、CLI、ローカルAPIをまとめて利用簡単に始めてPythonやRAGへ接続したい
LM StudioGUIでモデル検索・チャット・API提供が可能画面操作を中心に試したい
llama.cpp軽量で多くのCPU・GPUへ対応し、細かく設定可能性能や量子化を調整したい
vLLM高スループットな推論サーバー向けGPUサーバーで複数人へ提供したい
Open WebUIブラウザから利用できる画面を構築社内向けチャット画面を用意したい

llama.cppはApple Silicon、CUDA、AMD HIP、Vulkan、CPUとGPUのハイブリッド実行などに対応しています[3]。vLLMはNVIDIA、AMD、Intel、CPUなど複数の環境を対象とした推論・配信基盤です[4]。

個人で試すならOllamaまたはLM Studio、複数人に安定して提供するなら認証・監視を追加したサーバー構成を検討します。

2026年10月時点のモデル選定例

モデルの更新は速いため、特定のランキングではなく用途から選びます。2026年10月2日時点では、次のような選択肢があります。

モデル群特徴確認ポイント
Qwen 3.5系小型から大型まであり、推論・ツール・マルチモーダルの選択肢モデルサイズ、対応ランタイム、ライセンス
Gemma 4系小型モデルは端末上での利用を想定Gemma利用規約、モデルごとの入力形式
gpt-oss-20bローカル・専門用途向けのMoEモデルHarmony形式、MXFP4対応、約16GBメモリの公式目安
用途特化モデルコード、埋め込み、画像などに特化対象業務で汎用モデルと比較

OpenAIの公式モデルカードでは、gpt-oss-20bは21Bパラメータ、アクティブ3.6Bで、MXFP4条件では16GBのメモリに収まると説明されています[5]。ただし、対応ハードウェアや実装により挙動が異なるため、実機で確認します。

最初の検証では、4B~9B程度のモデルを使い、操作、ログ、評価、RAGの流れを確認してから大きなモデルへ移ると、原因を切り分けやすくなります。

Ollamaを使った導入手順

1.公式サイトからインストールする

Windows、macOS、Linuxに対応した公式の案内からインストールします。Windows版はWindows 10 22H2以降に対応し、ローカルAPIは通常、http://localhost:11434で提供されます[6]。

組織のPCでは、インストール権限、モデル保存先、利用可能なライセンス、外部ダウンロードのルールを先に確認します。

2.小型モデルを取得する

以下は例です。利用時にはOllamaのモデルライブラリでタグと容量を確認してください。

ollama pull qwen3.5:4b
ollama list

3.対話を開始する

ollama run qwen3.5:4b

最初は公開情報を使い、次を確認します。

  • 日本語の読みやすさ
  • 指示した形式への追従
  • 応答時間
  • CPU・GPU・メモリ使用量
  • 同じ質問を繰り返したときの変動

4.ローカルAPIを確認する

curl http://localhost:11434/api/chat -d '{
  "model": "qwen3.5:4b",
  "messages": [
    {
      "role": "user",
      "content": "研究報告書から条件を抽出するときの確認項目を5つ示してください。"
    }
  ],
  "stream": false
}'

OllamaのローカルAPIは、標準設定では認証を必要としません[7]。そのため、APIを社内ネットワークやインターネットへそのまま公開せず、必要な場合は認証、TLS、ファイアウォール、接続元制限、監査ログを追加します。

5.Pythonから呼び出す

import json
import urllib.request

payload = {
    "model": "qwen3.5:4b",
    "messages": [
        {
            "role": "system",
            "content": (
                "資料に書かれた内容だけを使って回答してください。"
                "数値には単位を付け、確認できない項目は推測しないでください。"
            ),
        },
        {
            "role": "user",
            "content": "圧縮強度の比較に必要な項目を表形式で示してください。",
        },
    ],
    "stream": False,
    "options": {
        "temperature": 0,
        "seed": 42,
    },
}

request = urllib.request.Request(
    "http://localhost:11434/api/chat",
    data=json.dumps(payload).encode("utf-8"),
    headers={"Content-Type": "application/json"},
)

with urllib.request.urlopen(request) as response:
    result = json.load(response)

print(result["message"]["content"])

モデル名、モデルのdigest、プロンプト、オプション、実行日、回答全文を保存すると、比較と再現試験に使えます。

ローカルLLMとRAGを組み合わせる

ローカルLLMは、学習時に持っていない社内文書の内容を自動的に知っているわけではありません。研究報告書や技術資料を参照させるには、必要な文書を検索してプロンプトへ渡すRAGを組み合わせます。

  1. 文書を収集し、版とアクセス権を付ける
  2. 意味のまとまりでチャンクへ分割する
  3. 埋め込みモデルでベクトル化する
  4. 質問に関連する文書を検索する
  5. 検索結果と質問をローカルLLMへ渡す
  6. 根拠箇所と出典を含めて回答する
  7. 資料に答えがない場合は棄権する

生成モデルと埋め込みモデルは別です。日本語や専門用語で検索精度が足りない場合は、生成モデルを大きくする前に、埋め込み、メタデータ、チャンク、top-kを評価します。

詳しい設計は、研究開発データにRAGを導入する際の設計と、RAGの活用方法と限界で解説しています。

材料科学のローカル実測例

実在企業の材料や機密情報を使わず、架空の月面レゴリス模擬土に関する疑似報告書3件を用いて、ローカルRAGを実行しました。

実行条件

項目設定
実行日2026年9月30日(日本時間)
実行基盤Ollama 0.34.4、CPU
生成モデルqwen3:1.7b、Q4_K_M
埋め込みモデルqwen3-embedding:0.6b、Q8_0
temperature・seed0・42
コンテキスト4096 tokens
RAG1報告書1チャンク、top-k 1
反復回答可能・回答不能質問を各5回

結果

評価項目実測結果
正解文書のtop-1取得5/5、100%
初期強度の抽出5/5、100%
処理後強度の抽出5/5、100%
出典の抽出5/5、100%
焼結条件の回答0/5、0%
保持率の正答0/5、0%
5項目の項目単位正答率15/25、60%
全項目正答率0/5、0%
回答不能質問への適切な棄権5/5、100%

モデルは初期強度48.3 MPaと処理後強度34.1 MPaを正しく抽出しましたが、焼結条件を回答から落とし、保持率を70.5%としました。Pythonで再計算すると、小数第1位では70.6%です。

round(34.1 / 48.3 * 100, 1)
# 70.6

この結果は、ローカルで実行できたことと、最終回答が正しいことは別であると示しています。一方、検索と主要数値の抽出は成功しているため、優先対策はモデル交換ではなく、必須項目の構造化出力と計算ツールの追加です。

評価の考え方は、研究開発で使えるLLM Evalsの設計と指標および生成AIのハルシネーションの検証方法で詳しく解説しています。

ローカルLLMを評価する指標

分類指標
品質項目正答率、完全正答率、根拠支持率、要求網羅率
棄権適切な棄権率、誤棄権率
安定性反復一致率、モデル更新前後の回帰
性能最初のトークンまでの時間、tokens/s、総応答時間
資源RAM、VRAM、CPU・GPU使用率、消費電力
運用修正時間、利用者採用率、障害率、同時処理数

公開ベンチマークの順位だけでなく、自分の文書、質問、言語、出力形式で比較します。

ローカルだから安全とは限らない

ローカルLLMの安全性は、モデルをどこで動かすかだけでなく、通信、ログ、権限、ソフトウェア供給元を含むシステム全体で決まります。

確認すべき設定

  • モデルと実行ソフトウェアを公式配布元から取得したか
  • モデルカード、ライセンス、ハッシュ値を保存したか
  • 推論時に外部通信が発生しない構成か
  • クラウドモデルとローカルモデルを明確に区別しているか
  • APIがlocalhost以外へ公開されていないか
  • 外部公開時に認証、TLS、接続元制限があるか
  • プロンプト、回答、アップロード文書の保存先はどこか
  • 利用者ごとに文書アクセス権を適用しているか
  • バックアップと削除の手順があるか
  • プラグイン、MCP、外部ツールの権限が限定されているか

特にRAGでは、利用者が閲覧できない文書を検索候補から除外する必要があります。回答後に機密部分を削除する方法ではなく、検索前にアクセス制御を適用します。

個人検証から組織導入へ進める手順

  1. 公開情報で起動確認:小型モデルで操作と性能を確認する
  2. 疑似データで評価:正解、誤答、回答不能問題を用意する
  3. 低機密用途へ限定:文書要約や分類など、書き込みを伴わない処理から始める
  4. 評価基準を設定:正答率、棄権率、重大な失敗を定義する
  5. 権限とログを設計:誰が何を利用・閲覧できるかを決める
  6. 人の承認を残す:研究判断、外部送信、データ変更を自動化しすぎない
  7. 限定利用で検証:少人数で失敗例と利用価値を集める
  8. モデル更新を管理:更新前後に同じ評価セットを実行する
  9. 段階的に拡大:性能、費用、セキュリティを確認して対象を広げる

私は10年以上の素材開発経験と、8年以上のインフォマティクス活用経験を持っています。その観点からも、ローカルLLMの導入はモデル選定だけで決まりません。対象業務、データ品質、評価方法、人の確認、運用責任を同時に設計することが、研究現場で継続して使える条件になります。

よくある質問

GPUなしでもローカルLLMは使えますか?

小型・量子化モデルはCPUでも実行できます。ただし生成速度は遅くなりやすいため、最初は1B~4B程度で操作と評価を確認します。

メモリは何GB必要ですか?

モデル規模、量子化、コンテキスト長によります。4bitの7B~9Bモデルなら12~16GB以上が一つの目安ですが、長い入力や他のアプリケーションを同時に使う場合は余裕が必要です。

VRAMとRAMのどちらが重要ですか?

GPUへモデルを載せる場合はVRAMが生成速度に大きく影響します。VRAMに収まらない場合、RAMやCPUへ一部を逃がせる実装もありますが、速度が低下することがあります。

ローカルLLMなら機密情報を入力しても安全ですか?

データを管理環境内で処理しやすい利点はありますが、外部通信、ログ、API公開、文書権限、プラグインを確認する必要があります。組織の情報管理ルールに従います。

最も大きいモデルを選べばよいですか?

必ずしもそうではありません。大きいモデルはメモリと処理時間を多く使います。対象業務での正確性、応答時間、費用、運用性を比較して選びます。

RAGとファインチューニングのどちらが必要ですか?

社内文書や更新される知識を参照させるなら、まずRAGが適しています。出力形式や特定の判断パターンを学習させたい場合は、ファインチューニングを検討します。

複数人で利用できますか?

可能ですが、個人PC向け構成をそのまま共有するのではなく、認証、文書権限、同時処理、監視、バックアップを備えたサーバー構成にします。

ローカルLLMはクラウドより安いですか?

利用量によります。ハードウェア、電力、保守、担当者工数まで含めて比較します。少量利用ではクラウド、大量・継続利用や特定の機密用途ではローカルが適する場合があります。

まとめ

ローカルLLMは、研究データの保存場所、モデルの版、実行条件を管理しやすく、RAGや計算ツールを組み合わせた研究支援環境を構築できます。

導入時は、次の順番が重要です。

  1. 小型モデルと公開・疑似データで試す
  2. モデル規模、量子化、コンテキストから必要メモリを見積もる
  3. 自分の用途に合わせた評価セットを作る
  4. RAG、計算ツール、構造化出力を組み合わせる
  5. 通信、API、ログ、文書権限を確認する
  6. 限定利用から段階的に広げる

ローカルで動くことは出発点です。正確性、安全性、再現性、利用価値を測定しながら改善することで、研究開発で実用的な生成AI環境になります。

参考文献・公式資料

  1. LM Studio. System Requirements. 2026年10月2日確認.
  2. ggml-org. llama.cpp Quantization Documentation.
  3. ggml-org. llama.cpp: LLM inference in C/C++.
  4. vLLM Project. vLLM Installation and Hardware Support.
  5. OpenAI. gpt-oss-20b Model Card.
  6. Ollama. Ollama for Windows.
  7. Ollama. API Authentication.
  8. Qwen Team. Qwen3.5-9B Model Card.
  9. Google. Gemma Model Overview.

モデル、対応OS、必要メモリ、ライセンス、実行ソフトウェアの仕様は更新されます。本記事の製品・モデル情報は2026年10月2日時点で確認しています。導入時には各公式資料の最新版をご確認ください。実測例は架空の疑似文書3件と小型モデルを用いた説明用試験で、特定モデル一般の性能を示すものではありません。

ABOUT ME
モス
材料開発・データ解析の実務経験と、ベンチプレス180kg到達までの実践をもとに、筋トレ・データサイエンス・英語の情報を発信しています。