目次
- Ollamaとは何か
- Ollamaの主な特徴
- Ollamaのインストール方法
- Windows へのインストール
- macOS へのインストール
- Linux へのインストール
- 基本的な使い方:モデルのダウンロードと実行
- モデルの実行(runコマンド)
- おすすめのモデル選び
- モデル管理コマンド
- Ollama APIの活用方法
- 基本的なAPI呼び出し
- OpenAI互換APIの利用
- Modelfileによるカスタマイズ
- Modelfileの作成例
- Open WebUIとの連携
- Dockerを使った簡単セットアップ
- トラブルシューティング
- モデルのダウンロードが途中で止まる
- GPUが認識されない
- メモリ不足エラー
- 推論速度が遅い
- まとめ:Ollamaでローカルai活用を始めよう
Ollamaは、ローカルLLMを最も手軽に始められるオープンソースツールです。ワンコマンドでモデルのダウンロードから実行までを完結でき、専門的な知識がなくても数分でAIとの対話を開始できます。
本記事では、Ollamaのインストールから基本的な使い方、業務活用に役立つ設定方法まで、初心者向けにステップバイステップで解説します。Windows・Mac・Linuxすべてのプラットフォームに対応した内容となっています。
Ollamaとは何か
Ollamaは、ローカル環境でLLM(大規模言語モデル)を簡単に実行するためのツールです。2023年にリリースされて以降、急速にユーザー数を伸ばし、2026年現在ではローカルLLM環境のデファクトスタンダードとも言える存在になっています。
Ollamaの主な特徴
- ワンコマンドでモデル実行:
ollama run モデル名だけでダウンロードと実行が完了 - 豊富なモデルライブラリ:Llama、Qwen、Gemma、Phi、Mistralなど主要モデルに対応
- OpenAI互換API:既存のOpenAI APIを利用したアプリケーションとの互換性あり
- クロスプラットフォーム:Windows、macOS、Linuxに対応
- GPU自動認識:NVIDIAやAMDのGPUを自動検出し、最適な設定で推論を実行
- 軽量な動作:バックグラウンドサービスとして動作し、システムリソースの消費が少ない
LM StudioがGUIベースのツールであるのに対し、Ollamaはコマンドラインベースのツールです。CLIに慣れている方や、スクリプトからの自動化を重視する方には特におすすめです。
Ollamaのインストール方法
Ollamaのインストールは非常にシンプルです。各OSごとの手順を解説します。
Windows へのインストール
Windowsでは、公式サイトからインストーラをダウンロードして実行するだけです。
- Ollama公式サイトにアクセス
- 「Download for Windows」をクリック
- ダウンロードされたインストーラ(OllamaSetup.exe)を実行
- インストールウィザードに従って進める
- インストール完了後、コマンドプロンプトまたはPowerShellで確認
ollama --version
バージョン番号が表示されればインストール成功です。
macOS へのインストール
macOSでは、公式サイトからのダウンロードまたはHomebrewでインストールできます。
# 公式のインストールスクリプト
curl -fsSL https://ollama.com/install.sh | sh
# またはHomebrewを利用
brew install ollama
Apple SiliconのMacでは、ユニファイドメモリがVRAMとして活用されるため、効率的にローカルLLMを実行できます。
Linux へのインストール
Linuxでは、公式のインストールスクリプトを使用します。
curl -fsSL https://ollama.com/install.sh | sh
NVIDIA GPUを利用する場合は、事前にCUDAドライバがインストールされている必要があります。Ubuntu 22.04以降であれば、以下のコマンドでドライバをインストールできます。
sudo apt install nvidia-driver-550
基本的な使い方:モデルのダウンロードと実行
インストールが完了したら、早速モデルを実行してみましょう。
モデルの実行(runコマンド)
最も基本的な操作は ollama run コマンドです。モデルがローカルに存在しない場合は自動的にダウンロードされます。
# Llama 4 Scout(8B)を実行
ollama run llama4-scout
# Qwen3の8Bモデルを実行
ollama run qwen3:8b
# Gemma 3の4Bモデルを実行
ollama run gemma3:4b
# Phi-3 Miniを実行
ollama run phi3:mini
コマンドを実行すると対話モードに入り、プロンプトに質問を入力するとAIが応答します。対話モードを終了するには /bye と入力します。
おすすめのモデル選び
初めての方は、PCスペックに合わせて以下のモデルから試してみてください。
| PCスペック | おすすめモデル | コマンド |
|---|---|---|
| GPU無し・RAM 8GB | Gemma 3 1B | ollama run gemma3:1b |
| GPU無し・RAM 16GB | Phi-3 Mini 3.8B | ollama run phi3:mini |
| VRAM 8GB以上 | Qwen3 8B | ollama run qwen3:8b |
| VRAM 16GB以上 | Qwen3 14B | ollama run qwen3:14b |
| VRAM 24GB以上 | Llama 4 Scout | ollama run llama4-scout |
日本語での利用を重視する場合は、Qwen3が特に高い精度を発揮します。おすすめモデルの比較も参考にしてください。
モデル管理コマンド
ダウンロード済みのモデルを管理するための基本コマンドを紹介します。
# ダウンロード済みモデルの一覧表示
ollama list
# モデルのダウンロード(実行せずにダウンロードのみ)
ollama pull qwen3:8b
# モデルの削除
ollama rm qwen3:8b
# モデルの詳細情報を表示
ollama show qwen3:8b
Ollama APIの活用方法
Ollamaはデフォルトでポート11434にAPIサーバーを起動しており、HTTP経由でモデルにアクセスできます。これにより、他のアプリケーションやスクリプトからOllamaのモデルを呼び出すことが可能です。
基本的なAPI呼び出し
# チャット形式のAPI呼び出し
curl http://localhost:11434/api/chat -d '{
"model": "qwen3:8b",
"messages": [
{"role": "user", "content": "中小企業のDX推進で最初に取り組むべきことは何ですか?"}
],
"stream": false
}'
OpenAI互換APIの利用
OllamaはOpenAI互換のAPIエンドポイントを提供しており、OpenAIのライブラリやツールをそのまま利用できます。
# OpenAI互換エンドポイント
curl http://localhost:11434/v1/chat/completions -d '{
"model": "qwen3:8b",
"messages": [
{"role": "user", "content": "議事録を要約してください。"}
]
}'
Pythonからは以下のように利用できます。
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:11434/v1",
api_key="ollama" # 任意の文字列でOK
)
response = client.chat.completions.create(
model="qwen3:8b",
messages=[
{"role": "user", "content": "売上報告書の下書きを作成してください。"}
]
)
print(response.choices[0].message.content)
この互換性を活かして、APIサーバーとして社内の様々なシステムと連携させることができます。
Modelfileによるカスタマイズ
Ollamaでは「Modelfile」を使って、モデルの動作をカスタマイズできます。システムプロンプトの設定やパラメータの調整が可能です。
Modelfileの作成例
例えば、社内ヘルプデスク用のカスタムモデルを作成する場合:
# helpdesk-modelfile という名前でファイルを作成
FROM qwen3:8b
SYSTEM """あなたは社内ITヘルプデスクのアシスタントです。
以下のルールに従って回答してください:
- 丁寧な日本語で回答する
- 手順は番号付きリストで説明する
- 不明な点がある場合は「IT部門にお問い合わせください」と案内する
- 社外秘の情報に言及しない"""
PARAMETER temperature 0.3
PARAMETER num_ctx 4096
このModelfileからカスタムモデルを作成します。
# カスタムモデルの作成
ollama create helpdesk -f helpdesk-modelfile
# カスタムモデルの実行
ollama run helpdesk
業務用途に特化したプロンプトを組み込んだモデルを作成しておくことで、エンドユーザーは特別な知識なしに適切なAI回答を得られるようになります。
Open WebUIとの連携
コマンドラインでの操作に慣れていない社員にもローカルLLMを使ってもらうには、Open WebUIとの連携がおすすめです。Open WebUIは、ChatGPTライクなWebインターフェースを提供するオープンソースプロジェクトで、Ollamaとシームレスに統合できます。
Dockerを使った簡単セットアップ
# Open WebUIの起動(OllamaがlocalhostでPCに直接動いている場合)
docker run -d -p 3000:8080 \
--add-host=host.docker.internal:host-gateway \
-e OLLAMA_BASE_URL=http://host.docker.internal:11434 \
--name open-webui \
ghcr.io/open-webui/open-webui:main
起動後、ブラウザで http://localhost:3000 にアクセスすると、チャット形式のUIが表示されます。Ollamaでダウンロード済みのモデルが自動的に選択可能になります。
この構成により、ITリテラシーに関係なく社内の誰もがローカルLLMを利用できる環境が整います。チャットボット・FAQ対応のシステムとしても活用できます。
トラブルシューティング
Ollamaの利用中に発生しやすい問題と対処法をまとめます。
モデルのダウンロードが途中で止まる
ネットワーク環境が不安定な場合に発生します。再度 ollama pull モデル名 を実行すれば、中断した位置からダウンロードが再開されます。社内プロキシ環境下では、環境変数 HTTPS_PROXY の設定が必要な場合があります。
GPUが認識されない
NVIDIA GPUの場合、以下を確認してください。
nvidia-smiコマンドでGPUが認識されているか- CUDAドライバのバージョンが要件を満たしているか(CUDA 11.7以上推奨)
- Ollamaを再起動してGPUの再検出を試みる:
sudo systemctl restart ollama(Linux)
メモリ不足エラー
「out of memory」エラーが出る場合は、より小さなモデルに切り替えるか、量子化レベルの低いバージョンを使用してください。例えば qwen3:8b-q4 のように、量子化レベルを明示的に指定できる場合があります。
推論速度が遅い
GPU推論が有効になっているか確認してください。ollama run 実行時に表示される情報で、GPUが利用されているかを確認できます。パフォーマンス最適化ガイドも参考にしてください。
まとめ:Ollamaでローカルai活用を始めよう
Ollamaは、ローカルLLMの導入障壁を大幅に下げるツールです。本記事の内容を振り返ります。
- インストールは数分で完了:全主要OSに対応し、専門知識不要
- ワンコマンドでモデル実行:
ollama run モデル名だけで即座にAIとの対話が開始 - 豊富なモデルライブラリ:Llama 4、Qwen3、Gemma 3など主要モデルをサポート
- OpenAI互換API:既存のシステムやツールとの連携が容易
- Modelfileでカスタマイズ:業務用途に特化したモデル設定が可能
- Open WebUIとの連携:ChatGPTライクなUIを社内に展開可能
まずは自分のPCスペックを確認し、対応するモデルを一つ動かしてみることから始めましょう。ローカルLLMのメリット・デメリットを理解した上で、段階的に業務活用を広げていくことが成功の鍵です。
先行モニター企業 募集中|先着5社・2026年11月末まで 生成AIの利用費、「誰が・何のために・いくら」まで見えていますか?
株式会社カイダンと共同開発したAI利用ガバナンスSaaS「ManageAI」は、OpenAI・Azure OpenAI・Claude・AWS Bedrock・Google Vertex AIの費用と利用状況を、部署・利用者・プロジェクト別に可視化します。導入は読み取り専用キーの登録だけ。初期費用0円・月額5万円(税別)で先行モニター企業を募集しています。
ニュースリリースを読む関連記事
Related / 9 articles
Notes & Insights
- AI・機械学習
Stable Diffusionの使い方とビジネス利用の注意点|ローカル画像生成入門
自社PCで動かせる画像生成AI「Stable Diffusion」の始め方をビジネス目線で解説。必要なスペック、ツールの選び方、商用利用のライセンス確認ポイント、販促物への活用と注意点をまとめました。
- AI・機械学習
Claude CodeのSkills(エージェントスキル)とは?作り方と活用例を解説
Claude Codeに定型ワークフローを覚えさせる「Agent Skills」を解説。SKILL.mdの書き方、スラッシュコマンドやサブエージェントとの使い分け、チームで再利用できるスキル設計のコツを実例つきでまとめました。
- AI・機械学習
ベクトルデータベース比較|Chroma・Qdrant・FAISS・pgvectorの選び方を解説
RAG構築に欠かせないベクトルデータベースを比較解説。Chroma・Qdrant・FAISS・pgvector・Milvusの特徴と使いどころ、中小企業の社内文書検索にはどれを選ぶべきかを実務目線でまとめました。
- AI・機械学習
Whisperで無料の文字起こし環境を作る|ローカル実行なら会議音声が社外に出ない
OpenAIの音声認識モデルWhisperを自社PCで動かし、無料かつセキュアな文字起こし環境を作る手順を解説。モデルサイズの選び方、精度を上げる録音のコツ、議事録自動化への発展まで実践的にまとめました。
- AI・機械学習
vLLMとは?Ollamaとの違いと使い方|社内LLMサーバーを高速化する本命ツール
複数人で使う社内LLMサーバーの本命「vLLM」を解説。PagedAttentionと連続バッチングの仕組み、Ollamaとの使い分け、導入手順と注意点まで、社内AI基盤を検討する企業向けにまとめました。
- AI・機械学習
AIエンジニアとは?仕事内容・必要スキル・なり方・年収まで完全ガイド
AIエンジニアとは何かを仕事内容・関連職種との違い・必要スキル・資格・なり方・年収まで網羅的に解説。目指す個人にも採用したい企業にも役立つ完全ガイドです。
- AI・機械学習
中小企業のAIエンジニア確保術|採用・育成・外注どれを選ぶべきか比較
AIエンジニアの採用が難しい中小企業向けに、正社員採用・既存社員の育成・外部委託の3つの選択肢を比較。自社に合ったAI人材確保の進め方がわかります。
- AI・機械学習
AIエンジニアの年収と将来性|需要が伸び続ける理由とキャリアの広げ方
AIエンジニアの年収水準と将来性を解説。需要が伸び続ける背景、年収を高めるスキルの掛け合わせ方、今後のキャリアパスの選択肢まで整理しました。
- AI・機械学習
未経験からAIエンジニアになるには?学習ロードマップ6ステップと転職のコツ
未経験からAIエンジニアになるための学習ロードマップを6ステップで解説。独学の進め方、ポートフォリオの作り方、転職活動を有利に進めるコツまで実践的に紹介します。
先行モニター企業 募集中
生成AIのコストを「部署別」に、請求書より先に。
先着5社限定・2026年11月末まで。初期費用0円・月額5万円(税別)で、正式版と同等の機能に加え、開発者と伴走者による導入支援を追加費用なしで提供します。プロンプト原文は一切取得しません。
株式会社カイダン × Harmonic Society株式会社の共同事業|読み取り専用キーの登録だけで導入できます