はじめに
前回の記事で、Apple SiliconがAIに強い理由が分かりました。さあ、理論を現実に変えましょう。Ollama をインストールして、インターネットや API キーを必要とせずに、コンピューターに直接 LLM とチャットしましょう。
このレッスンの目標: 5 分後には、完全にコンピューター上で実行されている AI モデルとチャットできるようになります。
##1.オラマとは何ですか?
Ollama は、現在ローカルで LLM を実行する最も簡単なツールです。これを「LLM 用の Docker」と考えてください。
- Docker イメージをプルするのと同様に、レジストリから モデルをプル
- 1 つのコマンドでモデルを実行
- OpenAI エンドポイントと互換性のある API を公開
- 複数のモデルを同時に管理
Ollama はその下で llama.cpp (C++ で書かれた推論エンジン) を使用しますが、それを非常にシンプルなエクスペリエンスにまとめています。
2. macOS に Ollama をインストールする
方法 1: Web サイトからダウンロードする (推奨)
# Truy cập https://ollama.com/download và tải bản macOS
# Hoặc dùng curl:
curl -fsSL https://ollama.com/install.sh | sh
方法 2: Homebrew を使用する
brew install ollama
インストールの確認
ollama --version
出力:
ollama version is 0.6.x
Ollama サーバーを起動します
からインストールされた場合 .dmg, Ollama アプリを開くと、自動的にサーバーが実行されます。 CLI からインストールする場合:
# Chạy server (giữ terminal này mở)
ollama serve
サーバーは上で実行されます http://localhost:11434。
確認してください:
curl http://localhost:11434
# Output: Ollama is running
3. 最初のモデルを実行します
Llama 3.2 をプルして実行する
# Pull model (chỉ cần lần đầu, ~2GB cho 3B, ~4.5GB cho 8B)
ollama pull llama3.2
# Chạy và chat
ollama run llama3.2
次のプロンプトが表示されます。
>>> Send a message (/? for help)
尋ねてみてください:
>>> Giải thích Docker trong 3 câu
AI はすぐに応答し、完全にコンピューター上で実行されます。プレス Ctrl+D 逃げるために。
別のモデルをプルする
# Gemma 3 - model của Google, mạnh với tiếng Việt
ollama pull gemma3:4b
# Qwen 2.5 - model của Alibaba, đa ngôn ngữ xuất sắc
ollama pull qwen2.5:7b
# Mistral - model của Pháp, code tốt
ollama pull mistral
# Phi-4 - model nhỏ của Microsoft, hiệu quả
ollama pull phi4-mini
4. 重要な Ollama CLI コマンド
ロードされたモデルのリストを表示する
ollama list
出力例:
NAME ID SIZE MODIFIED
llama3.2:latest a80c4f17acd5 2.0 GB 2 minutes ago
gemma3:4b 2d2a94b1e3fc 3.3 GB 5 minutes ago
qwen2.5:7b 845dbda0ea48 4.7 GB 8 minutes ago
詳細なモデル情報を表示する
ollama show llama3.2
出力には以下が表示されます。
- アーキテクチャ (LlamaForCausalLM)
- パラメータ (3.2B)
- 量子化 (Q4_K_M)
- コンテキスト長 (128K)
- システムプロンプトのデフォルト
ランニングモデルを見る
ollama ps
出力:
NAME ID SIZE PROCESSOR UNTIL
llama3.2:latest a80c4f17acd5 3.2 GB 100% GPU 4 minutes from now
💡 100% GPU は、モデル全体が GPU メモリ上にあることを意味します (Mac では Metal)。これが理想的なケースです。
モデルの削除
# Xóa một model để giải phóng ổ cứng
ollama rm mistral
モデルのコピー (別の名前でコピーを作成)
ollama cp llama3.2 my-assistant
5. Ollama フォルダー構造
Ollama は次の場所ですべてをホストしています。
~/.ollama/
├── models/
│ ├── blobs/ # Model weights (file lớn)
│ └── manifests/ # Metadata cho mỗi model
└── logs/ # Logs
容量の確認:
du -sh ~/.ollama/models
⚠️ 注意: 重いモデルです。 3 ~ 5 モデルは 20 ~ 30 GB を占有する可能性があります。 SSD が小さい場合は、必要なモデルを選択してください。
モデルフォルダーを外部ドライブに移動します。
メインドライブが小さい場合:
# Dừng Ollama
# Di chuyển thư mục
mv ~/.ollama/models /Volumes/ExternalSSD/ollama-models
# Tạo symlink
ln -s /Volumes/ExternalSSD/ollama-models ~/.ollama/models
# Khởi động lại Ollama
6. Ollama との高度なチャット
システムプロンプトインライン
ollama run llama3.2 "Bạn là một chuyên gia Python. Trả lời bằng tiếng Việt." \
--system "You are a senior Python developer who explains things simply in Vietnamese."
複数行入力
チャットモードでは、使用します """ 複数行を入力するには:
>>> """
... Phân tích đoạn code sau:
... def fibonacci(n):
... if n <= 1: return n
... return fibonacci(n-1) + fibonacci(n-2)
... """
温度とコンテキストを設定する
# Temperature thấp = ít sáng tạo, chính xác hơn
ollama run llama3.2 --temperature 0.1
# Context window lớn hơn (tốn RAM hơn)
ollama run llama3.2 --num-ctx 8192
チャットでのスラッシュ コマンド
| コマンド | 説明 |
|---|---|
/set system <prompt> | システムプロンプトを設定する |
/show info | モデル情報を見る |
/show modelfile | モデルファイル |
/clear | チャット履歴を削除する |
/bye または Ctrl+D | 終了 |
/? | ヘルプを参照 |
7. 便利な環境変数
# Thay đổi host/port
export OLLAMA_HOST=0.0.0.0:11434
# Thay đổi thư mục lưu model
export OLLAMA_MODELS=/path/to/models
# Giới hạn số model load đồng thời
export OLLAMA_MAX_LOADED_MODELS=2
# Bật debug logging
export OLLAMA_DEBUG=1
追加されました ~/.zshrc 永久に保存するには:
echo 'export OLLAMA_MAX_LOADED_MODELS=2' >> ~/.zshrc
source ~/.zshrc
8. トラブルシューティングは一般的です
「エラー: モデルには使用可能なメモリを超えるメモリが必要です」
モデルが RAM に対して大きすぎます。解決策:
- より小さいモデルを使用します。
llama3.2:3b代わりにllama3.2:8b - 他のアプリを閉じてRAMを解放します
異常に速度が遅い
# Kiểm tra GPU utilization
ollama ps
# Nếu thấy "100% CPU" thay vì "100% GPU" → model quá lớn, không fit GPU memory
Ollama サーバーが起動しませんでした
# Kiểm tra port xem có bị chiếm không
lsof -i :11434
# Kill process cũ nếu cần
pkill ollama
ollama serve
概要
| コマンド | 説明 |
|---|---|
ollama pull <model> | モデルをダウンロード |
ollama run <model> | 走ってチャット |
ollama list | ダウンロードしたモデルを表示 |
ollama ps | 実行中のモデルを表示 |
ollama show <model> | 機種情報 |
ollama rm <model> | モデルを削除 |
ollama serve | サーバーを起動する |
演習
- Ollama をインストールし、2 つのモデルをドラッグします。
llama3.2そしてgemma3:4b - 同じ質問をする各モデルとチャットし、回答の質を比較します。
- 使用する
ollama show両方のモデルの情報を参照してください: 量子化、パラメータ数、コンテキスト長 - チェック
ollama psチャット中 - モデルはどれくらいの RAM を使用しますか? GPUかCPUか? - 使用する
du -sh ~/.ollama/modelsモデルが占めるスペースを確認する
次の記事: ユースケースに合わせて選択するモデルはどれですか? →