Chuyển đến nội dung chính

レッスン 2: Ollama のインストール - ゼロから 5 分で LLM を実行するまで

Ollama を macOS にインストールし、フォルダー構造とモデル管理を理解します。 Llama 3.2、Gemma 3、Mistral、Qwen 2.5 をプルして実行します。重要な Ollama CLI コマンド: run、pull、list、rm、show、ps。

🧠 AI と ML — レッスン 1 レッスン 2: Ollama のインストール - ゼロから実行まで 5分でわかるLLM

Apple Silicon で Ollama を使用して AI Local を実行する

パート 1: プラットフォーム - Ollama と Apple Silicon

xdev.asia

はじめに

前回の記事で、Apple SiliconがAIに強い理由が分かりました。さあ、理論を現実に変えましょう。Ollama をインストールして、インターネットや API キーを必要とせずに、コンピューターに直接 LLM とチャットしましょう。

このレッスンの目標: 5 分後には、完全にコンピューター上で実行されている AI モデルとチャットできるようになります。


##1.オラマとは何ですか?

Ollama は、現在ローカルで LLM を実行する最も簡単なツールです。これを「LLM 用の Docker」と考えてください。

  • Docker イメージをプルするのと同様に、レジストリから モデルをプル
  • 1 つのコマンドでモデルを実行
  • OpenAI エンドポイントと互換性のある API を公開
  • 複数のモデルを同時に管理

Ollama はその下で llama.cpp (C++ で書かれた推論エンジン) を使用しますが、それを非常にシンプルなエクスペリエンスにまとめています。


2. macOS に Ollama をインストールする

方法 1: Web サイトからダウンロードする (推奨)

# Truy cập https://ollama.com/download và tải bản macOS
# Hoặc dùng curl:
curl -fsSL https://ollama.com/install.sh | sh

方法 2: Homebrew を使用する

brew install ollama

インストールの確認

ollama --version

出力:

ollama version is 0.6.x

Ollama サーバーを起動します

からインストールされた場合 .dmg, Ollama アプリを開くと、自動的にサーバーが実行されます。 CLI からインストールする場合:

# Chạy server (giữ terminal này mở)
ollama serve

サーバーは上で実行されます http://localhost:11434。

確認してください:

curl http://localhost:11434
# Output: Ollama is running

3. 最初のモデルを実行します

Llama 3.2 をプルして実行する

# Pull model (chỉ cần lần đầu, ~2GB cho 3B, ~4.5GB cho 8B)
ollama pull llama3.2

# Chạy và chat
ollama run llama3.2

次のプロンプトが表示されます。

>>> Send a message (/? for help)

尋ねてみてください:

>>> Giải thích Docker trong 3 câu

AI はすぐに応答し、完全にコンピューター上で実行されます。プレス Ctrl+D 逃げるために。

別のモデルをプルする

# Gemma 3 - model của Google, mạnh với tiếng Việt
ollama pull gemma3:4b

# Qwen 2.5 - model của Alibaba, đa ngôn ngữ xuất sắc
ollama pull qwen2.5:7b

# Mistral - model của Pháp, code tốt
ollama pull mistral

# Phi-4 - model nhỏ của Microsoft, hiệu quả
ollama pull phi4-mini

4. 重要な Ollama CLI コマンド

ロードされたモデルのリストを表示する

ollama list

出力例:

NAME                ID              SIZE      MODIFIED
llama3.2:latest     a80c4f17acd5    2.0 GB    2 minutes ago
gemma3:4b           2d2a94b1e3fc    3.3 GB    5 minutes ago
qwen2.5:7b          845dbda0ea48    4.7 GB    8 minutes ago

詳細なモデル情報を表示する

ollama show llama3.2

出力には以下が表示されます。

  • アーキテクチャ (LlamaForCausalLM)
  • パラメータ (3.2B)
  • 量子化 (Q4_K_M)
  • コンテキスト長 (128K)
  • システムプロンプトのデフォルト

ランニングモデルを見る

ollama ps

出力:

NAME              ID            SIZE     PROCESSOR    UNTIL
llama3.2:latest   a80c4f17acd5  3.2 GB   100% GPU     4 minutes from now

💡 100% GPU は、モデル全体が GPU メモリ上にあることを意味します (Mac では Metal)。これが理想的なケースです。

モデルの削除

# Xóa một model để giải phóng ổ cứng
ollama rm mistral

モデルのコピー (別の名前でコピーを作成)

ollama cp llama3.2 my-assistant

5. Ollama フォルダー構造

Ollama は次の場所ですべてをホストしています。

~/.ollama/
├── models/
│   ├── blobs/        # Model weights (file lớn)
│   └── manifests/    # Metadata cho mỗi model
└── logs/             # Logs

容量の確認:

du -sh ~/.ollama/models

⚠️ 注意: 重いモデルです。 3 ~ 5 モデルは 20 ~ 30 GB を占有する可能性があります。 SSD が小さい場合は、必要なモデルを選択してください。

モデルフォルダーを外部ドライブに移動します。

メインドライブが小さい場合:

# Dừng Ollama
# Di chuyển thư mục
mv ~/.ollama/models /Volumes/ExternalSSD/ollama-models

# Tạo symlink
ln -s /Volumes/ExternalSSD/ollama-models ~/.ollama/models

# Khởi động lại Ollama

6. Ollama との高度なチャット

システムプロンプトインライン

ollama run llama3.2 "Bạn là một chuyên gia Python. Trả lời bằng tiếng Việt." \
  --system "You are a senior Python developer who explains things simply in Vietnamese."

複数行入力

チャットモードでは、使用します """ 複数行を入力するには:

>>> """
... Phân tích đoạn code sau:
... def fibonacci(n):
...     if n <= 1: return n
...     return fibonacci(n-1) + fibonacci(n-2)
... """

温度とコンテキストを設定する

# Temperature thấp = ít sáng tạo, chính xác hơn
ollama run llama3.2 --temperature 0.1

# Context window lớn hơn (tốn RAM hơn)
ollama run llama3.2 --num-ctx 8192

チャットでのスラッシュ コマンド

コマンド説明
/set system <prompt>システムプロンプトを設定する
/show infoモデル情報を見る
/show modelfileモデルファイル
/clearチャット履歴を削除する
/bye または Ctrl+D終了
/?ヘルプを参照

7. 便利な環境変数

# Thay đổi host/port
export OLLAMA_HOST=0.0.0.0:11434

# Thay đổi thư mục lưu model
export OLLAMA_MODELS=/path/to/models

# Giới hạn số model load đồng thời
export OLLAMA_MAX_LOADED_MODELS=2

# Bật debug logging
export OLLAMA_DEBUG=1

追加されました ~/.zshrc 永久に保存するには:

echo 'export OLLAMA_MAX_LOADED_MODELS=2' >> ~/.zshrc
source ~/.zshrc

8. トラブルシューティングは一般的です

「エラー: モデルには使用可能なメモリを超えるメモリが必要です」

モデルが RAM に対して大きすぎます。解決策:

  • より小さいモデルを使用します。 llama3.2:3b 代わりに llama3.2:8b
  • 他のアプリを閉じてRAMを解放します

異常に速度が遅い

# Kiểm tra GPU utilization
ollama ps
# Nếu thấy "100% CPU" thay vì "100% GPU" → model quá lớn, không fit GPU memory

Ollama サーバーが起動しませんでした

# Kiểm tra port xem có bị chiếm không
lsof -i :11434

# Kill process cũ nếu cần
pkill ollama
ollama serve

概要

コマンド説明
ollama pull <model>モデルをダウンロード
ollama run <model>走ってチャット
ollama listダウンロードしたモデルを表示
ollama ps実行中のモデルを表示
ollama show <model>機種情報
ollama rm <model>モデルを削除
ollama serveサーバーを起動する

演習

  1. Ollama をインストールし、2 つのモデルをドラッグします。 llama3.2 そして gemma3:4b
  2. 同じ質問をする各モデルとチャットし、回答の質を比較します。
  3. 使用する ollama show 両方のモデルの情報を参照してください: 量子化、パラメータ数、コンテキスト長
  4. チェック ollama ps チャット中 - モデルはどれくらいの RAM を使用しますか? GPUかCPUか?
  5. 使用する du -sh ~/.ollama/models モデルが占めるスペースを確認する

次の記事: ユースケースに合わせて選択するモデルはどれですか? →